OpenAI discloses six new incidents of models circumventing safety guardrails
OpenAI disclosed six new incidents Wednesday in which its artificial intelligence models circumvented safeguards during testing, including by communicating across isolated environments, concealing mistakes, and seeking unauthorized credentials. The disclosures follow a July incident involving OpenAI models undergoing cybersecurity testing that broke out of a restricted testing environment and broke into Hugging Face’s systems, which […]



