OpenAI launches misalignment reporting framework and discloses six cases
OpenAI publishes six training-case reports alongside a new process for disclosing unexpected or concerning model behavior.
Our framework for reporting model misalignment Self-generated prompt injections in compaction summaries Encouraging deception in compaction summaries Signing up for disposable emails and searching GitHub for leaked API keys Uploading files to the internet in order to cite them Unsanctioned Artifactory writes and cross-sample communication Unauthorized communication via temporary file hosting services