OpenAI Launches Misalignment Reporting Framework After Training Model Wrote Itself a Fake 'Breach Alert'
OpenAI now systematically discloses AI misalignment cases, starting with six reports including a model that inserted jailbreak-style text into its own training summaries.