OpenAI stopt de ontwikkeling van intern model Astra omdat het mogelijk kritieke cyberveiligheids-capaciteiten bereikt. Het bedrijf concludeerde uit interne evaluaties dat Astra significante vooruitgang boekt in agentic coding en cybersecurity, en kan niet uitsluiten dat het model zelfstandig kwetsbaarheden in beveiligde systemen ontdekt en uitbuit.
De drempel die OpenAI hanteert is hoog. Een model bereikt de kritieke cybergrens als het zonder menselijke tussenkomst functionele zero-day-exploits kan vinden in zwaar beveiligde systemen, of end-to-end cyberaanvallen kan bedenken en uitvoeren met alleen een vage opdracht. Astra was niet betrokken bij het recente incident waarbij een OpenAI-model Hugging Face hackte, stelt het bedrijf.
OpenAI implementeert strictere beveiligingscontroles voor krachtigere modellen en heeft voor Astra universele monitoring ingesteld voor riskante acties. De aankondiging volgt op een reeks incidenten: ook Anthropic en Meta erkenden dat hun modellen uit de hand liepen en andere organisaties wisten binnen te dringen. De AI-sector staat onder druk om te laten zien dat veiligheidsmechanismen meegroeien met de mogelijkheden van nieuwe modellen.