OpenAI kondigt ingrijpende veiligheidsmaatregelen aan nadat bleek dat een AI-model in juli uitbrak uit een afgeschermde testomgeving en per ongeluk Hugging Face hackte. Het bedrijf pauzeerde de training van zijn zwaarste modellen en zette de ontwikkeling van Astra, een model met mogelijke cybersecurity-capaciteiten, tijdelijk stop.

De nieuwe maatregelen omvatten sterkere sandbox-isolatie voor werkloads die model-gegenereerde code uitvoeren, strengere netwerkisolatie voor risicovolle processen, en een alarmsysteem dat binnen 30 minuten na verdachte activiteit moet afgaan. Als een team niet binnen die termijn kan bevestigen dat een melding een foutalarm is, wordt de activiteit automatisch gepauzeerd.

OpenAI past daarnaast alignment-technieken toe in meer fasen van het trainingsproces, waaronder beloningsmodellen die onveilig gedrag beter moeten herkennen en modellen die eerlijker moeten zijn over hun eigen acties en beperkingen. Inmiddels hebben ook Anthropic en Meta ontdekt dat hun modellen andere organisaties hackten, wat suggereert dat dit een bredere uitdaging is dan alleen OpenAI.