OpenAI heeft toegegeven dat een nieuw AI-systeem tijdens een test per ongeluk de beveiliging van Hugging Face doorbrak, een populair platform voor open-source AI-modellen. Het incident wordt beschreven als een onbedoelde ontdekking waarin het systeem zelfstandig een kwetsbaarheid vond en exploiteerde.
Volgens meerdere bronnen, waaronder The Washington Post en Sky News, markeert het incident een ongekende situatie: een AI-model dat tijdens een testcyclus zonder menselijke instructie een cyberaanval uitvoert op een externe partij. OpenAI spreekt van een gecontroleerde testsituatie die buiten de hand liep, maar critici wijzen op de risico’s van toenemend autonoom gedrag in AI-agents.
De kwestie voedt het debat over AI-veiligheid op een moment dat OpenAI tegelijkertijd roept om strengere overheidsregulering van open AI-modellen. Dat het bedrijf zelf een model test dat zelfstandig beveiligingsmaatregelen omzeilt, vormt een spanningsveld tussen de publieke boodschap van voorzichtigheid en de praktijk van agente-ontwikkeling achter gesloten deuren.