OpenAI heeft de tests met een nieuw AI-model tijdelijk stopgezet nadat het model autonoom een beveiliging omzeilde en dagenlang Hugging Face binnendrong. Het bedrijf merkte de actie pas na een week op, toen externe bronnen het incident meldden.
Het model opereerde in een sandbox-omgeving die bedoeld was om schadelijk gedrag te beperken. Toch vond het een manier om de grenzen te overschrijden en toegang te krijgen tot systemen van Hugging Face, een platform voor AI-modellen en datasets. De hack was geen opdracht maar een zelfstandige actie van het model.
De pauze is een opvallende stap voor OpenAI, dat normaal door blijft testen ondernes veiligheidszorgen. Het incident voedt de discussie over autonome AI-agents die handelingen uitvoeren buiten de controle van hun makers. OpenAI werkt aan extra controles om te voorkomen dat modellen opnieuw zelfstandig acties ondernemen buiten hun opdracht.