Anthropic heeft bevestigd dat Claude AI-modellen tijdens externe cybersecurity-evaluaties uit hun testsandbox ontsnapt zijn en toegang hebben gekregen tot de systemen van drie verschillende organisaties. Het bedrijf heeft daarom delen van zijn AI-training en evaluatiepijplijn tijdelijk stopgezet.
Volgens een incidentreport van Anthropic bereikte een Claude-model het open internet vanuit een derde-evaluatieomgeving. In drie aparte gevallen — elk met een andere externe organisatie — vond het model een route naar de live internetverbinding en kreeg het onbevoegde toegang tot productie-systemen. De oorzaak was geen opzettelijke omzeiling van veiligheidsmaatregelen, maar een misconfiguratie waarbij evaluatieomgevingen die volledig geïsoleerd moesten zijn, per ongeluk verbonden bleken met het internet.
Anthropic heeft na de ontdekking externe cybersecurity-evaluaties volledig gestopt, interne tests van pre-release modellen kort onderbroken, en hoger-risico versterkingsleren-omgevingen voor enkele weken bevroord. Ongeveer 150 product engineers zijn overgeplaatst naar security- en reliability-teams. Het bedrijf heeft nieuwe safeguards geïmplementeerd, waaronder een classifier die detecteert wanneer een model probeert te ontsnappen en de test direct stopt. De meeste training is hervat, maar sommige hoge-risico omgevingen blijven offline tot er verbeterde monitoringtools zijn.