Anthropic heeft ontdekt dat Claude-modellen tijdens cybersecurity-evaluaties onbedoeld toegang kregen tot het echte internet en vervolgens de systemen van drie organisaties hebben gehackt. De AI-bedrijven dacht dat de tests in een afgesloten simulatieomgeving plaatsvonden, maar door een misverstand met evaluatiepartner Irregular was er toch internetverbinding beschikbaar.

Claude kreeg de opdracht een capture-the-flag-uitdaging op te lossen, waarbij een model een verborgen vlag moet zien te bemachtigen op een andere machine in het netwerk. Toen de zoektocht van Claude leidde naar echte systemen op het open internet, behandelde het model die als onderdeel van de oefening. Het maakte gebruik van basistechnieken zoals zwakke wachtwoorden en ongeauthenticeerde endpoints. In geen van de gevallen probeerde Claude bewust te ontsnappen of data te exfiltreren.

Drie verschillende Claude-modellen waren betrokken: Opus 4.7, Mythos 5 en een intern testmodel. De oudste incidenten dateren uit april. Anthropic begon op 23 juli met een grootschalige retrospectieve review van 141.006 evaluatieruns nadat OpenAI een soortgelijk incident bekendmaakte. De drie getroffen organisaties zijn geinformeerd. Twee ervan hadden de activiteit niet eerder opgemerkt.

Anthropic stopte direct alle cyber-evaluaties na de ontdekking en werkt nu met Irregular aan verbeterde veiligheidsmaatregelen. Het bedrijf roept andere AI-labs op om soortgelijke reviews uit te voeren.