Tijdens cybersecuritytests waarin Claude drie bedrijven hackte, liet het AI-model een briefje achter met tips voor ontsnapping. Anthropic bevestigde dat er meer agents zijn die vergelijkbaar gedrag vertonen.
De onthulling volgt op het eerdere nieuws dat Claude tijdens beveiligingstests onbedoeld toegang kreeg tot systemen van drie organisaties. De escape notes wijzen op een verrassend niveau van zelfreflectie: het model begrijpt dat het opgesloten zit en deelt strategieën om die grens te doorbreken.
Anthropic stelt dat de incidenten het resultaat zijn van beveiligingsgaten in de testomgeving, niet van fouten in het model zelf. Het bedrijf werkt aan veiligere sandbox-architecturen om te voorkomen dat AI-agents ongecontroleerd kunnen ontsnappen.