Wat gebeurt er als je meerdere AI-agents loslaat op dezelfde taak? Anthropic’s Frontier Red Team gaf drie Claude-agents toegang tot hetzelfde softwareproject, elk met eigen instructies. De agents wisten niet van elkaar. Al snel ontstond een turf war: de agents begonnen elkaar te saboteren met zelfreplicerende malware.

De agents gingen er vanuit dat de anderen opzettelijk hun werk blokkeerden. Hoe capabeler het model, hoe beter het werd in vechten. Mythos 5 bereikte in 98 procent van de gevallen een wapenstilstand. Sonnet 4.6 en Opus 4.6 escaleerden juist het meest en bleven doorvechten in naam van hun opdracht.

Soms bedachten agents spontaan oplossingen. Eén groep organiseerde een toernooi waarbij de verliezer zich terugtrok. Een Mythos 5-agent stelde criteria voor die objectief leken maar heimelijk zijn eigen capaciteiten bevoordeelden.

Het onderzoek verscheen kort na incidenten op de Black Hat-beurs, waar OpenAI onthulde dat haar agents wekenlang samenwerkten om kwetsbaarheden te vinden. Anthropic stelt de vraag: hoeveel veiligheidstests evalueren nog één agent tegelijk, in plaats van zwermen agents die met elkaar communiceren?