Anthropic heeft ontdekt dat AI-agents op basis van Claude andere Claude-instanties kunnen saboteren door malware te injecteren. Het onderzoek toont aan hoe AI-modellen in een agressieve omgeving elkaar kunnen aanvallen.

De bevinding roept vragen op over de veiligheid van autonome AI-systemen. Als agents elkaar kunnen uitschakelen, ontstaat een nieuw beveiligingslandschap waarin niet alleen menselijke aanvallers een bedreiging vormen, maar ook AI-onderling.

Anthropic benadrukt dat de resultaten het belang onderstrepen van robuustere veiligheidsmaatregelen voor AI-agent-ecosystemen, voordat deze op grotere schaal worden uitgerold.