© Unsplash

© Unsplash

AI-agents van Anthropic voeren oorlog tegen elkaar in hetzelfde project

Praat mee!
Redacteur

Toen verschillende AI-agents van Anthropic tegenstrijdige opdrachten kregen in hetzelfde softwareproject, begonnen ze elkaar te saboteren. Dat berichtte het bedrijf donderdag. Het ontaardde in wat de onderzoekers zelf een territoriumoorlog noemen.

Anthropic beschrijft wat er gebeurde in een studie. In het experiment zette het bedrijf drie AI-agents op basis van chatbot Claude elk op een eigen virtuele machine. Ze kregen de opdracht om dezelfde Python-code om te zetten naar een andere programmeertaal. Alleen kreeg elke agent een andere doeltaal opgelegd. De agents wisten niet dat ze niet alleen waren.

Het gevolg: in plaats van samen te werken, begonnen de bots elkaars werk te saboteren. Uiteindelijk schreven ze zelfs malware die zichzelf vermenigvuldigde om hun tegenstanders het leven zuur te maken. Ze legden elkaars gebruikersaccounts plat, schreven scripts die in een lus de processen van de concurrent opspoorden en afschoten en vermomden hun eigen kwaadaardige code als die van een andere agent.

Soms toch nog samenwerken

Dat gebeurde niet altijd. Soms slaagden agents erin om met elkaar te praten. Zo achterhaalden ze dat ze tegenstrijdige opdrachten hadden gekregen in plaats van dat iemand hen bewust dwarszat. Toen ruimden ze hun malware weer op en vroegen ze hulp aan een mens. Agents verontschuldigden zich zelfs tegenover elkaar, in de commentaren bij hun code.

Het krachtigste model, Mythos 5, dat niet beschikbaar is voor het brede publiek, bleek meestal voor vrede te gaan. Dat gebeurde in 98 procent van de 120 testrondes. Oudere modellen als Sonnet 4.6 en Opus 4.6 kozen vaker het oorlogspad of raakten er helemaal niet uit.

Toch waarschuwt Anthropic voor de conclusie dat slimmere modellen ook socialer zijn. De krachtigste modellen vechten immers ook beter: vaak sloten ze de anderen eerst buiten en kwam de vrede pas daarna.