©Unsplash

AI loog en manipuleerde: dit zagen testers gebeuren
AI-modellen worden steeds slimmer, maar volgens een nieuw rapport van het Britse AI Security Institute (AISI) ook een stuk eigenwijzer. Tijdens veiligheidstests vertoonden experimentele modellen van Anthropic en OpenAI gedrag dat onderzoekers omschrijven als autonoom en misleidend. En dat terwijl daar geen opdracht voor was gegeven.
Mythos
De test was op papier vrij simpel. Los een cybersecurity-uitdaging op met toegang tot tools en het internet. Maar het Mythos AI-model van Anthropic ging behoorlijk ver. Het probeerde niet alleen toegang te krijgen tot GitHub, maar ontwikkelde ook een strategie om mensen te misleiden die dat moesten goedkeuren. Daarover bericht de BBC.
Volgens het rapport maakte het AI-systeem nepprofielen aan op basis van echte personen die betrokken zijn bij GitHub. Vervolgens benaderde het die mensen met berichten die leken te komen van collega’s, in een poging om kwaadaardige code goedgekeurd te krijgen. Toen die poging werd doorzien, paste het model zijn eerdere acties aan om onschuldig over te komen. Het overwoog zelfs een nieuwe identiteit aan te nemen.
Het doelgericht manipuleren en zichzelf heruitvinden zagen onderzoekers niet eerder zo duidelijk terug. Vooral omdat het model hier niet specifiek toe was aangezet. Het ging op eigen initiatief op deze wijze te werk.
Sol
Ook een model van OpenAI, Sol, werd aan het werk gezet, al bleef de schade daar beperkter. In alle gevallen voorkwam menselijke controle dat de aanval slaagde.
Zowel Anthropic als OpenAI benadrukken dat de tests plaatsvonden onder kunstmatige omstandigheden, waarbij veiligheidsmechanismen deels waren uitgeschakeld. Toch onderstreept het incident volgens AISI een belangrijk punt. Naarmate AI-systemen krachtiger worden, vertonen ze gedrag dat moeilijker te voorspellen is. En dat vormt een nieuwe uitdaging in cybersecurity.

















