©Anthropic

Ook Claude heeft tijdens een test zelfstandig bedrijven gehackt
Niet alleen een AI-model van OpenAI blijkt zelfstandig andere bedrijven te hacken, want bij Anthropic is iets vergelijkbaars gebeurd.
Anthropic meldt dat na intern onderzoek blijkt dat Claude zelfstandig drie organisaties heeft gehackt. Anthropic voerde dit onderzoek uit na het nieuws dat een AI-model van OpenAI het bedrijf Hugging Face had gehackt om de antwoorden op een test te vinden.
Ook Claude kreeg in een testomgeving cybersecurityvraagstukken voorgeschoteld en net als bij OpenAI wist het model stiekem toegang te krijgen tot het internet. Wel gebeurde dat op een andere manier. Hugging Face werd via een onbekende kwetsbaarheid in de software gehackt, terwijl Claude het internet op ging via een pad dat per ongeluk open was gelaten.
Het gaat om drie verschillende modellen van Claude die dit pad richting het wereldwijd web hebben bewandeld: Open 4.7, Mythos 5 en een testmodel. Alleen het testmodel stopte uit zichzelf toen het door had dat zijn doelwit echt bleek. De andere twee modellen gingen gewoon verder, door te redeneren dat het allemaal onderdeel moest zijn van de oefening.
Geen monitoring
Anthropic geeft toe dat Claude in dit geval draaide zonder de veiligheidsmonitoring die normaal wordt toegepast. Daarnaast vindt Anthropic het belangrijk om te zeggen dat Claude enkel de gevraagde taak probeerde uit te voeren en niet een eigen doel koos.
















