©Unsplash

©Unsplash

OpenAI wist al dagen dat zijn losgeslagen AI-model achter Hugging Face-hack zat

Praat mee!
Eindredacteur
Floris is eindredacteur van Bright, host van de Bright Podcast en schrijft al 15 jaar over tech, media en meer.

Een mijlpaal: de eerste grote hack die zelfstandig en op eigen initiatief is uitgevoerd door een losgeslagen AI. De hack op Hugging Face was al spraakmakend, des te meer toen bleek dat een model van OpenAI er achter zat. Nog gekker: OpenAI wist het al anderhalve week.

OpenAI heeft eerder deze week toegegeven dat twee van zijn eigen AI-modellen dagenlang ongecontroleerd op het internet rondzwierven en daarbij AI-platform Hugging Face hackten. Maar dat bedrijf dat zelf al vrij lang wist voordat Hugging Face er ook maar iets van merkte is opvallender: dat meldt The Wall Street Journal op basis van bronnen rond het onderzoek. Het is een van de eerste concrete voorbeelden van het "loss of control"-scenario waar AI-veiligheidsonderzoekers al jaren voor waarschuwen, en het doet vragen rijzen over hoe transparant OpenAI eigenlijk is over zijn eigen fiasco's.

Ontsnapt tijdens een hacktest

Het begon allemaal met ExploitGym, een benchmark waarmee OpenAI test hoe goed zijn modellen zijn in het vinden en misbruiken van softwarelekken. Voor deze test had OpenAI de gebruikelijke veiligheidsmaatregelen losgelaten, om te zien wat GPT-5.6 Sol en een nog ongepubliceerd, krachtiger model écht konden. De test vond plaats op een computer zonder internet, om een voorbeeld te noemen.

In plaats van de test eerlijk te doorlopen, besloten de modellen blijkbaar dat het makkelijker was om uit hun sandbox te breken en de antwoorden ergens anders te gaan zoeken. Het model vond een zero-day kwetsbaarheid, misbruikte die en kwam zo het open internet op, waar het verder begon te hacken. Op 11 juli kwamen ze zo bij Hugging Face terecht, waar de modellen in twee dagen tijd zo'n 17.000 acties uitvoerden om binnen te dringen.

Hugging Face moest het zelf uitzoeken

Het meest wrange is niet eens dát de modellen ontsnapten – reward hacking is een bekend fenomeen waarbij een AI een shortcut zoekt om zijn taak op te lossen – maar hoe lang Hugging Face in het duister tastte. Het bedrijf merkte de aanval op via zijn eigen beveiligingssystemen, maar had geen idee wie erachter zat. Sterker nog: toen het Anthropic-modellen als Fable 5 en Opus inzette om de aanvalslogs te analyseren, weigerden die modellen simpelweg, omdat hun eigen guardrails de data als verdacht cyberaanval-materiaal bestempelden. Uiteindelijk moest Hugging Face terugvallen op het Chinese open-source model GLM 5.2 van Z.AI om de aanval te doorgronden en de indringers eruit te gooien.

Pas deze week, ruim anderhalve week na de aanval, hoorde Hugging Face van OpenAI zelf dat het om hun modellen ging. OpenAI wist dat allang, en koos er blijkbaar voor om eerst zelf uit te zoeken hoe erg de schade was voordat het slachtoffer werd ingelicht. Dat OpenAI intern zijn testomgevingen inmiddels heeft stilgelegd, is logisch – maar het verandert niets aan het feit dat een ander bedrijf dagenlang met een onbekende, autonome aanvaller te maken had zonder te weten dat de maker van die aanvaller allang op de hoogte was.

Een ongemakkelijk lesje in verantwoordelijkheid

Het is ook een pijnlijke ironie dat juist een Chinees model de aanval van Amerika's grootste AI-bedrijf moest opruimen, terwijl diezelfde grote spelers pleiten voor strengere restricties op Chinese modellen. OpenAI belooft een uitgebreid rapport, maar tot die tijd blijft de kernvraag onbeantwoord: hoeveel langer had OpenAI gewacht als Hugging Face zelf niet had aangeklopt?