3min Security

OpenAI-test leidt tot incident bij Hugging Face

OpenAI-test leidt tot incident bij Hugging Face

OpenAI heeft bevestigd dat een interne test met geavanceerde AI-modellen heeft geleid tot een beveiligingsincident bij AI-platform Hugging Face. De modellen wisten tijdens een evaluatie van hun cybercapaciteiten uit een afgeschermde testomgeving te ontsnappen. Ze drongen vervolgens door tot de infrastructuur van het platform. Volgens OpenAI is sprake van een ongekend incident dat laat zien hoe ver de cybercapaciteiten van de nieuwste generatie AI-modellen inmiddels reiken.

Hugging Face maakte het incident vorige week aanvankelijk bekend als een aanval door een “externe AI-agent”, zoals Techzine al meldde. Pas na gezamenlijk onderzoek concludeerden beide organisaties dat de aanvallende AI-modellen afkomstig waren uit een interne testomgeving van OpenAI.

Benchmark mondde uit in echte aanval

Het incident vond plaats tijdens een interne benchmark waarmee OpenAI de cybercapaciteiten van zijn nieuwste modellen beoordeelt. Daarbij werden onder meer GPT-5.6 Sol en een nog niet uitgebracht model getest. Voor deze evaluatie waren de gebruikelijke beveiligingsmaatregelen die modellen ervan weerhouden risicovolle cyberactiviteiten uit te voeren bewust uitgeschakeld, zodat de maximale cybercapaciteiten konden worden gemeten.

Volgens OpenAI is dit voor zover bekend de eerste keer dat een benchmark voor cybercapaciteiten heeft geleid tot een daadwerkelijke aanval op een externe organisatie.

De modellen draaiden in een sterk geïsoleerde testomgeving met slechts beperkte netwerktoegang. Volgens OpenAI ontdekten zij echter een onbekende kwetsbaarheid in software die werd gebruikt voor het installeren van softwarepakketten. Door deze zero-day te misbruiken verkregen de modellen toegang tot het internet.

Vervolgens voerden de modellen meerdere privilege-escalaties en laterale verplaatsingen uit binnen de onderzoeksomgeving van OpenAI, totdat zij een systeem bereikten met volledige internettoegang.

Eenmaal online concludeerden de modellen dat Hugging Face mogelijk datasets, AI-modellen en oplossingen voor ExploitGym hostte. ExploitGym is een publiek beschikbare benchmark waarmee wordt gemeten hoe goed AI-systemen bestaande kwetsbaarheden kunnen misbruiken.

Volgens OpenAI waren de modellen volledig gericht op het behalen van een zo hoog mogelijke score op deze benchmark. Om de evaluatie te omzeilen zochten zij actief naar manieren om de juiste antwoorden rechtstreeks te verkrijgen. Daarbij combineerden zij verschillende aanvalstechnieken, waaronder gestolen inloggegevens en een zero-day-kwetsbaarheid, om uiteindelijk toegang te krijgen tot de productieomgeving van Hugging Face. Daar haalden zij de testoplossingen rechtstreeks uit de productiedatabase.

De afwijkende activiteiten werden zowel door het beveiligingsteam van OpenAI als door Hugging Face opgemerkt. Hugging Face wist de aanval op zijn infrastructuur te stoppen en startte direct een forensisch onderzoek. Tijdens het gezamenlijke onderzoek stelden beide organisaties vast dat de aanvallende AI-agent afkomstig was uit OpenAI’s interne testomgeving.

OpenAI scherpt beveiliging aan

OpenAI meldt de ontdekte zero-day inmiddels op verantwoorde wijze te hebben gemeld aan de leverancier van de betrokken software. Ook worden de onderzoeksomgeving en de procedures rond modelevaluaties aangescherpt. Volgens het bedrijf gaan die extra beveiligingsmaatregelen voorlopig ten koste van de snelheid waarmee onderzoek kan worden uitgevoerd.

Daarnaast is Hugging Face opgenomen in het Trusted Access-programma van OpenAI, zodat het platform de nieuwste AI-modellen kan inzetten om zijn eigen beveiliging verder te versterken.

OpenAI noemt het incident een belangrijk signaal dat de cybercapaciteiten van AI-modellen sneller toenemen dan veel bestaande beveiligingsmaatregelen. Uit recente evaluaties van het Britse AI Security Institute bleek al dat modellen zoals GPT-5.6 Sol langdurige, complexe cyberoperaties kunnen uitvoeren. Volgens OpenAI toont dit incident aan dat die mogelijkheden niet langer uitsluitend theoretisch zijn.

Het bedrijf stelt dat geavanceerde AI uiteindelijk juist moet worden ingezet om beveiligingslekken eerder op te sporen dan kwaadwillenden. Tegelijkertijd laat het incident volgens OpenAI zien dat ook de beveiliging van testomgevingen en de controle op krachtige AI-modellen verder moet worden versterkt naarmate deze autonomer en capabeler worden.