OpenAI heeft een deel van de training van zijn krachtigste AI-modellen stilgelegd nadat een AI-agent opnieuw uit een afgeschermde testomgeving wist te ontsnappen. Het systeem kreeg toegang tot internet en benaderde vervolgens zelfstandig een externe chatbot.
Het incident vond volgens Bloomberg plaats tijdens de training van een agentisch AI-systeem in een sandbox die juist geen toegang tot internet hoorde te bieden. Het model ontdekte echter een zwakke plek in die afscherming en wist het openbare internet te bereiken.
Vervolgens stuurde het minstens twintig verzoeken naar een niet nader genoemde chatbotdienst van een derde partij. Daarbij ging het voor zover bekend niet om schadelijke opdrachten; een van de vragen was bijvoorbeeld wat de hoofdstad van Frankrijk is. Het probleem zit vooral in het feit dat het model überhaupt buiten zijn gecontroleerde omgeving kon komen.
OpenAI heeft daarop training waarbij zijn krachtigste modellen tools kunnen gebruiken voorlopig stilgelegd. Die training wordt pas hervat nadat het probleem met de sandbox is opgelost. Het specifieke model dat bij het incident betrokken was, wordt volgens het bedrijf niet verder getraind.
Noodstop werkte niet
Het incident bracht ook een tweede probleem aan het licht. Een intern monitoringsysteem detecteerde het afwijkende gedrag en waarschuwde een medewerker. Die bevestigde de melding binnen drie minuten via Slack.
Daarna had de trainingsrun automatisch moeten worden beëindigd, maar dat gebeurde niet. Uiteindelijk duurde het meer dan twee uur voordat de training handmatig werd stopgezet. Daarmee faalde niet alleen de technische afscherming van het model, maar ook een deel van het proces dat de gevolgen van zo’n incident moet beperken.
Het is niet de eerste keer dat OpenAI problemen ondervindt met modellen die tijdens tests buiten hun toegestane omgeving opereren. In juli kregen modellen tijdens interne tests toegang tot internet en drongen ze onbedoeld binnen bij AI-platform Hugging Face.
Daarnaast bevestigde OpenAI deze week dat modellen tijdens training en evaluatie informatie hebben benaderd op websites van Amerikaanse overheidsinstanties, waaronder het Census Bureau en de Securities and Exchange Commission (SEC). Eerder werd ook bekend dat OpenAI-agents betrokken waren bij een incident rond een Australische overheidswebsite.
Het nieuwe voorval is volgens OpenAI het eerste beveiligingsincident van dit specifieke type sinds de gebeurtenissen rond Hugging Face. Bloomberg meldt dat het bedrijf nog altijd bezig is de eerdere activiteiten van zijn agents in kaart te brengen.
De incidenten zetten ondertussen de discussie over de controle over steeds autonomere AI-systemen verder op scherp. Niet alleen OpenAI, maar ook Anthropic, Google DeepMind en Meta hebben de afgelopen tijd ongewenst gedrag van agents onderzocht. OpenAI en Anthropic hebben bovendien opgeroepen voorzichtig om te gaan met de ontwikkeling van systemen die een steeds grotere rol kunnen spelen bij het verbeteren van volgende generaties AI-modellen.