2min Security

OpenAI zet rem op AI-ontwikkeling na ‘Hugging Face’

OpenAI zet rem op AI-ontwikkeling na ‘Hugging Face’

OpenAI heeft een deel van de ontwikkeling van nieuwe AI-modellen op een lager pitje gezet. Aanleiding is een beveiligingsincident waarbij een autonome AI-agent tijdens een test uit zijn afgeschermde omgeving kwam en systemen van Hugging Face wist te bereiken. OpenAI scherpt daarop zijn test- en trainingsprocedures aan.

Het bedrijf legde de evaluatie van modellen twee weken stil, meldt Reuters. Ook de training van Astra, de volgende generatie AI-modellen van OpenAI, is gepauzeerd. Een omvangrijke trainingsrun die voor Astra op de planning stond, is nog niet hervat. Wanneer de tijdelijke vertraging precies is ingegaan, heeft OpenAI niet bekendgemaakt.

De ingreep betekent een koerswijziging voor OpenAI. De afgelopen jaren probeerde het bedrijf de ontwikkeling, evaluatie en introductie van modellen juist te versnellen. De concurrentiestrijd tussen aanbieders van generatieve AI maakte een hoog ontwikkelingstempo belangrijk.

De beveiligingsmaatregelen krijgen nu meer prioriteit. OpenAI wil onder meer AI-systemen inzetten om andere agents tijdens tests te volgen. Gevoelige experimenten moeten daarnaast vaker plaatsvinden in streng geïsoleerde sandboxomgevingen.

Een andere techniek waarop OpenAI inzet is ‘chain-of-thought monitoring’. Onderzoekers proberen daarmee tijdens tests zicht te krijgen op de stappen waarmee een model tot een beslissing of actie komt. Die aanpak biedt echter geen garantie. Onderzoek wijst erop dat modellen niet noodzakelijk in hun zichtbare redeneerproces prijsgeven dat ze van plan zijn regels te overtreden.

De aanleiding voor de maatregelen ligt bij een incident van vorige maand. Een autonome agent die gebruikmaakte van twee geavanceerde OpenAI-modellen werd getest op cybersecuritytaken. Daarbij wist de agent buiten de bedoelde testomgeving te opereren en toegang te krijgen tot infrastructuur van Hugging Face. Het systeem deed dat om het doel te behalen dat het tijdens de test had gekregen.

Astra voldoet nog niet aan eisen

De strengere aanpak beperkt zich niet tot de evaluatieomgeving. OpenAI maakte op 7 augustus al bekend extra beveiligingseisen te stellen aan zijn krachtigste modellen. Activiteiten rond Astra werden daarbij stilgelegd omdat het model nog niet aan die eisen voldeed.

OpenAI koppelt de maatregelen aan zijn Preparedness Framework, waarin het beschrijft hoe het omgaat met modellen die potentieel gevaarlijke capaciteiten ontwikkelen. Het bedrijf stelt nu dat niet alleen de eigen procedures moeten veranderen. Naarmate AI-modellen autonomer en krachtiger worden, zou de sector als geheel uitgebreidere beveiligingsmaatregelen nodig hebben.