OpenAI heeft aanvullende beveiligingsmaatregelen ingevoerd rond Astra, een nog niet uitgebracht AI-model. Recente interne tests laten volgens het bedrijf zulke sterke cybercapaciteiten zien dat niet kan worden uitgesloten dat Astra de hoogste risicodrempel uit het eigen Preparedness Framework bereikt.
De evaluaties van de afgelopen dagen wijzen volgens OpenAI op aanzienlijke vooruitgang bij agentic coding en cybersecurity. Eerdere modellen, waaronder GPT-5.6-Sol, werden op dit terrein nog ingedeeld in de categorie High. Bij Astra kan volgens de voorlopige resultaten sprake zijn van de hogere categorie Critical.
OpenAI benadrukt dat nog niet is vastgesteld dat Astra daadwerkelijk aan die criteria voldoet. Daarvoor lopen de benchmarks en verdere evaluaties nog. De Critical-drempel omvat onder meer het zelfstandig vinden en ontwikkelen van werkende zero-day-exploits voor goed beveiligde systemen of het autonoom opzetten en uitvoeren van nieuwe aanvalsmethoden tegen zwaar beveiligde doelen.
OpenAI vermeldt daarnaast expliciet dat Astra niet betrokken was bij het eerder gemelde incident rond Hugging Face.
De bekendmaking volgt op meerdere recente incidenten tijdens cybersecuritytests met geavanceerde AI-modellen. Denk daarbij aan het Hugging Face-incident en aan vergelijkbare voorvallen tijdens tests van modellen van Anthropic.
Activiteiten stilgelegd
Vanwege de testresultaten scherpt OpenAI de beveiliging rond de verdere ontwikkeling van Astra aan. Het gaat onder meer om geïsoleerde testomgevingen, beperkingen op netwerk- en tooltoegang, betere bescherming en encryptie van modelgewichten, extra monitoring en uitvoering binnen sandboxomgevingen.
Interne activiteiten met Astra die nog niet aan deze strengere beveiligingseisen voldoen, zijn voorlopig stilgelegd. Ook past OpenAI monitoring toe op alle agentic toepassingen van Astra tijdens training en evaluatie. Daarbij worden risicovolle acties en mogelijke misalignment gecontroleerd. Bij een hoog risico kan een beveiligingsprocedure de activiteit laten beoordelen en onderbreken.
OpenAI wil de capaciteiten van Astra daarnaast samen met relevante overheidsinstanties en geselecteerde AI-veiligheidsorganisaties verder testen. Externe testpartners krijgen aanvullende beveiligingsrichtlijnen voor evaluaties en workloads met een hoger risico.
Het bedrijf zegt geavanceerde cybermodellen uiteindelijk ook te willen inzetten voor verdediging, bijvoorbeeld om kwetsbaarheden te ontdekken en te verhelpen voordat aanvallers daarvan gebruikmaken.