OpenAI is erg optimistisch over zijn nieuwste model, GPT-6 Astra. Het is al uitgerold naar een selecte groep organisaties, waarna de toegang geleidelijk wordt uitgebreid naar Plus-, Pro- en Team-gebruikers. Ondanks de claim vanuit OpenAI dat er sprake is van ‘AGI’ wijst ander bewijs erop dat we hier te maken hebben met vooral een geduchte concurrent van Claude Fable van Anthropic.
OpenAI noemt het nieuwe LLM ‘een nieuwe generatie intelligentie’ en benadrukt de belangrijkste verbeteringen achter Astra. Het duidelijkste verschil met voorganger GPT-5.6 Sol is ExploitBench, met een perfecte score van 100%, terwijl Sol 78,5% haalde. Een andere ‘opgeloste’ benchmark is ARC-AGI-3, waar Sol 7,8% scoorde en Astra 99,9%.
Een van de eerste neutrale benchmarks is de suite van Artificial Analysis, die het algemene intelligentieniveau van Astra verrassend genoeg gelijk stelt aan dat van Sol (61). Binnen Codex, als programmeeragent, zijn de prestaties eveneens gelijk (67), en in beide gevallen liggen ze achter op Anthropic’s Claude Opus 5 (63, 68) en Fable 5.1 (65, 70). Het lijkt erop dat de statistieken op het eerste gezicht de beweringen niet helemaal rechtvaardigen. Subjectief gezien zijn er echter enkele behoorlijk grote claims die door enig bewijs worden ondersteund.
Twee belangrijke voordelen
OpenAI heeft een reputatie opgebouwd als het meest efficiënte van de AI-spelers qua tokengebruik, met een veel hogere efficiëntie per antwoord en lagere totale prijzen voor zowel API-calls als bredere toegang op basis van een abonnement, in vergelijking met Anthropic en concurrenten met open-weight-modellen. Cruciaal is dat Astra exclusief kan worden gebruikt en het volledige tokenbudget in reguliere abonnementen kan benutten, in tegenstelling tot Fable, dat 50% in mindering brengt op Claude Max-abonnementen. Desalniettemin is de prijs van 10 dollar per miljoen invoertokens en 50 dollar per miljoen uitvoertokens aanzienlijk hoger dan de respectievelijke 4 dollar en 20 dollar waarvoor Sol beschikbaar is.
Een ander belangrijk voordeel, vooral ten opzichte van Claude Fable, is het relatieve gebrek aan beperkingen voor gebruikers. Alleen activiteiten die vrij duidelijk op kwaadwillige bedoelingen duiden, worden geblokkeerd, terwijl code review en het aanbrengen van patches wel mogelijk zijn. Er wordt ook niet gesproken over het blokkeren van biologische onderwerpen.
“AGI”, nogmaals
Een belangrijke doorbraak die OpenAI bondig communiceert, is het feit dat het computergebruik nu verder gaat dan wat een mens kan. Alles wat men op een pc zou kunnen doen, zou in theorie door Astra met een hogere snelheid kunnen worden uitgevoerd. Natuurlijk ligt de focus vooral op mechanische, routinematige en vervelende taken, waarbij een mens Astra kan inzetten om zijn of haar opdrachten uit te voeren.
Natuurlijk moeten we uiterst op onze hoede zijn voor de manier waarop OpenAI zijn ontwikkelingen communiceert. De president van het bedrijf, Greg Brockman, suggereerde tijdens een persconferentie dat de sector met Astra nu het „AGI-tijdperk“ is binnengetreden. De vraag is, zoals altijd bij beweringen over AGI, wat dat precies inhoudt. Blijkbaar volstaat het om in ChatGPT Work een afspraak voor een knipbeurt te kunnen boeken om als “persoonlijke AGI” te worden aangemerkt. We zijn nogal sceptisch over de vraag of Astra in algemene zin daadwerkelijk een doorbraak is die verder gaat dan Fable. Dat is geen belediging, want de voorbeelden die we tot nu toe hebben gezien, laten algemene Fable-achtige prestaties zien die alleen Kimi K3 en GLM-5.3 Flash hier en daar hebben laten zien.
Uitmuntendheid in 3D
Voorbeelden van dit soort prestaties gaan vaak zelfs verder dan de mogelijkheden van Fable 5 en 5.1. Vooral het 3D-gedrag is uitmuntend: Astra lijkt in staat om straat voor straat door een schaalgetrouwe weergave van Manhattan te lopen en een op Unreal Engine 5 gebaseerd huis te bouwen volgens strikte specificaties.
We zullen moeten afwachten hoe GPT-6 Astra wordt ontvangen wanneer het op grotere schaal beschikbaar komt. Voorlopig lijkt het erop dat OpenAI in ieder geval de valkuil heeft vermeden waarin GPT-5 vorig jaar terechtkwam, toen het er niet in slaagde echt indruk te maken buiten, laten we zeggen, de redeneervermogens van o3 of het creatieve schrijven van GPT-4.1.
Lees ook: Claude Fable 5.1: de start van een nieuwe AI-realiteit