Gemini 4 Argon onthuld, maar nog niet uitgebracht: hoe zit dat?

Gemini 4 Argon onthuld, maar nog niet uitgebracht: hoe zit dat?

Na een klein jaar waarin Anthropic en OpenAI de afstand tot Google telkens vergrootten, is Gemini terug van weggeweest. Gemini 4 “Argon” is een model dat op papier wedijvert met Fable 5.1 en GPT-6 Astra. Soms is het zelfs beter als we naar de benchmarks kijken. Die zeggen echter niet alles; de werkelijke test blijft alleen nog even uit aangezien toegang zeer beperkt is.

Google beperkt toegang tot enkel de deelnemers aan het securitygedreven “Fairwind Program“, het eigen equivalent van Project Glasswing van Anthropic en Daybreak van OpenAI. De mogelijkheden reiken echter veel verder dan cybersecurity. Zo zou Gemini 4 Google al helpen om quantumberekeningen te optimaliseren, geheugen optimaal te gebruiken en grote codemigraties te maken.

Kampioen complexiteit

De Amerikaanse overheid mag van Google vóór de brede release het model onderzoeken en inzien. Daarnaast test het bedrijf achter Gemini de guardrails en verzamelt het vroege feedback. Het kan dus even duren voordat eindgebruikers binnen organisaties en consumenten aan de beurt zijn.

De prijs is al wel bekend. Deze is gelijk aan die van GPT-6.1 Sol: 2 dollar per miljoen input-tokens en 10 dollar per miljoen output-tokens. Gecachete input, die goedkoper is voor de AI-spelers om te verwerken omdat deze informatie al op de servers staat, krijgt 95 procent korting. Opvallend is dat de output-limiet stijgt van 64.000 naar 1 miljoen tokens.

Van Rust-migraties tot geheugenwinst

Intern draait Argon al bij duizenden ‘Googlers’. Agents migreren volop C/C++-code naar Rust, van libraries als re2 tot de ruim 800.000 regels van de Zircon-kernel van Fuchsia. Bij videodecoder libgav1 vervingen ze 32.000 regels SIMD-code. Het resultaat was een decoder die 2,7 keer sneller draait dan de eerdere Rust-port. Elders maakten Argon-agents ruim 300 TiB geheugen vrij in Googles datacenters. Zo blijkt dat Gemini 4 ondanks de ongetwijfeld forse inferencingkosten op meerdere manieren helpt de kosten te besparen.

Op benchmarks claimt Google de koppositie op DeepSWE v1.1 (77,9 procent), de Vals Index en Zapiers AutomationBench (51,3 procent). Nu zijn benchmarks, eigenlijk van alle soorten en maten, de laatste maanden wat ongeloofwaardig geworden. Dit omdat modellen zoals Opus 5 hoger scoorden dan Fable 5, terwijl elke gebruiker op de langere termijn moest concluderen dat laatstgenoemde aanzienlijk sterker was.

Zonder cyber-guardrails

Voor nu blijft de aandacht gericht op cybersecurity, ondanks de diverse sterke punten van Argon elders. Het model kan kwetsbaarheden op autonome wijze vinden, valideren en patchen. Vertrouwde verdedigers en interne Google-teams krijgen het model zonder cyber-guardrails. Wiz gebruikt Argon al voor zijn Scan for Good-initiatief, stelt het bedrijf. Daarbij vond het model een kritieke kwetsbaarheid in zorgsoftware van ziekenhuizen wereldwijd, een cybergevaar dat eerdere frontier-modellen hadden gemist.

Voor de brede uitrol versterkt Google naar eigen zeggen de safeguards tegen misbruik voor biologische, chemische, radiologische en nucleaire aanvallen en tegen indirecte prompt injection. Daarnaast monitort het de chain-of-thought en acties van het model op misalignment. Google roept de industrie op om transparantie in reasoning te behouden (een duidelijke sneer naar Anthropic en OpenAI) zodat de gedachten van modellen bruikbaar blijven om misalignment op te sporen.

Lees ook: Google lanceert Gemini 3.1 Pro, een LLM voor complexe redenaties