6min Devices

Helios: AMD groeit naar rack-scale AI-systeem

Helios: AMD groeit naar rack-scale AI-systeem

Advancing AI 2026 is feitelijk AMD’s introductie van Helios. Dit rack-scale systeem neemt het op tegen Nvidia’s Vera Rubin NVL72, de huidige standaard voor AI-training en -inferencing op grote schaal. Helios is met ruime marge AMD’s grootste discrete AI-product, met 31 terabyte aan HBM4-geheugen dat als één systeem kan worden aangestuurd. Afgezien van de specs is Helios bovenal een verhaal over weggenomen bottlenecks en leren van eerdere fouten.

Het belangrijkste wapenfeit is dat AMD van Helios één samenhangend systeem heeft gemaakt. Een pool van 31 terabyte (!) aan HBM4-geheugen is aan te spreken via een interne connectie op basis van Ultra Ethernet. De optelsom van 72 GPU’s is daarmee vergelijkbaar met het rack-scale equivalent van Nvidia, zij het met 1,5 keer zoveel geheugen en niet via NVLink verbonden. Eén Helios-rack kan meerdere instances van de grootste LLM’s bedienen, tientallen grote open-weight-modellen of meer dan honderd LLM’s met het vaak voorkomende aantal van circa 70 miljard parameters. Voor het trainen betekent de geheugencapaciteit dat er minder replica’s van een model nodig zijn tijdens het trainen. Dit leidt tot een betere ‘tokens-per-dollar’-verhouding, zoals AMD het uitdrukt.

Alle 72 GPU’s delen één enkel load/store-domein binnen de fabric. Elke GPU kan elke andere GPU bereiken in één enkele netwerk-hop. Software “hoeft niet langer te optimaliseren voor netwerklocaliteit”, zoals Mark Chubb het omschrijft, Corporate VP of Platform Architecture bij AMD. Of, om het anders te zeggen: software hoeft zich niet langer bezig te houden met de locatie van de data.

Weg met bottlenecks

Het systeem omzeilt ook automatisch congestie en behandelt het geheel van 72 GPU’s als één samenhangend object. Dit betekent dat veel bottlenecks die funest zijn voor AI-training en -inferencing worden weggenomen. Programmeurs kunnen zich daardoor richten op optimalisatie op andere gebieden.

Dankzij isolatielagen kun je Helios opdelen voor onafhankelijke workloads zonder dat er gegevens uitlekken. Maar de standaardconfiguratie is die van één enkele, enorme compute unit voor AI. Je kunt het natuurlijk naar eigen inzicht opdelen. Dankzij confidential computing kunnen klanten erop vertrouwen dat kritieke workloads veilig blijven, zelfs wanneer andere organisaties hun AI op precies hetzelfde Helios-systeem draaien.

Een andere verbetering komt voort uit het feit dat Helios wordt gezien als meer dan alleen de servers in de racks. AMD’s ‘inside-out’-benadering, denkend vanuit de server naar het datacenter als geheel, is nu gekoppeld aan de expertise van het overgenomen ZT Systems. Deze partij was een system integrator voor IT-infrastructuur. De combinatie van AMD met ZT komt met betere overwegingen over de praktische vereisten om Helios gebruiksvriendelijk te maken. Een enkele compute tray weegt 77 kilogram en bevat een overvloed aan kwetsbare componenten. Chubb, voorheen werkzaam bij ZT Systems, suggereert dat AMD een nuttig ‘outside-in’-perspectief heeft verworven om rekening te houden met de fysieke aard van deze systemen als je ze installeert of vervangt.

De waarheid is dat elke competente enterprise-GPU als warme broodjes over de toonbank gaat, en een van de redenen waarom AMD hier niet meer van heeft geprofiteerd, is dat het bedrijf ook een server-CPU- en consumententak moet runnen. Het toewijzen van wafers op TSMC’s 2 nanometer-procedé zal lastig zijn, aangezien zowel Epyc als Instinct (AMD’s AI-GPU’s) hiervan gebruikmaken. Elk Helios-systeem vereist 18 Epyc-processors en 72 Instinct MI455X-GPU’s, gestapeld in 18 trays.

CUDA is (blijkbaar) helemaal geen concurrentievoordeel

AMD beschikt al jaren over op papier sterke AI-specificaties. Door praktische factoren is het echter ver achtergebleven bij Nvidia, zelfs als we rekening houden met een groei in marktaandeel. Ten eerste was ROCm geen standaard en vormde het een verwarrende softwarelaag die bij lange na niet kon tippen aan CUDA. Eind 2024 zou het naar verluidt “vol met bugs” zitten. Bovendien hebben herhaaldelijke storingen het vertrouwen in het platform voor het uitvoeren van enorm kostbare AI-trainingsruns geschaad. AMD moest zich in feite beperken tot inferencing.

Verschillende factoren helpen AMD nu, los van de ruwe specificaties. Zo verschuift de vraag van training naar inferencing, in een verhouding van 60 procent tegen 40 procent. Twee jaar geleden was deze verhouding nog omgekeerd.

Ten tweede, en dit zal door velen controversieel klinken, is CUDA volgens AMD “geen moat“. Andrew Dieckmann, Corporate Vice President en General Manager van de Data Center GPU Business Unit van het bedrijf, is hierover heel duidelijk: “We hebben bijna geen gesprekken meer over CUDA.” Hogere abstractielagen en automatische, door AI ondersteunde ‘recepten’ voor AI-modellen op ROCm helpen om de CUDA-stack van Nvidia als belangrijke factor uit te schakelen. We zullen blijven rondvragen het komende jaar bij relevante partijen om te controleren of dit werkelijk het geval is.

Drie jaar geleden zou dit wegwuiven van CUDA verbazingwekkend hebben geklonken. Maar er is goede reden om aan te nemen dat AMD gelijk gaat krijgen. Neem bijvoorbeeld Anthropic, dat erin geslaagd is zijn Claude-modellen tot op zekere hoogte hardware-onafhankelijk te maken. Nvidia, AMD, Google TPU en AWS Trainium; ze draaien allemaal Claude, zelfs Fable 5.

Een bedrijf als Anthropic (of OpenAI, Meta, SpaceXAI en anderen, wat dat betreft) heeft geen reden om te investeren in een op CUDA gerichte wereld. AMD helpt hen daarbij. ROCm is enorm verbeterd en biedt inferencing-optimalisatie die in grote lijnen concurrerend is met die van Nvidia.

Lees ook: AMD investeert tot 5 miljard in Anthropic voor Instinct-GPU’s

Conclusie: de nieuwe realiteit van inferencing

Het is ietwat komisch dat AMD nu schijnbaar concurrerend is op het gebied van training, net nu inferencing duidelijk de prioriteit is geworden. In zekere zin heeft het de hoogtijdagen van de ‘training-first’-filosofie van 2023 tot 2025 gemist. Maar de schaal van AI zal alleen maar toenemen, en de behoefte aan concurrerende inferencing is enorm.

Dieckmann merkt op dat er een “enorme markt” is voor AI-workloads, met “ruimte voor diversiteit in rekenkracht”. De specifieke rol van AMD draait om flexibiliteit. “Modulariteit is onze bondgenoot”, zegt hij, en AMD beschikt over veel stukjes van de AI-puzzel. De integratie van ZT Systems is zo’n onderdeel, net als de toonaangevende Epyc-CPU’s van het bedrijf als host nodes voor GPU’s en meer, samen met de Instinct AI-versnellers, DPU’s, NIC’s en fabric.

Die diversiteit qua hardware begint al vorm te krijgen. Cerebras staat op het punt om 750 tokens per seconde (!) te leveren met GPT-5.6 Sol, dankzij zijn rekenkracht op wafer-schaal waardoor een model op één enkel stukje silicium kan draaien. Google zal het ontwerp van Gemini verwerken in een toekomstige ‘Frozen’-chip, terwijl OpenAI met Broadcom heeft samengewerkt aan zijn Jalapeno AI-processor.

Helios is de realisatie van alle bouwstenen van AMD samen. Natuurlijk is het één aanbod, waarschijnlijk met het soort marge dat alleen een ‘geïntegreerde oplossing’ kan opleveren. Maar Dieckmann maakt de belangrijke opmerking dat de meest geavanceerde datacenters zo’n gedetailleerde coördinatie vereisen dat zelfs system engineering op Helios-niveau te beperkt is. Enorme clusters van rack-scale-systemen vereisen uitgestrekte liquid loops, onmetelijke stroomvoorziening en ruimte. Helios is een uiterst belangrijke bouwsteen, maar slechts één van vele.