100 TB/s tegen GPU-honger: NetApp Novus is “snelste storage ooit”

100 TB/s tegen GPU-honger: NetApp Novus is “snelste storage ooit”

Er zijn meerdere redenen waarom AI niet slaagt bij veel organisaties. Veel van die redenen zijn terug te voeren op data. Als de verkeerde data een model ingaat, wordt het niets, maar de storagesystemen waar de data opstaat moeten de honger van GPU’s ook bij kunnen benen. Tel daarbij op dat er niet heel verwonderlijk een vertrouwensprobleem is rondom AI en het is niet eenvoudig voor organisaties om AI-projecten tot een goed einde te brengen. NetApp wil dit allemaal gaan oplossen. Hoe het dat wil gaan doen? Dat lees je hieronder.

NetApp-CEO George Kurian is tijdens NetApp INSIGHT, de jaarlijkse conferentie van het bedrijf, zoals altijd vrij duidelijk in zijn observaties. AI en AI-agents hebben toegang nodig tot het collectieve geheugen en de context van organisaties. Is dat niet het geval, dan zullen AI-projecten veel vaker mislopen dan goedgaan. Hij ziet de onderliggende NetApp-infrastructuur als het geheugen. Dat wil zeggen, op de storagesystemen slaan organisaties hun data op. De de context wordt opgebouwd in de software stack er bovenop.

Alle aankondigingen die NetApp tijdens INSIGHT deze week doet, staan in het teken van de ambitie van NetApp om AI die toegang te geven. Van NetApp Novus, de “snelste storage ooit”, via de agentic AI software stack van NetApp tot de hybrid cloudbenadering en vanzelfsprekend ONTAP als basis voor vrijwel alles wat met unified storage te maken heeft.

NetApp Novus

Met afstand de belangrijkste aankondiging van deze INSIGHT-conferentie is NetApp Novus. Door Syam Nair, de Chief Product Officer van NetApp, wordt dit tijdens gesprekken met hem nog geregeld Project Novus genoemd, wat ons vertelt dat dit intern iets is geweest waar heel veel tijd en moeite in is gestopt. Novus wordt dan ook onomwonden neergezet als “snelste storage ooit”. Dat zal men bij Everpure niet graag horen. Dat bedrijf meldde begin deze maand nog met gepaste trots dat hun FlashBlade//EXA verreweg de best score had neergezet had bij een MLPerf-benchmark.

Met Novus zet NetApp naar eigen zeggen een reuzenstap op het gebied van prestaties. Tijdens tests haalde het leessnelheden van 100TB/s. Daarmee laat het alle andere systemen in de markt ver achter zich. Als we vragen of dat ook zogeheten sustained prestaties zijn, dus of Novus dat ook lange tijd achter elkaar kan, is het antwoord bevestigend.

Storage moet mee met compute en netwerk

Dit soort snelheden zijn overigens geen overbodige luxe, hoe gek dit ook mag klinken. Storage ligt namelijk mijlenver achter compute en netwerkinfrastructuur als het gaat om prestaties. De grootste modellen die onder andere ook in AI-fabrieken en GPU-clouds moeten kunnen draaien, maken al gebruik van GPU-clusters van 10.000 GPU’s. De verwachting is dat dit nog verder zal groeien naar 50.000 GPU’s per cluster voor toekomstige Nvidia-architecturen. Als we uitgaan van 2GB/s per GPU, dan komt dat neer op, heel toevallig, 100 TB/s.

Met andere woorden, NetApp Novus moet ervoor zorgen dat storage niet langer de belemmerende factor is voor AI-projecten. Alle GPU’s moeten 100 procent van de tijd kunnen blijven werken. Op dit moment is dat soms niet meer dan 5 procent. Dat wil zeggen, de GPU’s doen 95 procent van de tijd niets in dit soort enorme GPU-clusters. Dat is zonde van de investeringen.

Als het gaat om prestaties, dan is die 100TB/s niet alles. NetApp belooft ook dat alles in principe eindeloos door kan schalen. Dit vanwege de disaggragatie die het toepast op de data (zie volgende paragraaf). Het moet mogelijk zijn om met NetApp Novus richting zettascale in een enkele namespace. Om dit in perspectief te zetten, geeft Kurian aan dat dit alle vorig jaar verkochte storage, verspreid over tape, HDD en SSD in een enkele omgeving is.

Disaggregatie naar een nieuw niveau

De prestaties van NetApp Novus zijn wat ons betreft echter niet het enige interessante wapenfeit. NetApp heeft dit naar eigen zeggen bewerkstelligd zonder de inzet van afgeschermde protocollen. Het is allemaal gebaseerd op pNFS, oftewel parallel NFS. Het beheer van dit filesystem wordt eveneens gedaan door standaardtooling.

NetApp Novus bereikt de hoge doorvoersnelheid eerst en vooral door het loskoppelen van metadata en data. Met andere worden, metadata is uit het datapad gehaald. De data kan gewoon doorstromen naar de GPU’s aan vrijwel line rate. De metadata (bestandsnaam, locatie, laatste keer toegang, dat soort zaken), waar allerlei inzichten en dergelijke uitgehaald kunnen worden, gaat naar metadataservers. Het is geen toeval dat PEAK:AIO als alles doorgaat overgenomen wordt door NetApp. Dat bedrijf heeft volgens Kurian “met afstand de beste pNFS”.

Wat NetApp gedaan heeft met Novus kun je zien als een nog diepere vorm van disaggregatie. Waar het vorig jaar met NetApp AFX compute en capaciteit (dus storage) loskoppelde van elkaar, doet het nu hetzelfde met data en metadata. AFX is veel meer gericht op inferencing-workloads overigens, waar Novus er is voor de enorme clusters waar doorgaans modellen mee getraind worden.

NetApp Novus draait ONTAP

Tot slot is het wat betreft NetApp Novus nog goed om op te merken dat het besturingssysteem ONTAP is. Met andere woorden, het integreert dus naadloos in de bredere datastrategie van bedrijven die al op ONTAP zitten.

Het feit dat ONTAP het besturingssysteem is voor Novus is volgens Jurgen Hofkens, CTO EMEA bij NetApp, een niet te onderschatten detail. Het zorgt ervoor dat er niet weer een aparte silo opgezet hoeft te worden. De neoclouds en GPU-clouds kunnen met Novus een enorm krachtige storagelaag onder hun GPU’s hangen, maar klanten kunnen het dankzij ONTAP ook soepel afnemen. Dat moet de adoptie sterk ten goede komen, is zijn verwachting.

Voor de volledigheid ook nog even wat NetApp Novus in de praktijk nu precies is als product: de NetApp Novus Data Director is de metadatasoftware. Die draait op Supermicro servers terwijl de ONTAP data services door een all-flash AFF A90 array worden geleverd. Volgens Arindam Banerjee, Chief Platform and Technology Officer van NetApp, komt er echter ook een software-defined versie aan, waarmee er meer keuze komt in hoe organisaties het daadwerkelijk uit willen rollen.

Er moet meer gebeuren

Het dataverhaal van AI draait niet alleen om prestaties. Als je geen idee hebt welke data je hebt en met welke data je aan de slag moet, kun je alsnog niet zoveel uitrichten. Tijdens de al eerder aangehaalde lancering van AFX leverde NetApp daarvoor al de AI Data Engine mee. Dat is feitelijk een dataprep metadata-engine die bepaalt welke data gevectoriseerd wordt en op die manier richting de modellen gaat.

AI Data Engine kan inmiddels metadata uit allerlei bronnen halen. Naast NetApp ONTAP-systemen werkt het ook in combinatie met NetApp StorageGRID en arrays die niet van NetApp zijn (zolang die standaard protocollen SMB, NFS en S3 gebruiken uiteraard). Er komen ook nog heel wat AI-aangedreven optimalisaties aan voor AI Data Engine die ervoor moeten zorgen dat deze nog beter wordt in het zoeken en analyseren van metadata.

Als we in gesprek met Kurian aangeven dat dit verhaal wel heel bekend klinkt uit de markt (onder andere Everpure vertelde ons dit ook) en dat het een beetje een rommeltje begint te worden in die laag van de stack, is hij het ermee eens dat er veel ruis is op het moment. Wat maakt het aanbod van NetApp dan beter? “Wij zijn ervan overtuigd dat we het ook echt kunnen leveren. We slaan al 30 jaar data van klanten op. We kunnen ze precies laten zien data data verandert op het moment dat dit gebeurt. Verder gebruiken we open standaarden en technologieën en dataformats en laten we alle klanten hun eigen AI-modellen kiezen.”

Iedere organisatie een eigen datakaart

Het uiteindelijke doel van wat NetApp wil doen in dit gedeelte van de AI datastack wordt goed verwoord door Asad Khan, SVP en GM voor AI bij het bedrijf. Volgens hem is ongestructureerde data nog altijd niet volledig inzichtelijk gemaakt tot nu toe. Heel veel data is nog nooit verwerkt. Vaak werken organisaties met een kleine subset. Dat is op zich te begrijpen want dataprep kost tijd en geld. Organisaties laten in potentie ook behoorlijk wat liggen op deze manier.

Het doel vanuit NetApp is volgens Khan om iedere organisatie een eigen kaart te geven van alle data die het heeft. Daarbovenop komt MCP en daar weer bovenop gaat het om de AI-tooling die je los kunt laten op de data. Dit kan met StorageGRID als basis als een volledige product door organisaties afgenomen worden. Er is echter ook de nodige flexibiliteit.

Waar het in de basis op neerkomt is dat organisaties op deze manier een knowledge graph van de eigen data kunnen bouwen. Als we vragen hoeveel flexibiliteit NetApp kan bieden, geeft Khan aan dat dit vooral in de bovenste lagen zit. De basis, hoe NetApp de knowledge graph bouwt, is vrij opinionated, ook al kunnen organisaties ook met andere knowledge graphs aan de slag gaan. We krijgen wel het idee dat Khan dit eigenlijk liever niet ziet gebeuren. De voornaamste flexibiliteit zit in de keuze van wat organisaties gebruiken om de data uiteindelijk te bevragen. Iedere organisatie kan de modellen meenemen die het zelf wil gebruiken.

Console en OCI

Om het verhaal van NetApp rondom de (AI) datastack helemaal compleet te maken, kunnen we ook niet om de NetApp Console heen. Deze is niet nieuw, maar krijgt wel de nodige uitbreidingen.

NetApp Console is de omgeving waarmee je de gehele datainfrastructuur vanuit een centraal punt kunt beheren. Niet alleen ONTAP overigens, ook StorageGrid en E-Series, twee lijnen die de laatste jaren niet enorm veel aandacht meer krijgen, maar nog wel belangrijk zijn voor NetApp. De voornaamste boodschap rondom Console tijdens de conferentie is dat er meer autonome functionaliteit inkomt.

Met Console is het bedoeling dat je volledige hybride NetApp-omgeving kunt beheren. En zeggen we hybride, dan gaat het ook al snel over de integraties van NetApp met de hyperscalers. Voornaamste nieuws op dit vlak is dat ook Oracle Cloud Infrastructure een native ONTAP-aanbod krijgt, naast de al bestaande integraties met Azure, AWS en GCP. Dit zijn gezamenlijk ontworpen storagediensten die feitelijk van de hyperscalers zijn en ook door hen verkocht worden. De nieuwe dienst heeft de enigszins lange naam Oracle Cloud Infrastructure NetApp Storage Service gekregen.

De waarde van de clouddiensten is overigens vrij groot, begrijpen we uit antwoorden van Pravjit Tiwana op vragen van ons. Volgens hem is 55 procent van de nieuwe cloudklanten voor NetApp als geheel een nieuwe klant. Het is dus zeker niet zo dat het alleen maar upsell is vanuit het on-premaanbod. Dat maakt het cloudaanbod een gezond onderdeel van het bedrijf.

Ook het al wat oudere Cloud Volumes ONTAP (waarmee klanten ONTAP als het waren kunnen uitbreiden van on-prem naar de cloud) doet het volgens hem goed. Daar investeert NetApp nog altijd in, volgens hem, ook al krijgt het wat minder aandacht de laatste jaren. Hij heeft het over nog altijd duizenden klanten. Dit zijn klanten die het inzetten voor disaster recovery, maar ook klanten die graag alles zelf beheren, bijvoorbeeld vanuit het perspectief van kostenoptimalisatie.

Tot slot: Keystone Sovereign

Het laatste waar we het in dit artikel over willen hebben, is zeker niet het minst belangrijke. Althans, als je in Europa (of elders buiten de VS) woont en soevereiniteit hoog in het vaandel hebt staan. Keystone, het Storage-as-a-Service-aanbod van NetApp, krijgt namelijk een soevereine variant.

Waar soevereiniteit voorheen ging om waar je data stond, zien we steeds vaker dat andere zaken ook een rol gaan spelen. Denk aan wie er toegang heeft tot een dienst, de telemetrie die heen en weer gaat en in het algemeen transparantie over hoe data door netwerken gaan.

Met Keystone Sovereign verplicht NetApp zich tot het hosten van de metadata van de dienst binnen een soevereine cloud in Europa. Ook alle operationele zaken, zoals support en escalatie verlopen in en via Europa. Alle toegangs- en beheerprocessen zijn ook onder Europese controle en er is heldere documentatie beschikbaar.

Zeker met de toenemende populariteit van StaaS (bij NetApp groeit de dienst ieder jaar met dubbele cijfers) is de beschikbaarheid van een soevereine variant van Keystone voor organisaties goed nieuws voor onze regio.

Conclusie: sneeuwbal wordt steeds groter

NetApp heeft in enkele jaren tijd enorm sprongen gemaakt als het gaat om het aanbieden van unified storage, het beheer ervan en de specifieke uitdagingen die AI met zich meebrengt voor de storagelaag. Waar we enkele jaren geleden vooral schreven over een nieuwe lijn in een van de all-flash series van appliances van het bedrijf, veranderde dat vorig jaar fundamenteel met NetApp AFX.

Met NetApp Novus gooit het bedrijf er nog een schepje bovenop. Het is aan de ene kant een logisch vervolg als je het bekijkt van het het perspectief van disaggregatie, maar je moet het wel nog even ontwikkelen. Dat heeft het bedrijf gedaan. Geheugen en context komen steeds duidelijker naar voren in de stack van NetApp.

De vraag is op dit moment vooral of de stack die NetApp heeft ontwikkeld de juiste componenten bevat. Alle onderdelen lijken er te zijn. Van de dataprep via beheer en hybride cloudopties naar de snelste opslag van het moment, het is er allemaal. De weg ligt open, zou je zeggen, uiteraard met het voorbehoud dat de interesse in AI moet blijven bestaan.

De kans bestaat echter dat al deze componenten nog altijd niet onderscheidend gaan zijn en dat het uiteindelijke succes staat of valt bij iets anders. Kurian had het over vertrouwen. Daar zou de sleutel weleens kunnen liggen. En dan is het zonder meer een voordeel dat NetApp al zolang meegaat. Maar dat doen vrijwel alle andere storagepartijen ook. Het kunnen leveren van wat je belooft is op dit moment dus belangrijker dan ooit. Dat zorgt voor vertrouwen en uiteindelijk voor succes.