Red Hat AI 3.5 draait om veiligheidsverificatie vooraf, multi-tenancy op gedeelde GPU-infrastructuur en observability. Ook agentic ontwikkeling krijgt een boost met AutoRAG en kant-en-klare agent templates.
Red Hat AI 3.5 moet organisaties de operationele basis geven om AI-workloads te draaien met dezelfde discipline als andere bedrijfskritische infrastructuur. Denk aan bewijsbare veiligheid, kostentoerekening en strak resourcebeheer.
Dat onder meer met de algemene beschikbaarheid van EvalHub. Daarmee kunnen teams modellen, RAG-opstellingen en agents vooraf doorlichten op risico’s en daar auditeerbare compliance-rapportage aan koppelen. In de modelcatalogus zijn ruim twintig gevalideerde modellen bijgekomen, waaronder Gemma 4 van Google, Nemotron 3 van Nvidia en Qwen van Alibaba Cloud. Die modellen krijgen naast performancebenchmarks nu ook Garak-veiligheidsscores en risicoscores voor PII-blootstelling en toxiciteit.
Meerdere huurders op dezelfde GPU’s
Het tweede zwaartepunt ligt bij gedeelde GPU-infrastructuur. Fair-share scheduling verdeelt capaciteit over tenants, terwijl priority-aware serving realtime inference beschermt en achtergrondtaken de restcapaciteit laat benutten. Voor wie hardere scheiding nodig heeft, ondersteunt Red Hat AI nu officieel hosted control planes op OpenShift Virtualization. Elke tenant krijgt dan een eigen control plane, met VM-isolatie bovenop gedeelde hardware.
Ook de distributie breidt uit. Volgens de releasenotes krijgt de scheduler voor distributed inference nieuwe scorers die KV-cachehergebruik verbeteren. llm-d loopt verder buiten OpenShift: algemeen beschikbaar op CoreWeave CKS en Microsoft Azure, met Amazon EKS als technology preview.
Agents met richtlijnen
Voor agentic toepassingen introduceert Red Hat AutoRAG, dat bedrijfsdatabronnen rechtstreeks koppelt aan agentapplicaties, inclusief meertalige documentondersteuning en contextual retrieval. De Responses API met ingebouwde RAG wordt algemeen beschikbaar, versterkt met NeMo Guardrails die kwaadaardige tool calls onderscheppen. In AI Hub verschijnen agent templates voor patronen als code review, documentverwerking en researchworkflows. Inference-Time Scaling past rekenkracht aan op de complexiteit van een vraag.
Aan de observability-kant komen er dashboards voor inference health, GPU-benutting en modelprestaties, plus per-user token metering voor showback. MLflow verzorgt visuele agentic tracing.
Red Hat AI 3.5 is per direct algemeen beschikbaar.