Dynatrace Intelligence stuurt aan op autonomous operations

Dynatrace Intelligence stuurt aan op autonomous operations

Dynatrace schuift zijn AI-functionaliteit sinds dit jaar onder één naam: Dynatrace Intelligence. Davis blijft bestaan en functioneert als kerncomponent vooral als root cause-skill. We spraken met SVP, Product Management – Observability Florian Ortner over hoe ingebouwde agents, Grail en DQL samen een basis vormen voor wat het bedrijf autonomous operations noemt.

De naam Davis is onder Dynatrace-gebruikers vrij bekend. Het was de enige AI-engine van het bedrijf, die uitsluitend werd ingezet rond incidenten en root cause-analyse. Hoewel die mogelijkheden zeer gewenst zijn, blijft dat met de mogelijkheden van AI vandaag de dag een beperkte inzet.

Wil je bijvoorbeeld je cloudkosten optimaliseren, dan gaat het niet enkel over incidenten. “We wilden ook iets hebben dat neutraler is voor verkennende, analytische toepassingen”, legt Ortner uit. Davis verdwijnt niet, maar is nu de root cause-skill binnen een bredere paraplu: Dynatrace Intelligence. Ortner vergelijkt het met Apple Intelligence, waar ook allerlei losse functies onder één vlag zijn geschoven.

Grail en Smartscape nu volledig gekoppeld

Onder de motorkap draait alles om enkele bouwstenen. Grail is de lakehouse waarin alle telemetrie landt. Smartscape is het topologische model dat vastlegt hoe componenten met elkaar verbonden zijn. Dat model staat niet apart, maar zit in Grail zelf.

Het verschil met simpelweg metrics en logs opslaan? Context. Komen een metric en een log uit dezelfde container, dan zie je die container in Dynatrace de twee signalen verbinden. Vervolgens kun je doorvragen naar de containers waarmee die praat. Het is een graph database om tussen datapunten te navigeren. Het werkt voor logs, spans, metrics en events.

Nieuw is dat Dynatrace het dus veel breder aan kan pakken. Alle telemetriesignalen die het platform verzamelt, worden opgeslagen en geanalyseerd in Grail, en gekoppeld via Smartscape. Die stap is volgens Ortner in fases over ongeveer een jaar gezet.

Agents die niet alle data aanraken

Het zwaartepunt van dit jaar ligt volgens Ortner bij de agentic aanpak. Dynatrace levert ingebouwde agents mee, waaronder een Root Cause Analysis-agent en een Analytics-agent. Die draaien autonoom op de data, maar triggeren nog niets.

Ze kijken bewust niet naar alles. Er stroomt een petabyte aan data per dag door het platform, en agents daarop laten lopen is volgens Ortner economisch onhaalbaar. Je zou er bij wijze van spreken een biljoen tokens per dag op verbranden, wat neerkomt op zo’n miljoen dollar per dag. Daarom gaat er eerst statistische, deterministische en algoritmische analyse over de data heen. Slechts een fractie belandt daarna bij een agent met volledige context en een LLM.

De agents staan standaard aan bij klanten op de laatste platformversie. Uitschakelen kan, maar gebeurt vrijwel nooit. Extra kosten zijn er niet: het zit in Dynatrace inbegrepen.

Garandeert Dynatrace dat die agents foutloos werken? Nee. Maar Ortner nuanceert: ook bij vroegere analyses was dat antwoord nee. Voor het ruizige werk waar Dynatrace vroeger nauwelijks aan toekwam, stelt hij dat de kwaliteit nu beter is dan ooit, simpelweg omdat er veel meer data wordt geanalyseerd.

DQL en de weg naar natuurlijke taal

Voor het bevragen van Grail bouwde Dynatrace zijn eigen querytaal: DQL. Er bestaan al PromQL en Splunks SPL, maar geen van die talen kon volgens Ortner het Smartscape-model doorlopen tijdens een query.

De tweede reden was inzetbaarheid verderop in de keten. DQL is niet alleen bedoeld voor analyse, maar ook voor ingest pipelines en datasources. Eén taal voor analyseren én configureren wat er wordt vastgelegd en hoe het wordt getransporteerd.

Hardcore DQL blijft expertwerk. Daarom trainde Dynatrace een eigen model dat natuurlijke taal omzet naar DQL. Ortner noemt een slagingspercentage dat van ongeveer 60 procent een jaar geleden naar zo’n 90 procent is gegaan, beter dan een generiek model op basis van de documentatie. Dat model is sinds drie tot vier maanden live en zit achter de Assist-chatinterface. Daarnaast is bij elk scherm en elke out-of-the-box alert de onderliggende DQL met één klik op te vragen, wat volgens Ortner duizenden voorbeelden oplevert.

OpenInference als OpenTelemetry voor AI

Dynatrace nam onlangs Arize over. Samen met een derde partij werkt het aan de OpenInference-standaard. Het uitgangspunt: AI-services mogen geen black box zijn wanneer ze voor klanten staan. Twee tot drie jaar geleden gebruikten AWS en anderen OpenTelemetry al als exportformaat, via OTLP, om klanten inzicht te geven. Met de opkomst van diensten als Bedrock werd standaardisatie urgenter en bleek OpenTelemetry op zichzelf niet toereikend.

De standaard begon als fork, maar het doel is een contribution die uiteindelijk in OpenTelemetry wordt opgenomen. OpenInference is een semantische conventielaag bovenop OpenTelemetry die spans en attributen standaardiseert voor LLM-calls, tool use, retrieval, agents en tokengebruik.

Minder ITOps, meer developers

Historisch richtte Dynatrace zich op ITOps en DevOps, omdat die de productieomgeving bezaten. Dat schuift. Bij grote bedrijven ziet Ortner minder klassieke ITOps-mensen en juist meer developers. Taken die Ops jaren terug deed, zijn al naar ontwikkelteams verhuisd.

Die twee groepen werken alleen totaal anders. Developers hebben een IDE open en vinden een command line geen probleem. Ze gebruiken de Dynatrace-UI vaak niet, maar wel de MCP-aanpak, API’s en command line interfaces. ITOps werkt met een UI, volgt training en een strak proces. En nog een verschil: developers kijken niet naar kosten. ITOps wil daar in elk geval over praten.

Tip: Dynatrace biedt ontwikkelaars nieuwe observability-tools

Autonomous operations met mens

Al die bouwstenen, agents, Grail-analytics en Smartscape, dienen volgens Ortner één doel: bedrijven laten wennen aan autonomous operations. Dat betekent niet dat de mens eruit gaat. Wat wel geautomatiseerd kan worden, is het handmatige, repetitieve werk. Een compliance check afvinken binnen tien minuten, bijvoorbeeld. Ortner spreekt veel klanten en hoort overal hetzelfde: te kleine teams, groeiende regeldruk en de wens om eenvoudige maar tijdrovende taken weg te automatiseren. Daar kan autonomous operations bij helpen, waar het human-in-the-loop-concept wel in overeind blijft.