3min Devops

Spotify verlaagt Claude Code-tokenverbruik met 90 procent

Spotify verlaagt Claude Code-tokenverbruik met 90 procent

Spotify heeft een methode ontwikkeld om het tokenverbruik van Claude Code drastisch te verlagen. Via het interne ontwikkelaarsplatform Portal worden routinetaken zoals bestanden lezen en voorspelbare codegeneratie doorgestuurd naar goedkopere AI-modellen. In tests leidde dat tot een gemiddelde besparing van 90 procent op het tokenverbruik van Claude.

Het systeem draait op wat Spotify AiKA Modes noemt, ofwel agents die draaien op tijdelijke runtimes. Ontwikkelaars bepalen per mode welk model, welke instructies en welke MCP-tools worden ingezet, zonder dat ze losse infrastructuur of API-keys hoeven te beheren.

Spotify-engineer Dimitri Mazmanov testte de aanpak op een Java-monorepo. Hij configureerde twee modes, te weten een bulk-reader voor het lezen van meerdere bestanden en een code-writer voor voorspelbare codefragmenten. Beide modes maken gebruik van Google Gemini 2.5 Flash als worker-model, al ondersteunt Portal ook andere modellen.

Mazmanov stelt dat de agent overwegend niet hoeft na te denken maar als I/O functioneert. Dat is alsnog een kostbaar iets als dit door een AI-model gedaan moet worden. Deze I/O-operaties worden daarom weggehouden bij het dure Claude, zodat het frontier-model beschikbaar blijft voor taken die daadwerkelijk redenering vereisen.

Shunt stuurt het verkeer

De routing vindt plaats via een Claude Code-plugin genaamd Shunt. Deze onderschept via PreToolUse hooks grote bestandslezingen en leidt ze om naar de bulk-reader mode. Standaard worden reads van meer dan 350 regels geblokkeerd. Gerichte reads met offsets en limieten passeren wel.

De code-writer mode ontvangt een specificatie en een referentiebestand, genereert de code en schrijft die direct naar de disk. Claude hoeft de gegenereerde output daardoor niet in zijn eigen context te laden.

Duidelijke grenzen

Spotify benadrukt dat de worker-modellen niet geschikt zijn voor debugging, architectuurbeslissingen of mission critical redenering. Gedelegeerde analyse levert ook niet altijd de regelnauwkeurige informatie die Claude nodig heeft bij het bewerken van code. Daar komt bij dat delegatie doorgaans 10 tot 30 seconden duurt, terwijl Portal een harde limiet van 30 seconden per aanroep hanteert.

De bulk-reader en code-writer modes zijn publiek beschikbaar gesteld via AiKA, zodat ontwikkelaars ze kunnen hergebruiken of aanpassen voor eigen projecten.

Model routing is complex

Wat hier wordt omschreven is een vorm van model routing, dat op allerlei manieren te implementeren is. AI-aanbieders bieden zelf ook routing aan, al is dit afhankelijk van de context. Zo zijn chatvensters veelal voorzien van een “Auto”-optie, waarbij de complexiteit van een prompt bepaalt of een dure LLM wel nodig is.

Desondanks is model routing lang niet altijd effectief. Wie de keuze krijgt om bepaalde modellen te gebruiken en feitelijk geen verdere restricties ontvangt, kiest logischerwijs voor het beste beschikbare model. Voor organisaties die hun personeel wel de controle willen geven maar ook niet onnodig veel tokens verbranden, is er een dilemma. Momenteel is het voor de hand liggend om de duurste LLM’s enkel voor de meest complexe beroepen beschikbaar te stellen, maar ook dit is nog experimenteel. AI-modellen op de werkvloer zijn een te jong fenomeen om te kunnen rusten op best practices omtrent model routing. Het voorbeeld van Spotify is bovenal pragmatisch, met een duidelijk begrip van onnodige kosten. Daar valt al veel te winnen voor minder goed ingelichte organisaties.