Beveiligingsonderzoekers van Pillar Security zeggen een nieuwe aanvalstechniek te hebben ontdekt waarbij een AI-agent een tweede, krachtigere AI-agent manipuleert om acties uit te voeren waarvoor de eerste zelf geen rechten heeft. De kwetsbaarheid werd aangetroffen in de GitHub-repository van Google’s Agent Development Kit (ADK) voor Python en illustreert een nieuw aanvalsvlak voor organisaties die meerdere AI-agents inzetten binnen hun ontwikkelstraat.
De onderzoekers spreken van de eerste praktijkvoorbeelden van een zogeheten “agent-to-agent”-aanval in een productieomgeving. Anders dan bij bekende prompt-injectionaanvallen richt de aanval zich niet op één AI-agent, maar op de vertrouwensrelatie tussen meerdere agents die binnen dezelfde CI/CD-pijplijn samenwerken. Google’s ADK voor Python is bovendien breed in gebruik, met inmiddels meer dan 90 miljoen downloads.
Vertrouwen tussen agents blijkt zwakke plek
In de onderzochte repository draaiden verschillende agents met uiteenlopende bevoegdheden. Een publiek toegankelijke agent analyseerde GitHub-issues en pull requests, terwijl een tweede agent namens maintainers taken uitvoerde met aanzienlijk ruimere rechten.
Volgens de onderzoekers ontstond het probleem doordat beide agents elkaars output impliciet vertrouwden. Via een prompt injection in een pull request kon de eerste agent een opdracht genereren voor de tweede, die vervolgens met hogere rechten acties uitvoerde. Volgens Pillar Security had dit in theorie kunnen leiden tot misbruik van GitHub-tokens, toegang tot Google Cloud-accounts en uiteindelijk een software supply chain-aanval.
Onderzoeker Dan Lisichkin waarschuwt dat hiermee een nieuw type aanval ontstaat waarvoor veel bestaande dreigingsmodellen nog geen rekening houden. Volgens hem gaat het niet langer uitsluitend om de beveiliging van afzonderlijke AI-agents, maar ook om de manier waarop zij onderling samenwerken.
De aanval bestond uit meerdere stappen. Eerst diende een aanvaller een ogenschijnlijk legitieme pullrequest in om vertrouwen op te bouwen. Daarna volgde een tweede pull request met een prompt injection die de publieke AI-agent ertoe bracht een geprivilegieerde agent in te schakelen. Zo ontstond een geloofwaardige keten van geautomatiseerde goedkeuringen, terwijl de uiteindelijke acties feitelijk door de aanvaller waren gestuurd, vult The Register aan.
Google zag geen aanleiding voor bug bounty
Google heeft de kwetsbaarheid inmiddels verholpen door de workflow van de repository aan te passen. Een financiële beloning voor de melding bleef echter uit. Volgens het bedrijf vereiste de aanval nog altijd dat een menselijke maintainer de kwaadaardige pull request zou goedkeuren. Daardoor was sprake van een aanval die mede afhankelijk was van social engineering en kwam deze niet in aanmerking voor het bug bounty-programma.
Pillar Security stelt dat traditionele beveiligingsmaatregelen voor AI-agents hiermee niet langer volstaan. Volgens de onderzoekers moeten agents ieder een eigen identiteit en een strikt afgebakend rechtenprofiel krijgen, zodat zij niet zonder aanvullende controles opdrachten kunnen doorspelen aan agents met meer bevoegdheden.