3min Security

Gemini hackt drie bedrijven tijdens securitytest

Gemini hackt drie bedrijven tijdens securitytest

Een AI-model van Google is tijdens een beveiligingstest binnengedrongen bij drie bedrijven. Gemini kreeg onbedoeld toegang tot internet en wist externe systemen te bereiken. Het model stopte volgens Google telkens zelf toen het ontdekte dat het omgevingen van andere organisaties had benaderd.

De incidenten vonden in mei plaats tijdens een test van beveiligingsbedrijf Irregular, schrijft The Wall Street Journal. Gemini nam deel aan een zogeheten capture-the-flag-oefening, waarbij het informatie moest achterhalen bij een fictief bedrijf. Dat bedrijf had echter dezelfde naam als een bestaande onderneming. Door een fout in de testopzet konden de AI-agents bovendien het openbare internet bereiken, terwijl dat niet de bedoeling was.

In één geval probeerde Gemini wachtwoorden totdat het toegang kreeg tot een beveiligd systeem. Tijdens twee andere testruns zocht het model op internet naar informatie over het bedrijf. Daarbij vond het in openbare repositories inloggegevens van andere ondernemingen. Gemini gebruikte die gegevens vervolgens om toegang te krijgen tot hun systemen.

Volgens Google stopte het model in alle gevallen zodra het doorhad dat het systemen van andere organisaties had bereikt. De drie getroffen ondernemingen zijn geïnformeerd, evenals Amerikaanse federale autoriteiten. Google wil niet zeggen welke versie van Gemini bij de tests werd gebruikt. Het bedrijf meldt wel dat het niet om zijn nieuwste model ging.

Google ziet geen ontspoord model

Google beschouwt de incidenten niet als zogeheten model misalignment, waarbij een AI-model tegen de bedoelingen of waarden van zijn ontwikkelaars ingaat. Het bedrijf wijst er juist op dat de veiligheidsmaatregelen werkten: Gemini herkende uiteindelijk de fout en beëindigde zijn acties.

Die uitleg is niet onomstreden. Jack Cable, ceo van AI-beveiligingsbedrijf Corridor, stelt tegenover The Wall Street Journal dat het vooral relevant is dat een AI-agent zelfstandig buiten de grenzen van zijn opdracht opereerde en systemen van andere organisaties wist binnen te dringen.

Google werd eind juli door Irregular over de incidenten geïnformeerd, maar maakte ze niet zelf openbaar. Het bedrijf bevestigde de hacks nadat The Wall Street Journal er vragen over stelde.

Eerdere incidenten met AI-agents

Het incident staat niet op zichzelf. Irregular was ook betrokken bij vergelijkbare tests met modellen van OpenAI, Anthropic en Meta, waarbij AI-agents eveneens systemen van andere organisaties wisten te bereiken.

Irregular zegt tegen CNBC dat dezelfde technische fout ook een rol speelde bij die eerdere incidenten. Google heeft naar aanleiding van de gebeurtenissen samen met Irregular het testproces aangepast.

De incidenten roepen de vraag op hoe AI-agents veilig kunnen worden getest wanneer ze zelfstandig tools kunnen gebruiken, op internet kunnen zoeken en beveiligingsproblemen kunnen opsporen. Daarnaast speelt de vraag wanneer AI-bedrijven dergelijke incidenten openbaar moeten maken.