6min Security

FOMO in AI-land: ook Meta meldt incident met hackend AI-model

FOMO in AI-land: ook Meta meldt incident met hackend AI-model

De timing van security-incidenten bij AI-spelers is bijzonder. Na OpenAI en Anthropic meldt nu ook Meta dat een van haar modellen op eigen houtje een ander bedrijf heeft gehackt tijdens een test. Dat klinkt allemaal erg onheilspellend (en is het misschien ook wel). Maar het is ook vrij logisch met de focus op cybersecurity bij de verschillende aanbieders van AI-modellen.

Als er een schaap over de dam is, volgen er meer. We krijgen sterk het idee dat dit spreekwoord ook opgeld doet in de wereld van AI. Dat was al zo aan het begin van de moderne AI-revolutie. Toen kwam Google heel snel met een (niet bijster goed) antwoord na de officiële lancering van OpenAI’s ChatGPT. Daarna is het eigenlijk nooit meer opgehouden. Komt Anthropic met een model dat zich specifiek richt op cybersecurity? Dan kun je er vergif op innemen dat OpenAI er ook snel mee komt.

Met bovenstaande in het achterhoofd is het niet gek dat er in de laatste weken een stroompje aan meldingen van security-incidenten bij de hoofdrolspelers in de AI-film is losgekomen. Toen OpenAI met Hugging Face-incident kwam, was het min of meer wachten op de volgende speler die met iets soortgelijks kwam. Die kwam er dan ook. Dat was toen Anthropic aangaf dat ook Claude op eigen houtje aan de gang waren geweest om andere organisaties te hacken.

Meta doet ook mee

Meta is nu de volgende die aangeeft dat een van haar AI-modellen een ander bedrijf heeft gehackt tijdens een cybersecurity-test. Volgens Meta was dit incident mogelijk doordat er een (configuratie-)fout werd gemaakt bij een partner. Opvallend genoeg is dat dezelfde partner die we ook al eerder tegenkwamen bij het incident bij Anthropic, namelijk Irregular. Deze fout zorgde ervoor dat het model tijdens de test toegang had tot het internet. Dit was niet de bedoeling.

Meta gaat in een statement dat elders wordt aangehaald nog wat dieper in op het incident. Dat wil zeggen, het wil expliciet duidelijk maken dat het model “een kwetsbaarheid in een third-party dienst misbruikte op een manier die lijkt op wat andere bedrijven eerder hebben gemeld”. Het zou specifiek gaan om het Muse Spark 1.1-model.

Incidenten bij AI-modellen zijn logisch

Dat AI-modellen kunnen worden ingezet om hacks uit te voeren, is op zich niet zo vreemd. Sterker nog, de manier waarop dit soort modellen werken maakt ze ideaal voor dit doeleinde. Als het een opdracht krijgt om iets te doen, en er is een manier om succesvol te zijn, dan zal een dergelijk model niet rusten tot het is gelukt. Zeker als er in testomgevingen minder security-beperkingen zijn. Ook in het geval van Meta nu per ongeluk internettoegang beschikbaar komt, zijn de mogelijkheden nagenoeg eindeloos voor de modellen.

De nadruk die er sinds de geheimzinnige aankondiging van Mythos eerder dit jaar ligt op de security-mogelijkheden van AI-modellen, maakt het logisch dat er veel mee wordt geëxperimenteerd. Dan kan het gebeuren dat er iets niet goed gaat. Al zou je mogen verwachten van bedrijven die hier serieus mee aan de slag gaan dat ze uitermate voorzichtig omgaan met dit soort experimenten. Dat blijkt dus niet het geval te zijn.

Is er ook een andere drijfveer?

Het zou ons echter ook niet verbazen als er toch ook een zekere mate van marketing actief is in de reacties op het incident bij OpenAI en Hugging Face. Als iedereen scherper gaat inzien dat AI-modellen veel problemen veroorzaken als ze niet kort gehouden worden, zullen ze eerder geneigd zijn om voor ‘volwassen’ modellen met extra securitylagen te kiezen. Daarnaast zijn dit soort incidenten ook een uitstekende manier om de kracht van de AI-modellen nog wat beter onder de aandacht te krijgen.

Dat laatste werd ook al gezegd toen Anthropic met Mythos kwam. Het wilde het niet meteen beschikbaar wilde maken voor iedereen, omdat het te gevaarlijk zou zijn. Als Anthropic het toch niet beschikbaar maakt, waarom maakt het er dan wel zo’n heisa om? Dan had het beter helemaal kunnen zwijgen. OpenAI deed overigens vrijwel exact hetzelfde ergens aan het begin van 2019. Toen stelde het eveneens dat het iets ontwikkeld had dat te gevaarlijk was om uit te brengen. Het ging toen om GPT-2, waar uiteindelijk een veel kleinere versie van werd uitgebracht.

Incident bij OpenAI was anders

Let wel, de incidenten bij Anthropic en Meta zijn van een andere orde dan die bij OpenAI. Bij Anthropic en Meta gaat het eigenlijk om vrij banale configuratiefouten. Bij het incident bij OpenAI gaat het echter om AI agents die op eigen houtje een kwetsbaarheid vinden en uit de sandbox ontsnappen.

Dat laatste is een stuk verontrustender dan configuratiefouten. Configuratiefouten zijn mensenwerk, bij OpenAI ging het duidelijk voorbij aan menselijk toezicht. Wat ons betreft zijn de incidenten bij Anthropic en Meta dan ook eigenlijk helemaal niet zo interessant. Het zou ons ook niets verbazen als dit soort incidenten veel vaker voorkomen. Als je zaken niet goed configureert, dan pakt AI zijn vrijheid. En configuratiefouten blijven een van de belangrijkste problemen in cybersecurity. Dat maakt een plus een wat ons betreft twee.

Rondom het incident bij OpenAI gingen er ook stemmen op dat dit allemaal wel erg goed uitkomt voor het bedrijf. Men impliceerde dat OpenAI het bewust had gedaan. Het wil immers maar al te graag aantonen hoe krachtig de AI-modellen wel niet zijn. Wat ons betreft is dit niet heel waarschijnlijk, want dit incident maakt dit soort modellen alleen maar minder interessant voor organisaties. Het straalt daarnaast slecht af op OpenAI als bedrijf. Dat werkt aan technologie dat het overduidelijk niet in de hand heeft. Het kan immers op eigen houtje uit een sandbox ontsnappen via een kwetsbaarheid die OpenAI zelf ook nog niet had gevonden.

Al met al is het goed om alles wat er voorbijkomt op het gebied van AI-modellen en wat ze allemaal kunnen en niet kunnen goed te wegen. Sommige dingen zijn daadwerkelijk goed om in de gaten te houden, andere een stuk minder. Een zekere mate van FOMO is te verwachten.

Kijk en/of luister ook naar een recente aflevering van Techzine Talks, waar we onder andere ingaan op het onderwerp van dit artikel (en nog veel meer):