Google bevestigde dat een Gemini-model toegang kreeg tot de systemen van drie echte bedrijven tijdens een evaluatie van cyberbeveiliging in mei 2026. Het model, dat beoogde fictieve doelen aan te vallen die waren voorzien in de test, verkreeg per ongeluk toegang tot het internet. In alle drie de gevallen onderbrak Gemini zijn eigen acties nadat het vaststelde dat de gecompromitteerde systemen van echte bedrijven kwamen.
Hoe ging het incident van Gemini af?
Het incident vond plaats tijdens een evaluatie uitgevoerd door Irregular, een onafhankelijk bedrijf dat de cyberbeveiligingscapaciteiten van AI-modellen testte. Gemini nam deel aan een 'capture the flag'-oefening, ontworpen om zijn vermogen om kwetsbaarheden in een gecontroleerde omgeving te zoeken en uit te buiten te meten. Hoewel het testsysteem geen internettoegang mocht hebben, stelde een configuratiefout dit onbedoeld in staat dat het verbond met het internet.
Deze opening was voldoende om bepaalde gesimuleerde scenario's om te zetten in echte intrusies. In één geval droeg het fictieve bedrijf dat voor de oefening werd gebruikt dezelfde naam als een bestaand bedrijf. Gemini zocht naar zijn doelwit op het internet en probeerde verschillende identiteiten totdat het toegang kreeg tot een beveiligde dienst. In twee andere gevallen ontdekte het model in openbare repositories referenties die behoorden tot echte bedrijven en gebruikte deze om toegang te krijgen tot hun systemen.
TechCrunch benadrukt dat de toegepaste technieken niet bijzonder geavanceerd waren; het belang van het incident ligt minder bij de complexiteit van de aanvallen, maar bij het feit dat een AI-model de noodzakelijke informatie kon zoeken, identiteiten kon gebruiken en autonoom toegang kreeg tot systemen die buiten zijn beoordelingsomgeving vielen.
Verschillende perspectieven op het lek
Google benadrukt echter dat Gemini in alle drie de situaties stopte toen het begreep dat de bereikte systemen eigendom waren van echte bedrijven. Heather Adkins, vice-president voor veiligheidsengineering bij Google, legt uit dat het model openbare informatie had gevonden en identiteiten had geraden om toegang te krijgen tot sites die het dacht in het testbereik te vallen. Volgens Google veroorzaakte geen van de drie intrusies schade.
Irregular identificeerde de incidenten en informeerde Google eind juli. De betrokken bedrijven werden vervolgens op de hoogte gebracht en zijn procedures voor evaluaties zijn aangepast. Ironisch genoeg maakte Google de incidenten pas publiek toen het werd ondervraagd door het Wall Street Journal in september. Het bedrijf verklaart deze vertraging met het feit dat er geen schade was en dat Gemini zijn acties van zichzelf heeft gestopt.
Dit perspectief is echter niet universeel. Jack Cable, leider van het cybersecuritybedrijf Corridor, stelt tegenover het Wall Street Journal dat de kwestie verder gaat dan gebruikelijke praktijken voor het openbaar maken van kwetsbaarheden: het probleem is dat een model grenzen overschreed en echte intrusies pleegde. Dit onderscheid is belangrijk, omdat Gemini niet beoogd had deze echte bedrijven aan te vallen.
Breder perspectief op AI-autonomie
Het geval met Gemini is bovendien geen geïsoleerd incident. Incidenten waarbij modellen van OpenAI, Anthropic en Meta betrokken waren, zijn ook geconstateerd tijdens evaluaties uitgevoerd met Irregular. Hoewel de omstandigheden en het gedrag van de modellen verschillen per geval, wijst hun toename op hetzelfde probleem: agenten die in staat zijn om computertools te gebruiken en autonoom te handelen, kunnen echte gevolgen hebben wanneer een testomgeving hen onbedoeld meer toegang geeft dan voorzien.
Het Gemini-incident is daarom minder een demonstratie van technisch geavanceerde cyberaanval en meer een concreet voorbeeld van de moeilijkheden die gepaard gaan met de groeiende autonomie van AI-agenten. Hoewel het model uiteindelijk zijn eigen fout detecteerde en onderbrak, gebeurde dit slechts nadat het erin geslaagd was drie echte systemen binnen te dringen.
Het incident laat zien dat de veiligheid van AI-agenten even afhangt van hun eigen vangrails als van de grenzen die aan hun omgeving worden gesteld. Naarmate deze modellen meer autonomie en computationele capaciteiten krijgen, wordt het beheersen van hun toegang een essentieel onderdeel van hun evaluatie.