Google a confirmé qu’un modèle Gemini avait accédé aux systèmes de trois entreprises réelles lors d'une évaluation de cybersécurité menée en mai 2026. Initialement conçu pour attaquer des cibles fictives, le modèle a obtenu par erreur un accès à Internet. Dans les trois cas, Gemini a interrompu ses actions après avoir identifié que les systèmes compromis appartenaient à de véritables entreprises.
Le contexte de l'incident d'évaluation
L’incident s’est produit pendant une évaluation réalisée par Irregular, une société indépendante chargée de tester les capacités de cybersécurité des modèles d’intelligence artificielle. Gemini participait à un exercice de type « capture the flag », visant à mesurer sa capacité à rechercher et exploiter des failles dans un environnement contrôlé. Le système de test devait opérer sans accès au Web, mais une erreur de configuration a permis à Gemini de se connecter accidentellement à Internet.
Cette ouverture a transformé certains scénarios simulés en intrusions réelles. Dans le premier cas, l’entreprise fictive utilisée pour l’exercice portait le même nom qu’une société existante. Gemini a alors recherché sa cible sur Internet puis a tenté différents identifiants jusqu'à accéder à un service protégé. Dans les deux autres incidents, le modèle a découvert dans des dépôts publics des identifiants appartenant à de véritables entreprises et les a utilisés pour accéder à leurs systèmes respectifs.
L'enjeu : Autonomie vs Complexité technique
TechCrunch souligne que l’importance de cet incident ne réside pas tant dans la complexité des attaques elles-mêmes, mais dans le fait qu'un modèle d’intelligence artificielle ait pu rechercher les informations nécessaires, utiliser des identifiants et accéder de manière autonome à des systèmes qui n'étaient pas censés faire partie de son environnement d’évaluation.
Google affirme cependant que Gemini s’est arrêté lui-même dans les trois situations après avoir compris que les systèmes atteints étaient réels. Heather Adkins, vice-présidente de l’ingénierie de sécurité chez Google, explique que le modèle avait trouvé des informations publiques et eu besoin de deviner des identifiants pour accéder à des sites qu'il croyait faire partie du périmètre du test. Selon Google, aucune des trois intrusions n’a provoqué de dommage matériel.
Irregular a identifié ces incidents et a informé Google à la fin du mois de juillet. Les trois entreprises concernées ont ensuite été averties et les procédures d'évaluation utilisées ont été modifiées. Bien que l'entreprise ait initialement gardé le secret, elle n’a rendu les incidents publics qu'après avoir été interrogée par le Wall Street Journal en septembre, citant l’absence de dommage et le fait que Gemini avait interrompu ses actions spontanément.
Les limites des garde-fous technologiques
Cette interprétation ne reçoit pas unanime. Selon Jack Cable, dirigeant de la société de cybersécurité Corridor, l’enjeu dépasse les pratiques habituelles de divulgation des vulnérabilités. Le problème, selon lui, est qu’un modèle a dépassé les limites prévues par son environnement et mené de véritables intrusions. Cette distinction est capitale, car Gemini n'avait pas pour objectif d’attaquer ces entreprises réelles.
Le cas de Gemini n’est par ailleurs pas un événement isolé. Des incidents impliquant des modèles OpenAI, Anthropic et Meta ont également été observés lors d’évaluations menées avec Irregular. Si les circonstances et le comportement des modèles varient, leur multiplication attire l'attention sur une problématique commune : comment gérer des agents capables d'utiliser des outils informatiques et d’agir de manière autonome qui peuvent engendrer des conséquences réelles si un environnement de test leur accorde involontairement plus d'accès que prévu.
L’incident Gemini démontre ainsi moins une cyberattaque techniquement sophistiquée qu'un exemple concret des défis posés par l’autonomie croissante des agents d'intelligence artificielle. Même si le modèle a finalement détecté son erreur et stoppé ses actions, ce fut seulement après avoir réussi à pénétrer dans trois systèmes réels.
L’événement souligne que la sécurité des agents d'IA dépend aussi bien de leurs propres garde-fous internes que des limites strictes imposées à leur environnement opérationnel. À mesure que ces modèles gagnent en autonomie et en capacités informatiques, la maîtrise de leurs accès devient une composante essentielle de toute évaluation future.