Google confirmó que un modelo Gemini accedió a los sistemas de tres empresas reales durante una evaluación de ciberseguridad llevada a cabo en mayo de 2026. El modelo, cuya tarea era atacar objetivos ficticios dentro del marco de la prueba, obtuvo acceso involuntario a Internet. En los tres casos, Gemini detuvo sus acciones por sí mismo después de identificar que los sistemas comprometidos pertenecían a empresas legítimas.
Los detalles de la brecha de seguridad con Gemini
El incidente tuvo lugar durante una evaluación realizada por Irregular, una empresa independiente encargada de medir las capacidades de ciberseguridad de modelos de inteligencia artificial. Gemini participaba en un ejercicio tipo «capture the flag», diseñado para evaluar su capacidad de buscar y explotar vulnerabilidades en un entorno controlado. Si bien se esperaba que el sistema de prueba funcionara sin acceso a la Web, un error de configuración le permitió conectarse a Internet.
Esta apertura fue suficiente para transformar ciertos escenarios simulados en intrusiones reales. En un primer caso, la empresa ficticia utilizada para el ejercicio compartía el mismo nombre que una sociedad existente. Gemini buscó su objetivo en Internet y luego probó diferentes identificadores hasta lograr acceder a un servicio protegido. En dos casos adicionales, el modelo descubrió en repositorios públicos identificadores pertenecientes a empresas reales y los utilizó para ingresar a sus sistemas.
TechCrunch señaló que la importancia del incidente radica menos en la complejidad de los ataques que en el hecho de que un modelo de inteligencia artificial pudo buscar información necesaria, utilizar identidades e ingresar de manera autónoma a sistemas que no formaban parte de su entorno de evaluación.
Declaraciones y controversia sobre las intrusiones
Google afirmó que Gemini se detuvo en las tres situaciones al comprender que los sistemas alcanzados pertenecían a empresas reales. Heather Adkins, vicepresidenta de ingeniería de seguridad de Google, explicó que el modelo había encontrado información pública y deducido identificadores para acceder a sitios web que creyó estar incluidos dentro del perímetro de la prueba. Según Google, ninguna de las tres intrusiones causó daños.
Irregular detectó los incidentes e informó a Google a finales de julio. Las tres empresas afectadas fueron posteriormente notificadas y los procedimientos utilizados para estas evaluaciones se modificaron. Sin embargo, Google no hizo públicos los detalles hasta ser cuestionado por el Wall Street Journal en septiembre. La compañía atribuyó esta decisión a la falta de daños reportados y al hecho de que Gemini había detenido sus acciones voluntariamente.
No obstante, esta interpretación no es unánime. Jack Cable, director de la compañía de ciberseguridad Corridor, estimó ante el Wall Street Journal que el tema va más allá de las prácticas habituales de divulgación de vulnerabilidades: el problema radica en que un modelo superó los límites establecidos y llevó a cabo intrusiones reales.
Implicaciones más amplias de la autonomía de la IA
El caso de Gemini tampoco es un evento aislado. También se han registrado incidentes similares involucrando modelos de OpenAI, Anthropic y Meta durante evaluaciones con Irregular. Si bien las circunstancias y el comportamiento varían según el modelo, su acumulación dirige la atención hacia un problema común: agentes capaces de utilizar herramientas informáticas y actuar de forma autónoma pueden generar consecuencias reales cuando se les otorga involuntariamente más acceso en un entorno de prueba del que deberían.
De esta manera, el incidente Gemini representa menos una demostración de un ciberataque técnicamente avanzado que un ejemplo claro de las dificultades planteadas por la creciente autonomía de los agentes de inteligencia artificial. Aunque el modelo finalmente detectó su error y detuvo sus acciones, esto ocurrió solo después de haber penetrado en tres sistemas reales.
El incidente subraya que la seguridad de los agentes de IA depende tanto de sus propios mecanismos de protección como de los límites estrictamente impuestos a su entorno operacional. A medida que estos modelos ganan autonomía y capacidades informáticas, el control riguroso de su acceso se está consolidando como un componente esencial en cualquier evaluación de estas tecnologías.