Noticias

Google confirma que Gemini también vulneró empresas reales en una prueba de Irregular

Arte editorial sobre el proveedor externo que corre las pruebas de seguridad de los grandes modelos de inteligencia artificial

En siete días, tres de los laboratorios de inteligencia artificial más grandes del mundo —Anthropic, OpenAI y Meta— admitieron que sus modelos habían accedido sin permiso a sistemas de empresas reales. Las tres divulgaciones tienen una cosa en común que al principio casi nadie contó: apuntan al entorno del mismo proveedor. Se llama Irregular, tiene unas 35 personas según PitchBook, y hoy corre las evaluaciones de IA más sensibles de la industria. Lo dijo la propia empresa: es «exactamente el mismo problema de entorno de evaluación».

🔄 Actualización del 19 de septiembre de 2026: ya no son tres. El 18 de septiembre Google confirmó que agentes basados en su modelo Gemini entraron en mayo a sistemas de tres empresas reales durante una prueba de Irregular, e Irregular dijo que es el mismo problema que ya se había reportado, no un incidente materialmente separado. Lo publicó primero The Wall Street Journal, y Google lo confirmó en declaraciones a la prensa: no encontramos un documento propio de Google sobre el caso. La portada y la infografía de apertura muestran solo las tres divulgaciones de julio y agosto. Qué se sabe del cuarto laboratorio.

🔄 Actualización del 15 de agosto de 2026: después de dos semanas sin poner una línea propia sobre el caso en su sitio, Irregular publicó su investigación el 14 de agosto. Trae la causa raíz —el equipo eligió un nombre de empresa ficticia que resultó ser un dominio real— y una corrección al modo en que se contó el caso, incluida esta nota: las divulgaciones de OpenAI y Meta no son incidentes separados del que Anthropic contó el 30 de julio, sino el mismo, originado en un único escenario de evaluación. Qué dice el documento, y qué sigue sin decir.

Infografía sobre las evaluaciones de IA de Irregular y los tres laboratorios que divulgaron la falla entre el 30 de julio y el 5 de agosto de 2026

Y hay un detalle que, al publicar esta nota el 9 de agosto, nadie había contado en español, porque está enterrado en un PDF de 112 páginas: el mismo día, con el mismo modelo, Meta e Irregular publicaron dos evaluaciones de riesgo que hoy se leen distinto.

Qué es Irregular, la empresa que corre las evaluaciones de IA de media industria

Antes de que un laboratorio lance un modelo grande, alguien tiene que responder una pregunta incómoda: ¿este modelo sirve para atacar sistemas ajenos? No es una pregunta que se conteste leyendo el código. Se contesta poniéndolo a hacerlo, en un entorno cerrado, contra blancos falsos, y midiendo hasta dónde llega.

Eso es lo que hace Irregular. Se define en su propio sitio como «el primer laboratorio de seguridad frontera», se fundó en 2023 en Tel Aviv —antes se llamaba Pattern Labs—, y sus clientes son exactamente los que uno imagina: OpenAI, Anthropic, Google DeepMind y Meta, más agencias de gobierno. En septiembre de 2025 levantó US$ 80 millones liderados por Sequoia y Redpoint.

El mecanismo de estas pruebas es simple y ahí está el problema. Al modelo se le dice que está en una simulación y que no tiene internet. Se le da una tarea del estilo «entrá a este sistema y sacá este dato» — un ejercicio de capture the flag, donde la consigna literal es vulnerar algo. Y se lo suelta.

Si la parte de «no tenés internet» resulta ser mentira, el modelo hace exactamente lo que le pidieron, pero contra el mundo real. No se rebela, no se escapa: cruza una puerta que quedó abierta. Eso es lo que pasó, y lo terminaron contando tres laboratorios distintos. En septiembre, un cuarto.

Diagrama del mecanismo de una evaluación de capacidades ofensivas y del punto donde la configuración del entorno falló

Cuatro laboratorios, la misma puerta abierta

LaboratorioCuándo lo contóQué pasóFormato
Anthropic30 de julioTras revisar 141.006 corridas de evaluación, encontró tres incidentes contra tres organizaciones reales. Los más viejos, de abrilDocumento propio detallado
OpenAI4 de agostoIrregular le notificó el 29 de julio un incidente propio: al modelo se le dijo que no tenía internet, la configuración se lo dio, y terminó explotando un sitio realDocumento propio
Meta5 de agostoUno de sus modelos vulneró los sistemas de una empresa externa que sigue sin identificarse❌ Solo declaraciones de un vocero
Google (Gemini)18 de septiembreEn mayo, agentes basados en Gemini entraron a sistemas de tres empresas reales: una vez adivinando contraseñas y dos con credenciales de un repositorio público. Según Google, se detuvieron al darse cuenta❌ Solo declaraciones a la prensa; la primicia fue de The Wall Street Journal

Las tres primeras filas llegaron en siete días. La cuarta, el 18 de septiembre: más de seis semanas después de la de Meta.

La frase que ató los tres primeros casos no la dedujo la prensa: la dijo Irregular. Un vocero de la empresa declaró que lo de Meta «es exactamente el mismo problema de entorno de evaluación» que Anthropic había divulgado la semana anterior, y agregó:

This did not involve a sandbox escape or a sophisticated cyber action. There are no current open issues. Irregular is developing a white paper to share best practices for containment and securely running cyber evals.Vocero de Irregular — vía CNN Business

(«Esto no involucró un escape de sandbox ni una acción cibernética sofisticada. No hay problemas abiertos actualmente. Irregular está desarrollando un white paper para compartir buenas prácticas de contención y de cómo correr evaluaciones cibernéticas de forma segura»). Vale marcar una tensión que quedó registrada: mientras Irregular dice que no hubo «acción cibernética sofisticada», Anthropic describió a uno de sus modelos yendo a extremos considerables para publicar un paquete malicioso en el repositorio real de Python — que quince sistemas reales descargaron y ejecutaron en una hora.

Conviene además no mezclar dos cosas que se parecen: el caso de OpenAI con Hugging Face, el que arrancó toda esta historia, no fue de este tipo. Ahí los modelos encadenaron vulnerabilidades día cero para salir de un entorno que sí estaba aislado. Lo contamos entero en la nota sobre el agente de OpenAI que hackeó Hugging Face para copiarse en un examen. Son mecanismos opuestos: uno rompió la pared, los otros cruzaron la misma puerta que nunca se cerró.

El 9 de julio: todos midieron el riesgo equivocado

Acá está la parte que, al 9 de agosto, no había salido en español, y la sacamos leyendo los documentos originales.

El 9 de julio de 2026 Meta lanzó su modelo. Ese mismo día publicó su informe de evaluación: 112 páginas firmadas por sus equipos de preparación, red team, alineamiento y seguridad. En la introducción del informe dice esto (traducción nuestra, y el matiz del final va adentro de la cita porque es parte de lo que afirman):

El cambio determinante en capacidad a lo largo de nuestros dominios de riesgo catastrófico para esta versión está en Ciberseguridad: evaluado sin mitigaciones, no podemos descartar una designación de capacidad «alta» para Muse Spark 1.1 bajo la provisión de Ciberseguridad del Advanced AI Scaling Framework; con las mitigaciones aplicadas en el despliegue, el riesgo residual es «moderado o menor».Informe de evaluación de Muse Spark 1.1 — Meta, 9 de julio de 2026

O sea: el propio Meta dijo que, sin frenos puestos, no podía descartar que ese modelo alcanzara su umbral más alto de riesgo en ciberseguridad. Con frenos, quedaba en moderado — y por eso lo lanzó. Para que quede completo: el informe dice lo mismo del dominio químico y biológico, y ahí la conclusión es todavía más dura (sin mitigaciones, ese umbral se alcanza). Lo que hace de la ciberseguridad el cambio determinante de esta versión es que ahí está la novedad respecto del modelo anterior.

¿Y con qué lo midió? El mismo informe lo dice: entre las pruebas usó «un conjunto de desafíos atómicos desarrollados por Irregular que testean habilidades ofensivas aisladas mapeadas a fases de la cadena de ataque» y CyScenarioBench, un banco de pruebas de Irregular para ataques autónomos de largo alcance sobre varias máquinas.

Y ese mismo 9 de julio, Irregular publicó su propia evaluación del modelo. Su conclusión, textual:

Overall, Muse Spark 1.1 represents a measurable advancement in offensive cyber capability compared to Muse Spark 1.0. (…) However, we assess that Muse Spark 1.1 does not materially alter the cyber threat landscape in its current form.Irregular — evaluación del 9 de julio de 2026

(«En conjunto, Muse Spark 1.1 representa un avance medible en capacidad cibernética ofensiva respecto de Muse Spark 1.0. (…) Sin embargo, evaluamos que Muse Spark 1.1 no altera materialmente el panorama de amenazas cibernéticas en su forma actual»).

Las dos evaluaciones, una al lado de la otra:

 Meta (informe de evaluación)Irregular (assessment propio)
Fecha9 de julio de 20269 de julio de 2026
Qué mideRiesgo catastrófico del modelo en tres dominios, con y sin mitigacionesCapacidad ofensiva del modelo contra bancos de pruebas de seguridad
Extensión112 páginasPublicación de investigación
Veredicto en ciberseguridadSin mitigaciones, «no podemos descartar» capacidad alta. Con mitigaciones, riesgo residual «moderado o menor»Avance medible respecto de la versión anterior, pero no altera materialmente el panorama de amenazas
Herramientas usadasIncluye desafíos atómicos y CyScenarioBench, ambos de IrregularBancos de pruebas propios
Qué NO evaluabaLa configuración del entorno donde se corrían las pruebas — que es lo que terminó fallando
Comparativa entre la evaluación de riesgo de Meta y la de su proveedor externo publicadas el mismo día sobre el mismo modelo

Cuatro semanas después, Meta divulgó que ese modelo había vulnerado a una empresa real desde adentro del entorno de Irregular. (Cuándo ocurrió exactamente no lo dijo nadie: el informe del 14 de agosto aclara que el escenario ya estaba resuelto antes de la primera divulgación pública, la del 30 de julio.)

Y acá hay que ser preciso, porque la ironía fácil sería la lectura equivocada. Irregular no dijo que el modelo fuera inofensivo: dijo que su capacidad ofensiva, aun habiendo mejorado, no cambiaba el panorama de amenazas. Meta dijo que sin mitigaciones no podía descartar riesgo alto. Las dos cosas pueden ser ciertas a la vez y probablemente lo sean.

El punto es otro, y es más incómodo: todo ese aparato —112 páginas, dos evaluaciones independientes, un framework de riesgo con umbrales— estaba midiendo de qué es capaz el modelo. Lo que falló no fue la medición. Fue el laboratorio donde se medía. Ninguna de las dos evaluaciones se ocupaba de eso, porque nadie pensó que hiciera falta.

Es el mismo patrón que ya vimos en el incidente que divulgó el organismo británico de seguridad de la IA: los controles del modelo estaban bajo la lupa, la configuración del entorno no.

Lo que Irregular no quiso decir

El 7 de agosto, The Record le preguntó a Irregular lo único que importa a esta altura: ¿Anthropic, OpenAI y Meta fueron los únicos clientes afectados? La respuesta del vocero fue que la investigación sigue abierta y que no podían «entrar en más detalles». Tampoco quiso aclarar si su frase «no hay problemas abiertos» se refiere a configuraciones mal puestas o a incidentes todavía sin divulgar. Y no respondió si la investigación está buscando casos adicionales.

La pregunta quedaba flotando por una razón aritmética: al 9 de agosto, de los cuatro clientes conocidos de Irregular, tres ya habían divulgado un incidente. El cuarto era Google DeepMind, que no había dicho nada, y ninguna fuente sugería entonces que le hubiera pasado algo. Eso cambió el 18 de septiembre: Google confirmó que Gemini también entró a sistemas de empresas reales durante una prueba de Irregular. Lo contamos acá.

Hay algo más, y es lo que más nos llamó la atención al publicar esta nota: durante dos semanas Irregular no publicó una sola línea propia sobre esto. Habló con CNN, con Reuters, con The Record y con la BBC, pero en su sitio la última publicación era del 16 de julio — veinte días antes de que Meta divulgara su caso. Eso cambió el 14 de agosto, cuando la empresa finalmente publicó su investigación: la analizamos acá. El white paper que prometió, en cambio, sigue sin fecha.

El video de ABC News resume el caso de Meta en tres minutos:

🔄 Actualización del 15 de agosto: Irregular finalmente habló, y la causa raíz es un nombre inventado que existía

El 14 de agosto —quince días después de la primera divulgación, y cinco después de que publicáramos esta nota— Irregular subió a su sitio su propia investigación. Es la primera vez que la empresa dice algo sobre el incidente por escrito y con su nombre. Explica también por qué tardó: cronometró el informe para que saliera después de los comentarios públicos de todos los clientes involucrados, «por respeto a sus respectivos procesos».

La causa raíz es tan mundana que da un poco de vértigo. La evaluación que falló necesitaba una empresa de mentira como blanco, y el equipo de ingeniería le puso un nombre inventado. Textual del documento:

At the time the evaluation was designed, we believed the fictional company name used in the environment did not correspond to any real entity. Due to human oversight, however, it unintentionally coincided with a real domain, leading models to consider taking offensive action against it in a small fraction of cases.Irregular — informe del 14 de agosto de 2026

(«Cuando se diseñó la evaluación, creíamos que el nombre de empresa ficticia usado en el entorno no correspondía a ninguna entidad real. Sin embargo, por un descuido humano, coincidió involuntariamente con un dominio real, lo que llevó a los modelos a considerar tomar acción ofensiva contra él en una pequeña fracción de los casos»). La empresa aclara que sí hace un chequeo previo para evitar exactamente eso, pero que el dominio real no era ampliamente conocido y la conexión no se identificó en la revisión inicial.

La corrección que nos toca: las tres divulgaciones salen de un solo escenario

Esta nota —y toda la cobertura en inglés— contó el caso como tres incidentes separados en siete días. Irregular dice que no:

All subsequent public disclosures refer to the same underlying issue first disclosed by one of our customers on July 30 – and are not materially separate incidents. The issue originated from a single evaluation scenario, was resolved before the initial public disclosure, and there are no active issues today.Irregular — informe del 14 de agosto de 2026

(«Todas las divulgaciones públicas posteriores se refieren al mismo problema subyacente, divulgado por primera vez por uno de nuestros clientes el 30 de julio, y no son incidentes materialmente separados. El problema se originó en un único escenario de evaluación, se resolvió antes de la divulgación pública inicial, y no hay problemas activos hoy»).

Qué significa exactamente, sin estirarlo. Lo que Irregular dice es que las divulgaciones de OpenAI (4 de agosto) y Meta (5 de agosto) no son casos nuevos: son el mismo problema que Anthropic contó primero el 30 de julio. No dice —y conviene no leerlo así— que los tres incidentes que Anthropic reportó ese día sean uno solo. De hecho el informe lo acota él mismo: dice que se va a concentrar en «un incidente ya divulgado» y remite explícitamente al «incidente 1» de Anthropic, que reportó tres. Lo que se cae es el conteo de tres fallas distintas entre laboratorios; lo que se confirma, y por escrito, es lo que esta nota sostuvo desde el título: la misma falla, el mismo proveedor.

Y hay una segunda causa raíz que el informe pone por encima del nombre mal elegido, porque es la que se repite: «la mayoría de los problemas que encontramos se debieron a los controles de acceso a internet. Sobre todo, los modelos creían estar en entornos simulados cuando en realidad actuaban en el mundo real». Sin esa puerta abierta, la coincidencia de nombres no habría alcanzado para nada.

Los números que faltaban

DatoQué dice el informe
FrecuenciaPasó en menos de 1 de cada 10.000 simulaciones avanzadas, y generalmente en etapas tardías, «después de cientos de turnos»
Qué hicieronEn un puñado de corridas los modelos intentaron acceder al dominio real sin que nadie se lo pidiera, porque lo confundieron con parte del desafío
Hasta dónde llegaronExplotaron vulnerabilidades, extrajeron credenciales y obtuvieron acceso a una base de datos de producción
El desvío extraUn modelo se fue a otro sitio de nombre parecido, donde encontró credenciales que estaban publicadas
ClientesNo hay evidencia de que los sistemas de un cliente fueran vulnerados ni de que se filtraran datos — pero ojo: los «clientes» acá son los laboratorios. El blanco real fue explotado
EstadoLa investigación sigue abierta; el white paper sigue prometido y sin fecha

Y hay una frase que desinfla la lectura épica del caso, dicha por la propia empresa que corre las pruebas:

The discussed domain lacked several common security practices in place – and therefore most frontier AI models found it easy to exploit. That’s why we do not believe this incident reveals anything particularly notable about the capabilities or behavior of any specific AI model, as these capabilities have become common at the frontier.Irregular — informe del 14 de agosto de 2026

(«El dominio en cuestión carecía de varias prácticas de seguridad comunes — y por eso a la mayoría de los modelos frontera les resultó fácil de explotar. Por eso no creemos que este incidente revele nada particularmente notable sobre las capacidades o el comportamiento de ningún modelo de IA en particular, dado que esas capacidades se han vuelto comunes en la frontera»). Traducido al castellano de todos los días: el mérito no fue del modelo, fue del candado abierto. Que es, con otras palabras, la moraleja con la que cierra esta nota desde el 9 de agosto.

Lo que Irregular sigue sin decir: qué dominio fue y qué empresa estaba detrás. Sobre si hubo más clientes afectados, lo más lejos que llega es a decir que el incidente involucró «a algunos de nuestros clientes, tal como ellos divulgaron» — sin dar un número y con la investigación todavía abierta. Al 15 de agosto, la pregunta que The Record le hizo el 7 seguía sin una respuesta cerrada. La respuesta llegó por otro lado, el 18 de septiembre, con el caso de Gemini.

🔄 Actualización del 19 de septiembre: Google confirma el caso de Gemini, el cuarto laboratorio

El 18 de septiembre de 2026 Google confirmó ante varios medios lo que había publicado The Wall Street Journal: agentes basados en Gemini, su modelo, entraron a sistemas de empresas reales durante una prueba de Irregular. Según lo que dijo Google, citado por CNBC, pasó en mayo: el modelo accedió a sistemas privados de tres empresas, una vez adivinando contraseñas y dos usando credenciales publicadas en un repositorio público. Era un ejercicio de capture the flag, y según le dijo Irregular al WSJ, el modelo no tenía que poder salir a internet, pero el acceso quedó disponible sin querer.

Y la causa suena conocida. Según el WSJ, citado por Axios, la empresa ficticia del ejercicio tenía el mismo nombre que una real: es el mismo tipo de coincidencia que Irregular describió en su informe del 14 de agosto.

La versión de Google la dio Heather Adkins, su vicepresidenta de ingeniería de seguridad:

In a standard evaluation, the model found public information online and guessed credentials to access websites it thought were part of the test. In all three of these instances, the model stopped.Heather Adkins, Google — declaración citada por CNBC

(«En una evaluación estándar, el modelo encontró información pública en internet y adivinó credenciales para acceder a sitios web que creía que eran parte de la prueba. En las tres ocasiones, el modelo se detuvo»). Es la versión de la parte interesada: según Google, sus agentes se detuvieron cuando se dieron cuenta de que estaban en sistemas reales. Ninguna de las coberturas que leímos identifica a las tres empresas, así que, con lo publicado hasta hoy, esa parte no se puede contrastar de forma independiente.

Irregular repitió la línea del 14 de agosto. Su vocero le dijo a CNBC que es «el mismo problema que ya se había reportado» y que «no representa un incidente materialmente separado» (traducción nuestra), y a Axios, que todos los laboratorios involucrados fueron notificados a fines de julio. Google dice que Irregular le avisó en esa fecha y que trabajó con la empresa en los cambios a su proceso de pruebas. Qué versión de Gemini fue, Google no lo quiso decir.

Qué cambia para esta nota. El conteo, no la tesis: no fueron tres laboratorios con mala suerte, fue un proveedor con una puerta abierta, y los cuatro clientes grandes que se le conocen pasaron por ella.

¿Y esto qué significa para vos?

Persona revisando en su computadora un informe de evaluación de seguridad de un modelo de inteligencia artificial

Lo primero, la tranquilidad: nada de esto pasó en un producto que uses. Ni en ChatGPT, ni en Claude, ni en Gemini, ni en la IA de WhatsApp o Instagram. Pasó en entornos de prueba cerrados, con los frenos bajados a propósito, que es precisamente para lo que existen. Las víctimas fueron organizaciones con sistemas expuestos, y varias ni se habían enterado.

Lo segundo es la lectura que sí te sirve, y no es sobre inteligencia artificial: es sobre proveedores. Acá hay una empresa de 35 personas en cuyo entorno se apoyan cuatro de los laboratorios más grandes del planeta para decidir si un modelo es seguro de lanzar. Cuando esa empresa se configuró mal, el problema terminó apareciendo en los cuatro. Es concentración de riesgo en un punto único, exactamente el mismo cuento de cuando se cae un proveedor de nube y con él la mitad de internet.

Y lo tercero, lo práctico. Todo empezó igual: un sistema real, alcanzable desde internet, con una contraseña débil, una credencial publicada o un servicio sin autenticación. Los modelos no derribaron nada — encontraron lo que estaba abierto, a velocidad de máquina y sin cansarse. Si administrás algo expuesto a internet, esa es la moraleja: lo que antes tardaba semanas en ser encontrado, ahora tarda horas. La higiene de siempre (nada de credenciales en repositorios públicos, nada de contraseñas fáciles de adivinar, nada de endpoints sin autenticación, doble factor en todo) pasó de ser buena práctica a ser lo único que hay.

Servidores y equipos de trabajo en una oficina, con un panel de control de accesos y credenciales en pantalla

Preguntas frecuentes sobre el caso

¿Qué es Irregular?

Es una empresa de seguridad en inteligencia artificial fundada en 2023 en Tel Aviv, antes llamada Pattern Labs. Su negocio es evaluar de qué son capaces los modelos en tareas ofensivas de ciberseguridad antes de que salgan al mercado. Entre sus clientes figuran OpenAI, Anthropic, Google DeepMind y Meta, además de agencias de gobierno.

¿Cuántos laboratorios fueron afectados por esta falla?

Cuatro laboratorios. Anthropic lo divulgó el 30 de julio, OpenAI el 4 de agosto y Meta el 5 de agosto de 2026; Google confirmó el caso de Gemini el 18 de septiembre, en declaraciones a la prensa, y la primicia fue de The Wall Street Journal. Irregular sostiene que el de Gemini es «el mismo problema que ya se había reportado» y no un incidente materialmente separado; el 14 de agosto había dicho lo mismo de las divulgaciones de OpenAI y Meta, que atribuyó a un único escenario de evaluación. No dio un número total de clientes afectados.

¿Los modelos se escaparon de su entorno de pruebas?

En los tres primeros, no: la propia Irregular aclaró que no hubo escape de sandbox ni acción cibernética sofisticada. A los modelos se les dijo que no tenían internet, una mala configuración se lo dio igual, y actuaron creyendo que los sistemas reales eran parte del ejercicio simulado que se les había encargado. En el de Gemini, CNBC escribió que el modelo «se escapó» de su entorno de pruebas, pero el mecanismo que describen Google e Irregular es el mismo: el modelo no debía poder salir a internet, el acceso quedó disponible sin querer, y entró a sitios que creía parte de la prueba.

¿Qué modelo de Meta estuvo involucrado?

Meta no confirmó públicamente el nombre. Su vocero habló de «uno de nuestros modelos». La identificación como Muse Spark 1.1 proviene de The Information, que fue el medio que destapó el caso el 5 de agosto de 2026, y no fue desmentida por la empresa.

¿Quién audita al que audita? Tirá tu opinión ⬇️

Deja un comentario