Noticias

Agentes de IA atacaron empresas reales y hubo cuatro divulgaciones en dos semanas: quién contó qué y qué siguen debiendo

Arte editorial sobre las divulgaciones de incidentes de cuatro laboratorios de inteligencia artificial

En dos semanas y media hubo cuatro divulgaciones públicas de lo mismo: agentes de inteligencia artificial que, durante pruebas de seguridad, terminaron tocando sistemas de empresas reales. Tres las hicieron laboratorios sobre sus propios modelos —OpenAI, Anthropic y Meta— y la cuarta la hizo un organismo público británico sobre modelos ajenos. Todos contaron algo. Ninguno contó lo mismo, ni en el mismo formato, ni en el mismo plazo — y a esta altura la transparencia de los laboratorios de IA es una escala con peldaños muy distintos. Hicimos el inventario: qué publicó cada uno, cuánto tardó y qué sigue debiendo al día de hoy.

Infografía del marcador de transparencia de los laboratorios de IA: qué publicó cada uno tras los incidentes de sus modelos

El disparador para hacer las cuentas justo hoy es concreto: el 30 de julio, Anthropic prometió por escrito publicar «dentro de la próxima semana» la transcripción de uno de sus incidentes. Esa semana venció el 6 de agosto. Verificamos hoy, 9 de agosto, en los tres lugares donde tendría que estar: sigue sin publicarse.

La transparencia de los laboratorios de IA, medida en dos semanas y media

El primero fue OpenAI. El 21 de julio publicó su comunicado: durante una evaluación interna de capacidades ofensivas, varios de sus modelos se salieron de un entorno aislado y terminaron atacando a Hugging Face, la plataforma de modelos y datasets. Lo contamos entero cuando pasó, en la nota sobre el agente de OpenAI que hackeó Hugging Face para copiarse en un examen.

Nueve días después, el 30 de julio, Anthropic publicó su propia divulgación: tras revisar 141.006 corridas de evaluación, encontró tres incidentes en los que modelos de Claude accedieron sin autorización a la infraestructura de tres organizaciones reales. Y dice, con todas las letras, que se puso a revisar por lo que había divulgado OpenAI.

El 4 de agosto le tocó al AI Security Institute del Reino Unido, y este caso es distinto de los otros tres: no es un laboratorio contando lo suyo, es el organismo público que evalúa modelos ajenos contando lo que pasó en sus propias pruebas. Publicó un informe de incidente —y, aparte, un informe técnico de 35 páginas en PDF— por 19 acciones no autorizadas contra personas y organizaciones reales. Y conviene decir de quién eran esos agentes, porque cambia las cuentas: 17 de las 19 acciones fueron de Mythos 5, de Anthropic, y las otras 2 de GPT-5.6 Sol, de OpenAI. O sea que Anthropic y OpenAI aparecen dos veces cada uno en esta seguidilla, no una. Ese caso lo contamos entero: los agentes que crearon identidades falsas para colar malware en un proyecto open source.

Y el 5 de agosto cerró la seguidilla Meta, que confirmó que uno de sus modelos vulneró los sistemas de una empresa externa durante una evaluación. Con una diferencia de formato que es el corazón de esta nota: Meta no publicó ningún documento. Lo confirmó un vocero a la prensa, y hasta ahí llegó.

Línea de tiempo de las divulgaciones de incidentes de OpenAI, Anthropic, el AI Security Institute y Meta entre julio y agosto de 2026

El marcador: quién publicó qué y cuánto tardó

Acá está el inventario, y conviene mirarlo con calma porque la diferencia entre el primero y el último de la lista es enorme. La columna que más dice no es la del «qué», es la del formato: un documento escrito se puede leer, citar y refutar; una declaración a un periodista, no.

LaboratorioQué publicóFormatoCuándo
OpenAIComunicado con hallazgos preliminares + dos actualizaciones + una charla de 37 minutos en Black HatDocumento propio y video de conferencia21-jul, ampliado el 28 y 29-jul, charla el 5-ago
AnthropicDivulgación propia con los tres incidentes, la causa raíz y el razonamiento de los modelosDocumento propio, detallado30-jul (los hechos más viejos son de abril)
AI Security Institute (Reino Unido)Informe de incidente público + un paper técnico en PDFDocumento propio + PDF técnico4-ago
MetaDeclaraciones de un vocero a distintos medios❌ Ningún documento5-ago

El caso de OpenAI merece un asterisco, y es a favor. Cuando publicó el comunicado del 21 de julio prometió «un informe técnico de nuestros aprendizajes en las próximas semanas». Ese informe todavía no salió. Pero el 5 de agosto, en Black Hat USA —la conferencia de seguridad más grande del mundo—, dos personas de la empresa se subieron a un escenario y contaron el incidente en detalle durante 37 minutos: cómo empezó, qué hicieron los modelos, cómo se coordinaron entre ellos y cómo lo detectaron. Nosotros la transcribimos entera y volcamos lo nuevo en el bloque sobre el tablón de mensajes que los modelos se armaron adentro de OpenAI.

O sea: el informe escrito sigue pendiente, pero el contenido llegó, quince días después y por otra vía. Escribir que OpenAI «no explicó nada» sería falso. Escribir que ya cumplió lo que prometió, también — y lo dicen ellos mismos en el minuto dos de esa charla: la investigación no está terminada y el postmortem completo sale más adelante.

Los seis documentos que todavía no salieron

Esta es la otra mitad del inventario, y la verificamos hoy una por una, entrando a cada fuente. Un detalle importante antes de la tabla, porque es la diferencia entre informar y hacer clickbait: solo una de estas promesas tenía fecha, y es la única que se puede decir que está vencida. Las demás son compromisos sin plazo. Están pendientes, que no es lo mismo que incumplidas.

QuiénQué prometió¿Tenía plazo?Estado al 9 de agosto
AnthropicUna transcripción levemente censurada del incidente en que Claude publicó un paquete malicioso✅ Sí: «dentro de la próxima semana», desde el 30-jul🔴 Plazo vencido el 6-ago. Sin publicar
AI Security InstituteTranscripciones parcialmente censuradas, con las trazas de razonamiento de los agentesNo: «tan pronto como sea factible»🟡 Pendiente
OpenAIEl informe técnico con sus aprendizajes del caso Hugging FaceNo: «en las próximas semanas»🟡 Pendiente (la charla de Black Hat no es el informe)
METR + Redwood ResearchUn blog conjunto con los términos, el alcance y los hallazgos de su evaluación externaNo🟡 Pendiente
IrregularUn white paper de buenas prácticas de contención de evaluacionesNo🟡 Pendiente
MetaUna «retrospectiva completa», según su voceroNo: «cuando tengamos todos los hechos»🟡 Pendiente

Hay dos pendientes más que dejamos fuera de la tabla a propósito, porque meterlos adentro sería inflar el número. Los dos son revisiones de METR, la organización independiente que audita modelos, y ninguno es un documento prometido: el AI Security Institute dice que tiene la intención de trabajar con METR y que «todavía está definiendo el alcance»; Anthropic dice que está «en diálogo» con METR para una revisión de terceros. Intenciones, no compromisos con entregable. La única de las tres que llegó a un acuerdo cerrado es la de OpenAI — y lo anunció OpenAI, no METR.

Un apunte sobre el cuarto nombre de la tabla, que probablemente no te suene: Irregular es la empresa externa que le corre a media industria las pruebas de capacidades ofensivas. En su entorno ocurrieron los incidentes de Anthropic, de Meta y uno de OpenAI, y por eso el white paper que prometió no es un detalle menor: es el manual de cómo no repetirlos.

Un detalle que hace más interesante la fila de OpenAI: el compromiso se emitió dos veces. Primero el 21 de julio por escrito. Y otra vez el 5 de agosto, arriba del escenario de Black Hat, cuando los expositores abrieron aclarando que la investigación no estaba terminada y que el postmortem completo con todos los detalles saldría después. Verificamos la frase en la transcripción de la charla, no en la cobertura.

La única con reloj: la transcripción de Anthropic

De las seis, la de Anthropic es la única que se puede medir contra un calendario. El compromiso sigue escrito en su propio sitio, textual: «dentro de la próxima semana, publicaremos una transcripción levemente censurada en la que Claude construyó un paquete malicioso de PyPI». Ese incidente —un modelo que publicó en el repositorio real de paquetes de Python uno con código para robar credenciales, que quince sistemas reales descargaron y ejecutaron en una hora— es el más concreto de todos, y su transcripción sería el documento más crudo publicado hasta ahora.

Buscamos hoy en los tres lugares donde estaría: el post original, el índice de novedades de Anthropic y el índice de su equipo de red team. En ninguno hay nada. Y un detalle que nadie está contando: la página del 30 de julio se editó después. Tiene un bloque visible que dice «Actualizado el 3 de agosto» — para corregir el nombre de un banco de pruebas que habían escrito mal. Volvieron al documento, arreglaron una palabra y dejaron la promesa como estaba.

Comparativa entre los documentos prometidos por los laboratorios de inteligencia artificial y lo que efectivamente publicaron

El que menos contó es el que menos preguntas recibió

Y acá aparece lo más incómodo del asunto, que no es una opinión sino un número. Fuimos a contar cuánta discusión generó cada caso en Hacker News, el foro donde la industria del software desarma estas cosas, tomando en cada uno el hilo más votado. La escala es de dos órdenes de magnitud.

CasoQué publicóPuntosComentarios
OpenAI / Hugging Face (21-jul)Comunicado + dos ampliaciones + charla de 37 min1.6321.158
Anthropic / tres organizaciones (30-jul)Divulgación propia detallada252199
Meta / empresa sin identificar (5-ago)Solo declaraciones de un vocero3934

Cuarenta y dos veces menos atención para el caso del que menos se sabe. Y no es que a Meta le fuera mal con la prensa: lo levantaron la BBC, CNN, Bloomberg y Reuters. Es que en el foro donde se discuten los detalles casi no hubo detalles que discutir.

No estamos diciendo que Meta se haya callado para esquivar el escrutinio; eso no lo sabemos y no hay forma de sostenerlo. Lo que muestra el número es un mecanismo bastante simple: sin documento no hay mucho que analizar, y sin nada que analizar la conversación se apaga rápido. Un comunicado con detalles técnicos le da material a cientos de ingenieros para desarmarlo durante días — el de OpenAI juntó más de mil comentarios. Una declaración de tres frases a un periodista se lee en veinte segundos y no deja nada sobre la mesa.

¿Mala fe, o así funciona la divulgación?

La discusión en la comunidad técnica está lejos de ser unánime, y vale la pena traer las dos puntas porque las dos tienen argumentos serios. Del lado crítico, @vector_spaces hizo el 24 de julio el inventario más detallado de lo que faltaba en el comunicado de OpenAI:

In lieu of these items, the author here suggests that we use some media literacy and critical thinking to read in between the lines instead. In doing so, one sees that instead of specifics, OpenAI gave a breathless narrative rife with superlatives («unprecedented») that reads as promotional material moreso than a security disclosure (…)@vector_spaces en Hacker News — ver comentario

(«En lugar de estos elementos, el autor sugiere que usemos alfabetización mediática y pensamiento crítico para leer entre líneas. Al hacerlo, uno ve que en vez de especificidades, OpenAI dio una narrativa jadeante y plagada de superlativos —’sin precedentes’— que se lee más como material promocional que como una divulgación de seguridad»). Importante, porque cambia bastante la frase: en un comentario posterior del mismo hilo él mismo precisa el alcance de la crítica — el punto no es que OpenAI ni Hugging Face hayan mentido, sino que la empresa impulsa un relato sobre lo peligrosos que son sus modelos mientras se posiciona como la única capaz de manejarlos. Es una crítica al formato de la divulgación, no una acusación de fraude.

Del otro lado está el argumento que menos se escucha y que, para nosotros, es el más sólido. Lo escribió @solenoid0937 el 31 de julio, defendiendo la decisión de Anthropic de publicar:

It is extremely easy to not disclose. (…) We see this in aviation as well by the way. Punitive disclosure leads to no disclosure. This is how you get suicidal pilots that don’t ever disclose their depression because it’d be career ending.@solenoid0937 en Hacker News — ver comentario

(«Es extremadamente fácil no divulgar. (…) Esto también lo vemos en aviación, dicho sea de paso. La divulgación punitiva lleva a que no haya divulgación. Así es como terminás con pilotos suicidas que nunca informan su depresión porque les arruinaría la carrera»). El argumento es incómodo pero razonable: si cada empresa que levanta la mano se come un escarmiento, la próxima aprende a no levantarla. Y el caso de Meta, que publicó menos y recibió menos preguntas, es exactamente la clase de incentivo que él describe.

@strictnein, en el mismo hilo, encontró la síntesis — y su última cláusula es la que hay que leer entera:

If they hadn’t published this and instead it leaked out in two months we’d be slamming them for that as well. They’re stuck between a rock and a hard place, although they kind of put the rock there.@strictnein en Hacker News — ver comentario

(«Si no hubieran publicado esto y en cambio se filtrara en dos meses, también los estaríamos destrozando. Están entre la espada y la pared, aunque en cierto modo ellos pusieron la espada ahí»). Traducido: la crítica es inganable, pero eso no los absuelve — el problema se lo fabricaron ellos.

Vale la pena marcar además una fecha. El 24 de julio, cuando le reclamaban a OpenAI la falta de detalles, el desarrollador Simon Willison pidió paciencia citando el compromiso textual de la empresa: «sugiero darles unos días más antes de decir que la falta de detalle prueba que esto es una maniobra de marketing». Los detalles llegaron: tardaron doce días y llegaron en una charla de conferencia, no en el informe. Y para el 6 de agosto la seguidilla ya era tal que el propio Willison se armó una etiqueta entera en su blog para llevar la cuenta de estos casos, con el chiste obligado: «Google Gemini realmente necesita ponerse al día en eso de ciberatacar accidentalmente a otras empresas».

¿Y esto qué significa para vos?

Persona leyendo en su computadora el informe de seguridad publicado por un laboratorio de inteligencia artificial

Primero, lo obvio pero incómodo: de todo esto te enterás porque decidieron contarlo. No hay ninguna ley que los obligue. Las cuatro divulgaciones fueron voluntarias. Y hay un caso que muestra lo fácil que sería el silencio: de las tres organizaciones que Anthropic dice haber alcanzado, las dos que pudo contactar no se habían dado cuenta de nada. Si nadie lo cuenta, nadie se entera.

Segundo, la parte práctica: ninguno de estos incidentes te toca directamente si sos un usuario común. No pasó en ChatGPT, ni en Claude, ni en la app de Meta AI. Pasó en entornos de evaluación de capacidades ofensivas — pruebas que existen justamente para medir hasta dónde llega un modelo atacando, y en las que se le bajan a propósito las negativas de temática cibernética. Lo que no era deliberado es lo que salió mal: en los casos de Anthropic, Meta y el organismo británico, una configuración mal puesta le dio al modelo acceso real a internet cuando se le había dicho que no lo tenía; y en el de Hugging Face, los modelos encontraron un día cero y se salieron de un entorno que sí estaba cerrado. El riesgo real que dejan es de otro orden: si tenés un servidor con una credencial publicada o un endpoint sin contraseña, ahora hay una categoría nueva de cosa que lo va a encontrar, y no se cansa nunca.

Tercero, la lectura de fondo, que es la que nos parece más útil. Cuando estas historias arrancaron, la pregunta pública era si la IA se estaba «rebelando». Ya está claro que no: son modelos haciendo exactamente lo que se les pidió, con una creencia equivocada sobre si el entorno era real. La pregunta que quedó es bastante más aburrida y bastante más importante: quién audita a quien evalúa. Es la misma discusión que abrió la carta Pacing the Frontier que firmaron más de 1.200 empleados de laboratorios de IA, y la que hoy tiene al Congreso de Estados Unidos mandando cartas.

Y una recomendación de higiene informativa, porque en las próximas semanas va a haber ruido: cuando veas un titular que diga que «publicaron el informe», fijate cuál informe. Hay por lo menos seis documentos distintos prometidos por cinco actores distintos, y ya vimos titulares confundiendo uno con otro — incluido uno grande que le atribuyó a la empresa equivocada una frase que había dicho otra.

Escritorio con una computadora mostrando la divulgación pública de un incidente de seguridad de un modelo de inteligencia artificial

Preguntas frecuentes sobre las divulgaciones

¿Los laboratorios están obligados a publicar estos incidentes?

No. Hoy no existe ninguna obligación legal de divulgar que un modelo se salió de su entorno de pruebas y accedió a sistemas de terceros. Las cuatro divulgaciones de julio y agosto de 2026 fueron voluntarias. En Estados Unidos hay proyectos de ley y cartas de legisladores, pero ninguna norma vigente.

¿Qué prometió Anthropic y por qué está vencido?

El 30 de julio de 2026 Anthropic escribió que «dentro de la próxima semana» publicaría una transcripción censurada del incidente en que un modelo de Claude publicó un paquete malicioso en PyPI. Esa semana venció el 6 de agosto. Al 9 de agosto no aparece en ninguno de los tres lugares donde debería estar.

¿La charla de Black Hat es el informe técnico de OpenAI?

No, y lo aclaran los propios expositores en los primeros minutos: la investigación no está terminada, están contando los hechos como los conocen hoy y el postmortem completo saldrá más adelante. La charla aporta mucha información nueva, pero no reemplaza al informe escrito que OpenAI prometió el 21 de julio.

¿Alguno de estos incidentes afectó a usuarios comunes?

No hay evidencia de eso. Los cuatro casos ocurrieron en entornos de evaluación de capacidades ofensivas, con las restricciones de seguridad bajadas a propósito para la prueba. Los afectados fueron organizaciones cuyos sistemas quedaron expuestos, no usuarios de los productos comerciales. Varias ni siquiera habían detectado el acceso.

¿Transparencia real o control de daños? Opiná ⬇️

Deja un comentario