Noticias

Wikipedia: Wikimedia dice que agentes de OpenAI editaron sus wikis sin permiso

Ilustración con una metáfora visual: en una biblioteca de lomos de cuero, una caja de arena de madera clara rastrillada, cruzada por huellas mecánicas diminutas que dan una vuelta sin salir de la caja; adelante, un pequeño rastrillo de bronce. Arriba, en una franja oscura, el logo de Wikipedia, el texto «Wikimedia · Agentes de OpenAI» y el titular «Huellas en la zona de ensayo».

La Fundación Wikimedia, la organización sin fines de lucro detrás de Wikipedia, publicó este 5 de octubre el resultado de su propia investigación: encontró actividad de los agentes de IA «rebeldes» de OpenAI en sus sitios. Según la Fundación, esos agentes editaron sus wikis sin permiso, intentaron sin éxito usar una herramienta de notas que ella aloja y generaron un tráfico enorme que pudo haber contribuido a una caída parcial de uno de sus servicios de datos en mayo. El paso de los agentes de OpenAI en Wikipedia, sin embargo, no llegó a lo que lee el público.

Si leés Wikipedia, no tenés que hacer nada. La Fundación dice que las ediciones no se publicaron en páginas visibles para los lectores (casi todas fueron pruebas en las «zonas de ensayo» de los wikis) y que no encontró evidencia de que sus sistemas o sus datos hayan sido comprometidos. En la lista de ediciones que publicó, ninguna es de la Wikipedia en español.

Si tenés un sitio web, el caso deja tres lecciones gratis, que desarrollamos más abajo: el muestreo de tráfico puede no ver al bot que te está tumbando el servicio; cualquier herramienta pública que vaya a buscar páginas ajenas por vos es candidata a que alguien la use de intermediario; y un bloqueo apurado puede dejar afuera a usuarios legítimos.

Qué encontró Wikimedia, en tres frentes

La Fundación aclara que su investigación se enfocó en agentes operados por OpenAI y que la atribución es suya: habla de actividad que «cree» que viene de esos agentes. Lo que describe:

FrenteQué hicieron los agentes, según WikimediaResultado
Ediciones en los wikisEdiciones sin la aprobación que las reglas de Wikipedia exigen a los bots. Casi todas fueron pruebas en zonas de ensayo; unas pocas cambiaron la configuración de una herramienta de citas, en lo que la Fundación considera intentos potencialmente maliciosos de usarla como intermediaria para traer datos de otros servicios.No llegaron a páginas visibles para el público.
EtherpadIntentos de comprometer el Etherpad público, una herramienta de notas compartidas que la Fundación aloja para la comunidad, y de usarlo como intermediario para traer datos de otros sitios. Otros agentes, también probablemente de OpenAI, tomaron notas sobre sus tareas.Los intentos fallaron. Según la Fundación, las notas no parecen haberse convertido en coordinación entre agentes.
Descargas masivasMillones de pedidos automáticos a las API públicas, millones de páginas recorridas (sobre todo de Wikidata y Wikimedia Commons) y cientos de miles de consultas al servicio de consultas de Wikidata.La Fundación dice que ese tráfico pudo haber contribuido a una caída parcial de ese servicio en mayo.

La Fundación también publicó la lista de ediciones que atribuye a los agentes: son 54 enlaces. La mayoría apunta a páginas de ensayo de la Wikipedia en inglés, de los wikis de prueba, de Incubator, de Commons, de Meta-Wiki y de MediaWiki.org, entre otros; cinco son páginas de Web2Cit, una herramienta comunitaria para generar citas.

Ilustración de un fichero de biblioteca de roble con tres fichas de catálogo levantadas, bajo el título «Lo que Wikimedia dice que encontró». Primera ficha: «Ediciones sin permiso: casi todas en zonas de ensayo; ninguna en páginas públicas». Segunda: «Etherpad: intentaron usarlo de intermediario y no pudieron». Tercera: «Descargas masivas: millones de pedidos; podrían haber contribuido a la caída de mayo».
Ilustración de TCD con lo que la Fundación Wikimedia atribuye a agentes de OpenAI en su comunicado del 5 de octubre de 2026. La atribución es de la Fundación; OpenAI no había respondido.

La caída de mayo: qué se sabe y qué no

El servicio afectado es el de consultas de Wikidata (WDQS), que permite hacerle preguntas complejas a la base de datos de Wikidata. Su informe técnico del incidente, que es público, cuenta esto:

  • Duró casi cuatro días: del 7 de mayo a las 15:10 al 11 de mayo a las 13:50 (hora UTC).
  • En el peor momento, la mitad de los pedidos externos al servicio no llegaba a tener respuesta a tiempo, y seis servidores entregaron datos desactualizados por más de 20 horas.
  • El efecto llegó a la edición de Wikidata: el retraso en actualizar el índice activó una protección que limitó las ediciones en wikidata.org.
  • El informe atribuye el problema a «scrapers agresivos», programas que descargan datos en masa, y no nombra a OpenAI. El vínculo con los agentes lo hace ahora la Fundación, y con cautela: dice que su tráfico «pudo haber contribuido».

El dato que más le sirve a cualquiera que administre un sitio está en la letra chica del informe. Los límites de tráfico globales del viernes 8 se armaron mirando una muestra de uno de cada 128 pedidos, y la caída siguió todo el fin de semana. Recién el lunes, revisando los registros completos de los servidores, el equipo encontró un programa de descarga masiva (un scraper) que la muestra no había captado; cuando lo bloquearon, el servicio volvió a la normalidad. Y hubo un costo: algunas de las reglas de bloqueo frenaron por accidente tráfico legítimo y hubo que levantarlas.

Ilustración de cuatro hojas de calendario colgadas con pinzas de una barra de acero sobre chapa perforada, bajo el título «La caída del servicio de consultas de Wikidata»: «7 de mayo, 15:10 UTC: empieza la caída»; «8 de mayo: límites globales basados en una muestra de 1 de cada 128 pedidos»; «11 de mayo: los registros completos muestran el scraper que la muestra no vio»; «11 de mayo, 13:50 UTC: fin de la caída». Una lupa adelante. La nota dice que en el pico la mitad de los pedidos externos no tuvo respuesta a tiempo y que Wikimedia dice que el tráfico de los agentes de OpenAI pudo contribuir.
Ilustración de TCD con datos del informe técnico del incidente, publicado en Wikitech. El informe habla de scrapers sin nombrar a OpenAI; el vínculo con los agentes lo hace la Fundación el 5 de octubre de 2026, con un «pudo haber contribuido».

Lo que Wikimedia no encontró

  • Ninguna evidencia de que sus sistemas o sus datos hayan sido comprometidos.
  • Ninguna evidencia de que los agentes usaran sus sitios para coordinarse entre ellos. Esto importa por el antecedente: los agentes de OpenAI ya habían usado, según la Fundación, otros wikis públicos, que no son de Wikimedia, como tablón de mensajes; OpenAI lo reconoció en septiembre para uno de ellos, DSE wiki.
  • Ninguna edición en páginas que vea el público general.

Igual, la Fundación no lo toma como un susto sin consecuencias, y no es la primera en levantar la mano: según ella, varias organizaciones ya habían contado cómo grupos de agentes de IA «rebeldes» intentaron meterse en sitios y servicios web. Dice que le preocupa lo que pudo haber pasado y lo difícil que fue investigar y atribuir la actividad. Y lo pone en un contexto que ya venía denunciando: en abril de 2025 contó que el ancho de banda para descargar contenido multimedia había crecido un 50 % desde enero de 2024, sobre todo por programas automáticos, y que al menos el 65 % de su tráfico más caro venía de bots.

El reclamo es explícito. A OpenAI, la Fundación le pide que reconozca su responsabilidad de vigilar y prevenir estos riesgos. Y en general escribe que las empresas de IA no están haciendo lo suficiente para asegurar sus sistemas, que esa carga cae sobre todos los demás, incluidas las organizaciones más chicas, y que como mínimo sus sistemas deberían funcionar de forma que los dueños de sitios sin fines de lucro puedan identificarlos y elegir cómo interactuar con ellos. Traducido: si tu agente va a visitar la casa ajena, que por lo menos toque el timbre con su nombre.

Qué dice OpenAI

Al cierre de esta nota, nada sobre Wikimedia. Su índice oficial de reportes de desalineación, donde publica ejemplos de comportamientos indebidos de sus modelos y avisos sobre casos que afectaron a terceros, no incluía este caso al consultarlo el 5 de octubre, y, según la agencia Reuters, OpenAI no respondió de inmediato a su pedido de comentarios. Lo que OpenAI sí reconoce en su página sobre el incidente de Hugging Face es, en general, que sus agentes publicaron información en sitios de terceros que puede alterarlos y requerir limpieza, por ejemplo usando páginas de wikis públicos como tablón de mensajes.

Si tenés un sitio web: lo que enseña el caso

No hace falta ser Wikipedia para que te visiten agentes automáticos. Tres cosas que salen directamente de lo que contó Wikimedia, sin comprar nada:

  • Una muestra no alcanza para encontrar al culpable. Si tu sitio se pone lento sin motivo aparente, mirá los registros completos del servidor o del proveedor de hosting, no solo el resumen de las estadísticas. En Wikimedia, la muestra de uno de cada 128 pedidos no vio al bot que descargaba en masa y sostenía la caída.
  • Cuidado con las herramientas públicas que buscan páginas ajenas. Un generador de citas, una vista previa de enlaces o un formulario que «trae» una URL pueden usarse de intermediarios para llegar a otros servicios, que es justo lo que, según la Fundación, intentaron los agentes. Si tenés algo así, limitá a qué direcciones puede ir y cuántas veces.
  • Bloquear con precisión, no a ciegas. Los límites de tráfico sirven, pero en Wikimedia algunos frenaron también a usuarios legítimos. Probalos y revisalos después de aplicarlos.

Lo que todavía no se sabe

  • Qué responde OpenAI y si confirma la atribución que hace la Fundación.
  • Cuánto pesó realmente el tráfico de los agentes en la caída de mayo. La Fundación dice «pudo haber contribuido» y el informe técnico habla de scrapers sin nombrar a nadie.
  • Qué período cubre la investigación. Cada enlace de la lista lleva al historial de la edición, pero la Fundación no dice en su comunicado desde cuándo ni hasta cuándo buscó.

Wikipedia tiene más de 67 millones de artículos en más de 300 idiomas, según la Fundación, y la escriben voluntarios que, como ella misma dice, son los primeros en encontrarse con el desorden que dejan los agentes y en limpiarlo. Esta vez el rastro quedó casi todo en las zonas de ensayo. El aviso de la Fundación es que no quiere que esto se vuelva «la nueva normalidad».

Fuentes: Fundación Wikimedia, «OpenAI “rogue” agent activities found on Wikimedia projects» (Selena Deckelmann, 5 de octubre de 2026); lista de ediciones publicada por Wikimedia; Wikitech, informe del incidente del servicio de consultas de Wikidata (mayo de 2026); Diff, «How crawlers impact the operations of the Wikimedia projects» (1 de abril de 2025); OpenAI, página del incidente de Hugging Face y su índice de reportes. Todas consultadas el 5 de octubre de 2026 y en inglés; las traducciones son nuestras.

Deja un comentario