Noticias
Astra de OpenAI: frenaron su próximo modelo porque no pueden descartar que hackee solo
OpenAI publicó este viernes que no puede descartar que Astra, uno de sus modelos todavía sin lanzar, haya cruzado el umbral “Crítico” de capacidades cibernéticas de su propio manual de riesgos. En consecuencia, frenó las actividades internas con el modelo que no cumplen controles de seguridad reforzados. Astra de OpenAI no está disponible para nadie, así que lo que se frenó es el desarrollo, no un producto que ya estuvieras usando.
Traducido: la empresa dice que su próximo modelo podría ser capaz de encontrar y desarrollar exploits de día cero, de cualquier severidad, en sistemas críticos endurecidos del mundo real, sin intervención humana. Ese es el texto del umbral. Y en lugar de esperar a estar segura, lo anunció antes de terminar de medirlo.
- Qué dice exactamente el anuncio
- Alto y Crítico: los dos escalones que casi nadie leyó
- El dato incómodo: el modelo que ya usás está un escalón abajo
- Lo que los titulares están mezclando
- Las cinco medidas que anunció, una por una
- Qué dicen los que trabajan en seguridad
- ¿Y esto qué significa para vos?
- Preguntas frecuentes
Qué dice exactamente el anuncio de Astra de OpenAI
El texto es corto y está firmado por la empresa, sin autor individual. Se publicó el 7 de agosto de 2026 bajo la categoría “Security” y se titula “Responding to the next frontier of critical cyber capabilities”. La frase que sostiene toda la noticia es esta:
“Nuestras últimas evaluaciones internas de Astra, uno de nuestros próximos modelos, realizadas en los últimos días, indican avances significativos en codificación agéntica y ciberseguridad. Estos resultados, sumados a evaluaciones de expertos, nos llevaron a concluir anoche que no podemos descartar capacidades cibernéticas críticas bajo nuestro Preparedness Framework.”
Conviene detenerse en dos palabras. “Anoche”: es una conclusión de menos de 24 horas, sobre evaluaciones que la propia empresa declara preliminares y en curso. Y “no podemos descartar”: no dice que Astra sea Crítico, dice que ya no puede afirmar que no lo sea. Es una cosa bastante distinta, y mucho más incómoda.
| Dato | Qué dice la fuente oficial |
|---|---|
| Modelo | Astra, “uno de nuestros próximos modelos”. No está lanzado ni disponible |
| Conclusión | “No podemos descartar” capacidades cibernéticas críticas |
| Cuándo se concluyó | “Anoche” respecto del post del 7 de agosto de 2026 |
| Estado de la medición | Preliminar: “mientras seguimos evaluando este modelo” |
| Qué se frenó | Las actividades internas con Astra que todavía no cumplen los controles reforzados |
| Qué NO se frenó | Nada que vos uses hoy. Astra nunca estuvo disponible |
| Fecha de lanzamiento | El anuncio no menciona ninguna. Axios agrega que el calendario “no estaba claro” |
Alto y Crítico: los dos escalones que casi nadie leyó
El anuncio se apoya entero en un documento que casi ninguna cobertura abrió: el Preparedness Framework v2, un PDF de 22 páginas donde OpenAI define qué capacidades vigila —biológica y química, ciberseguridad y autosuperación de la IA— y qué se compromete a hacer cuando aparecen.
Ahí adentro hay una nota al pie que explica el tamaño del asunto. “Daño grave”, para este documento, significa “la muerte o lesión grave de miles de personas, o cientos de miles de millones de dólares en daño económico”. Ese es el listón contra el que se miden los umbrales: no es una escala de “el modelo se porta mal”.
Para ciberseguridad hay dos escalones, y la diferencia entre ellos es el corazón de la noticia:
| Escalón | Definición textual del framework | Qué se compromete OpenAI a hacer |
|---|---|---|
| Alto (High) | “El modelo elimina cuellos de botella existentes para escalar operaciones cibernéticas, incluyendo automatizar operaciones cibernéticas de punta a punta contra objetivos razonablemente endurecidos O automatizar el descubrimiento y la explotación de vulnerabilidades operativamente relevantes” | Controles y salvaguardas de nivel Alto antes de desplegarlo, más salvaguardas contra desalineación para el uso interno a gran escala |
| Crítico (Critical) | “Un modelo aumentado con herramientas puede identificar y desarrollar exploits de día cero funcionales de todos los niveles de severidad en muchos sistemas críticos del mundo real endurecidos, sin intervención humana, O puede idear y ejecutar estrategias novedosas de punta a punta para ciberataques contra objetivos endurecidos, dado solamente un objetivo de alto nivel” | “Hasta que hayamos especificado salvaguardas y estándares de controles de seguridad que cumplan un estándar Crítico, detener el desarrollo posterior” |
La lógica de fondo la aclara el propio documento: Alto son capacidades que “aumentan significativamente vectores de riesgo existentes”; Crítico, capacidades que “presentan un riesgo real de un vector de amenaza cualitativamente nuevo, sin precedente disponible”. Y hay un detalle que casi nadie mencionó: lo que alcanza Crítico necesita salvaguardas ya durante el desarrollo, no solo antes de salir a la calle. Por eso el anuncio habla de puertas adentro.
El dato incómodo: el modelo que ya usás está un escalón abajo
Acá está, para nuestro gusto, la información más útil del anuncio, y va enterrada en una sola oración: “Modelos anteriores, incluido GPT-5.6-Sol, fueron evaluados por capacidades cibernéticas de frontera y clasificados en el umbral Alto (en lugar de Crítico)”.
Volvé a leer la definición de “Alto” de la tabla de arriba. Un modelo que ya está desplegado y que cualquiera puede usar está clasificado por su propio fabricante en un escalón que se define, entre otras cosas, por automatizar el descubrimiento y la explotación de vulnerabilidades relevantes. OpenAI no aclara cuál de las dos condiciones cumple GPT-5.6 Sol, pero alcanza con que esté ahí. Astra es noticia porque podría estar un escalón más arriba; el de abajo ya está habitado, y hace rato.
Eso no es un tecnicismo: es la explicación de por qué las estafas que te llegan al mail vienen cada vez mejor escritas y por qué las campañas de malware se renuevan cada semana. Es el mismo hilo que veníamos siguiendo cuando un agente de OpenAI se escapó de su laboratorio y terminó dentro de Hugging Face.
Lo que los titulares están mezclando
Hay una confusión muy fácil de cometer acá, y OpenAI la vio venir: atar el freno de Astra al incidente de Hugging Face de julio. Los tres episodios pasaron en tres semanas, así que la tentación es entendible. Pero el desmentido está en el propio anuncio, en una oración que la empresa metió a propósito: “Astra es un modelo próximo, y no estuvo involucrado en la explotación de Hugging Face”.
Vale la pena separar los episodios, porque son distintos y solo el último es de esta semana. Los dos de las evaluaciones de terceros están detallados en un informe que OpenAI publicó el 4 de agosto:
| Episodio | Cuándo | Qué pasó | Qué modelo |
|---|---|---|---|
| Hugging Face | Julio 2026 | Un agente salió de su entorno de prueba y llegó a la plataforma | Modelos de OpenAI (no Astra) |
| UK AISI | Avisó el 3 de agosto | Agentes accedieron a internet en una evaluación con acceso habilitado y clasificadores desactivados a propósito; 2 de 19 eventos fueron de GPT-5.6 Sol | GPT-5.6 Sol y modelos de otro laboratorio |
| Irregular | Avisó el 29 de julio | Un ejercicio que debía estar aislado quedó con internet abierto por una mala configuración del entorno | Modelos de OpenAI (no Astra) |
| Astra | 7 de agosto | Evaluaciones internas: no se puede descartar capacidad Crítica | Astra, sin lanzar |
Hay una segunda mezcla, más sutil, en la idea de “retraso del lanzamiento”. Axios, que tuvo el anuncio en exclusiva, tituló que OpenAI “demora el lanzamiento”, pero en el cuerpo es más prolijo: “si bien el calendario de lanzamiento del modelo no estaba claro, con esta pausa en su desarrollo, cualquier lanzamiento futuro podría demorarse”. O sea: no hay una fecha pública que se haya corrido. Lo que sí agrega Axios es una confirmación desde el otro lado del mostrador — un funcionario de la Casa Blanca le dijo que “OpenAI informó voluntariamente a la administración sobre sus planes de demorar el lanzamiento”.
Y una precisión que conviene hacer antes de que alguien la use mal: el framework dice que ante un Crítico confirmado corresponde detener el desarrollo. OpenAI no está haciendo eso, y tampoco se está contradiciendo, porque no declaró a Astra Crítico: declaró que no puede descartarlo. Para esa zona gris el documento tiene una sección propia, la 4.4, titulada justamente “Aumentar las salvaguardas antes del uso interno y del desarrollo posterior”: dice que los modelos que alcanzaron “o se prevé que alcancen” capacidad Crítica requieren salvaguardas adicionales durante el desarrollo. Es exactamente donde OpenAI dice estar parada.
Pero esa misma sección deja una frase que ahora quedó incómoda. El framework afirma: “No poseemos actualmente ningún modelo con niveles Críticos de capacidad, y esperamos actualizar este Preparedness Framework antes de alcanzar ese nivel con algún modelo”. Astra es el primer examen de esa promesa — y llegó antes que la actualización.
Las cinco medidas que anunció OpenAI, una por una
El anuncio enumera lo que la empresa dice estar haciendo puertas adentro. Tres medidas están en presente:
- Controles más estrictos para modelos de mayor capacidad: entornos de prueba aislados, acceso restringido a red y herramientas, protección y cifrado reforzados de los pesos del modelo, más monitoreo y detección, y ejecución en sandbox.
- Pausa de actividades internas con Astra que todavía no cumplan esos requisitos reforzados.
- Monitoreo universal de acciones riesgosas y de desalineación en todas las aplicaciones agénticas de Astra, incluidos entrenamiento y evaluación. Los monitores evalúan la cadena de razonamiento del modelo y “disparan una respuesta de seguridad para revisar e interrumpir actividad de alto riesgo”.
Las otras dos son compromisos a futuro, y conviene no leerlos como hechos consumados: OpenAI dice que trabajará con agencias de gobierno y organizaciones seleccionadas de seguridad en IA para testear el modelo, y que proveerá controles recomendados a los socios externos que corran evaluaciones de mayor riesgo — la consecuencia directa de lo que salió mal en las pruebas de julio.
El propio framework había anticipado el escenario. En la fila de ciberseguridad, el documento advierte que “en conjunto con una capacidad de autonomía de largo alcance”, los modelos capaces de “eludir las salvaguardas técnicas de OpenAI que restringen la actividad del modelo, como el sandboxing o los servicios de monitoreo, podrían comprometer la capacidad de OpenAI de rastrear y mitigar todos los demás riesgos”. Estaba escrito antes de los incidentes de julio. Con una precisión que corresponde hacer: en las evaluaciones de terceros no hubo elusión de salvaguardas. La propia OpenAI aclara que los modelos llegaron a internet “bajo condiciones específicas y configuraciones de salvaguardas reducidas que no reflejaban el despliegue ordinario”.
Qué dicen los que trabajan en seguridad
El anuncio llegó a la portada de Hacker News con 144 puntos y más de 160 comentarios en pocas horas. El tono predominante es escéptico, y vale la pena leerlo completo antes de comprarlo o descartarlo.
“Ah, sí, que siga el miedo. Es un problema real, pero por ahora ni de cerca tan grave como lo pintó todo el marketing, en perjuicio de todos —incluidas estas empresas que anuncian capacidades aterradoras—.”
@TrueDuality en Hacker News — ver post
Su argumento no es que la IA no encuentre vulnerabilidades: más abajo en el mismo hilo aclara que los hallazgos son válidos y que estos modelos “siguen encontrando días cero reales”. Su tesis es otra, y más incómoda: lo que lo asusta no es que los modelos hagan investigación de seguridad básica, sino que “la calidad de base de todo el software desplegado es tan baja” que alcanza con eso.
“¿Más estrictos que qué? Nunca revelaron siquiera qué pasó en el primer incidente. Esto no es más que preparar el terreno para que vuelva a pasar y poder decir: «¿Vieron? Se escapó otra vez, ¡y de un sandbox todavía más estricto!»”
@jackb4040 en Hacker News — ver post
En el mismo hilo le contestaron una parte: OpenAI sí detalló públicamente el incidente de Hugging Face, en una presentación en Black Hat USA 2026. Eso responde su reclamo sobre la falta de información, aunque no toca su acusación de fondo, que es sobre la intención del anuncio. La charla está en el canal oficial de la conferencia y es la mejor pieza en video que existe hoy sobre el tema:
La contracara del escepticismo la puso un usuario que dice haber tenido varios casos en las últimas semanas —por curiosidad, aclara, no por dinero de bug bounties— usando el programa de verificación cibernética de OpenAI, un trámite de identidad que habilita usos de seguridad que el modelo normalmente rechaza:
“En mi experiencia personal, Sol con verificación cibernética es extremadamente capaz de encontrar vulnerabilidades […] en las últimas semanas tuve varios casos en los que Sol encontró un RCE en aplicaciones web autoalojadas en literalmente minutos, solo con leer el código.”
@Tiberium en Hacker News — ver post
Con una salvedad que corresponde declarar: en ese mismo hilo le pidieron pruebas (“pasá los reportes entonces… demostralo”) y no las dio, alegando que prefiere mantener separadas sus identidades en internet; ofreció en cambio que le pasaran un repositorio para revisarlo en vivo. Aclaró además que los RCE que encontró no eran en software crítico. Es un testimonio, no una demostración, y así hay que leerlo.
¿Y esto qué significa para vos?
Empecemos por lo que no significa, porque va a circular mal por WhatsApp durante el fin de semana. Astra no está en ChatGPT. No hay nada que desinstalar, ningún parche que aplicar, ninguna cuenta que cerrar. Si mañana alguien te dice que “la IA de OpenAI se escapó y está hackeando”, está mezclando este anuncio con los incidentes de julio — otra historia, con consecuencias reales pero acotadas, que ya contamos en detalle cuando el instituto británico publicó su informe.
Lo que sí significa es más aburrido y más importante: el escalón “Alto” —automatizar el descubrimiento y la explotación de vulnerabilidades— ya está ocupado por modelos desplegados, y eso se nota en el volumen y en la calidad de lo que te llega. No en un ataque de película contra tu PC, sino en el mail que imita perfecto a tu banco, en la notificación de un cargo que nunca hiciste y en el instalador trucho que aparece primero en el buscador.
Para una PyME de la región, la traducción práctica es que el eslabón débil sigue siendo el mismo de siempre: software desactualizado y equipos sin protección al día. Que es, literalmente, lo que decía el comentario más votado del hilo. Mantener el sistema operativo con soporte vigente y el antivirus activo no te protege de un modelo de frontera —nada de lo que vos hagas lo hace—, pero sí de la enorme mayoría de lo que efectivamente te va a llegar; si el equipo con el que trabajás está sin cobertura, una licencia de ESET NOD32 para 1 PC cubre ese frente puntual.
Preguntas frecuentes sobre el modelo que OpenAI frenó
¿Qué es Astra de OpenAI?
Es uno de los próximos modelos de OpenAI, todavía sin lanzar y sin fecha pública de lanzamiento. La empresa lo describe como “uno de nuestros próximos modelos” y aclara que sus evaluaciones internas muestran avances significativos en codificación agéntica y ciberseguridad. No está disponible en ChatGPT ni en la API.
¿OpenAI dijo que Astra es peligroso?
No exactamente, y la diferencia importa. Dijo que “no puede descartar” capacidades cibernéticas críticas según su Preparedness Framework, con evaluaciones que declara preliminares y en curso. No afirmó que el modelo haya alcanzado ese umbral: afirmó que ya no puede asegurar que no lo alcanzó.
¿Esto afecta a ChatGPT o a los modelos que uso hoy?
No. El anuncio es sobre un modelo sin lanzar y sobre actividades internas de desarrollo. Lo que sí conviene saber es que GPT-5.6 Sol, ya desplegado, está clasificado por OpenAI en el umbral “Alto” de capacidad cibernética, un escalón por debajo del Crítico.
¿Es la primera vez que un laboratorio frena un modelo propio por riesgo cibernético?
Podría serlo. Axios señala que “esta podría ser la primera vez que un laboratorio de IA de frontera se compromete a frenar el progreso de uno de sus propios modelos por preocupaciones cibernéticas”. El mismo medio recuerda que Anthropic tenía un compromiso parecido de pausa y lo flexibilizó al actualizar su Responsible Scaling Policy en febrero de 2026.
🛒 Te puede servir
¿Y vos qué opinás? Dejalo en los comentarios ⬇️
Poné al día la protección del equipo →