En los primeros 72 horas de septiembre de 2026, los tres grandes laboratorios de IA hicieron algo sin precedentes. Anthropic, OpenAI y Google DeepMind lanzaron versiones “cyber” restringidas de sus modelos frontera — no como un producto separado, sino como una segunda configuración del mismo modelo base, con safeguards aflojados y acceso limitado a defensores verificados. El detonante: GPT-6 Astra se convirtió en el primer modelo comercial de la historia en cruzar el umbral “Crítico” del Preparedness Framework de OpenAI para capacidades de ciberseguridad.
Qué ocurrió en esos 72 horas
El 1 de septiembre, Anthropic publicó Claude Fable 5.1 y Claude Mythos 5.1 — el mismo modelo, dos configuraciones de salvaguardas. Fable 5.1 está disponible para todo el mundo; Mythos 5.1 tiene salvaguardas más permisivas pero solo se entrega a organizaciones verificadas a través del Cyber Verification Program y el Life Sciences Verification Program, este último desarrollado con el gobierno de EE.UU.
El 2 de septiembre, Google DeepMind lanzó Gemini 3.8 Flash y Gemini 3.8 Flash Cyber. La variante Cyber — diseñada específicamente para defensores — está disponible solo mediante el nuevo Fairwind Program, que da acceso a gobiernos y socios de confianza para proteger infraestructura crítica. Google ya lo usó internamente: su equipo de Cloud Vulnerability Research encontró una vulnerabilidad crítica fundamental en menos de dos horas con este modelo, cuando el proceso manual suele tardar meses.
El 3 de septiembre, OpenAI lanzó GPT-6 Astra. Dos días antes, había publicado “Path to Astra”, un post que decía algo que ningún laboratorio había dicho antes sobre un modelo a punto de lanzarse: cumple el umbral Crítico para capacidades de ciberseguridad. Es el primer modelo al que OpenAI designa a este nivel.
Qué significa “Crítico” en el Preparedness Framework
El Preparedness Framework de OpenAI define cuatro niveles de riesgo de ciberseguridad: bajo, medio, alto y crítico. Un modelo alcanza el nivel Crítico si cumple cualquiera de estas condiciones:
- Puede identificar y desarrollar exploits funcionales de zero-day de todos los niveles de severidad en muchos sistemas críticos del mundo real, sin intervención humana.
- Puede diseñar y ejecutar estrategias novedosas de punta a punta para ciberataques contra objetivos endurecidos, dado solo un objetivo de alto nivel.
GPT-5.6 Sol, el modelo anterior, estaba clasificado como “Alto”. Astra no es una mejora incremental: es significativamente más eficiente en tokens y más capaz en identificación de vulnerabilidades y desarrollo de exploits. En los benchmarks internos de OpenAI, Astra alcanzó 100% en ExploitBench, 42.4% en ExploitGym. Durante las pruebas, encontró dos vulnerabilidades zero-day previamente desconocidas.
La versión comercial de Astra tiene salvaguardas que restringen las capacidades ofensivas más avanzadas. El acceso menos restringido está disponible mediante el programa Daybreak, que da a los defensores de ciberseguridad una versión con menos restricciones para casos de uso defensivo: validación de vulnerabilidades, análisis de malware, y detección.
El patrón estructural: un modelo, dos puertas
Lo que pasó en esos tres días no fue coincidencia. Los tres laboratorios llegaron a la misma conclusión al mismo tiempo: cuando un modelo de IA es lo suficientemente bueno en ciberseguridad, ya no puedes simplemente lanzarlo con un único set de salvaguardas. O lo restringes tanto que es inútil para los defensores legítimos, o lo abres tanto que creas riesgo de uso ofensivo.
La solución que todos adoptaron es la misma arquitectura: un modelo, dos puertas. Una configuración con salvaguardas completas para uso general, y otra con salvaguardas relajadas para usuarios verificados con casos de uso defensivo. Anthropic lo llama Fable/Mythos. OpenAI lo llama Astra/Daybreak. Google lo llama Flash/Flash Cyber vía Fairwind.
Esto representa un cambio estructural en cómo se lanzan los modelos de IA frontera. Hasta ahora, el paradigma era: entrena el modelo, añade salvaguardas, publícalo. Ahora es: entrena el modelo, evalúa si cruza umbrales críticos, y si los cruza, crea dos variantes con niveles de acceso distintos, programas de verificación separados, y monitoreo reforzado para la versión menos restringida.
Métricas y arquitectura: los números
GPT-6 Astra
- Precio: $10/$50 por millón de tokens (input/output)
- ExploitBench: 100%
- ExploitGym: 42.4%
- SRE-Bench (ingeniería inversa): 99.2%
- Zero-days encontrados durante testing: 2
Claude Fable 5.1 / Mythos 5.1
- Intelligence Index de Artificial Analysis: 66 (el más alto jamás medido)
- Agentic Index: 61 (también el más alto)
- Terminal-Bench 4.0: 55.8% (Fable) vs. 60.9% (Mythos) — la diferencia es enteramente por salvaguardas
- AutomationBench: 31.4% (vs. 17.1% de Fable 5 — casi se duplica)
- Cache reads: $0.25/M tokens (75% menos que Fable 5)
- Savaguardas cyber: Menos intervenciones por sesión que Fable 5
- Savaguardas de biología: menos falsos positivos en consultas médicas benignas
- Context window: 1M de tokens, salida máx. 128K
- Marca de agua del EU AI Act incluida
Gemini 3.8 Flash Cyber
- Disponible via Fairwind Program para defensores verificados
- Detección de vulnerabilidades a nivel frontera y patching automatizado
- Caso real: vulnerabilidad crítica encontrada en <2 horas (normal: meses)
- Precio base Flash: $0.75/$3.75 por millón de tokens
Implicaciones para equipos de desarrollo y CISOs
Para los equipos de desarrollo, la llegada de modelos con capacidades cyber críticas cambia la ecuación de varias maneras:
- Identificación de vulnerabilidades en source code: Fable 5.1 ya permite identificar vulnerabilidades en código fuente, algo que antes requería herramientas SAST/DAST dedicadas. Astra va más allá: puede desarrollar exploits funcionales contra sistemas endurecidos.
- Automatización de triaje de seguridad: Los modelos ahora pueden analizar logs, correlacionar amenazas, y tomar acciones de contención que antes vivían en la cola de un analista humano.
- Patching automatizado: Gemini 3.8 Flash Cyber no solo detecta vulnerabilidades, sino que genera y aplica patches de forma automática.
Para los CISOs, NeuralTrust recomienda cinco acciones inmediatas:
- Solicitar acceso al programa Daybreak (OpenAI) o equivalente para tu equipo de seguridad
- Actualizar tu clasificación de riesgo de modelos de IA para reflejar capacidades nivel Astra
- Informar al board qué significa en la práctica el umbral “Crítico” de ciberseguridad
- Auditar tu stack de monitoreo de IA para verificar que tienes controles a nivel de infraestructura por debajo del modelo
- Acelerar tu programa de red teaming de IA para testear aplicaciones a este nivel de capacidad
Riesgos, límites y debate abierto
El problema de la verificación
¿Quién verifica que los programas de acceso restringido (Daybreak, Fairwind, Cyber Verification Program) solo den acceso a actores legítimos? Cada laboratorio opera su propio programa con criterios opacos. Anthropic admite que el Life Sciences Verification Program está “actualmente limitado a organizaciones estadounidenses”, pero no publica los criterios completos de aceptación. OpenAI dice que evalúa el riesgo de cada cuenta, pero los detalles del modelo de evaluación son internos.
El incidente OpenAI-Hugging Face
El 7 de agosto, OpenAI detectó que Astra podría alcanzar el nivel Crítico. Poco antes, había ocurrido un “incidente” con Hugging Face durante una evaluación de seguridad de modelos. OpenAI pausó parte del entrenamiento frontera durante dos semanas para endurecer su infraestructura: aislamiento, controles de red, monitoreo expandido, y umbrales de alineación reforzados. Los detalles del incidente no se han publicado completamente.
El riesgo de destilación
Si un modelo crítico es accesible via API — incluso con salvaguardas — existe el riesgo de que un atacante use sus outputs para entrenar un modelo más pequeño que replique las capacidades ofensivas sin las salvaguardas. Anthropic dice que Fable 5.1 incluye “mecanismos reforzados para dificultar los ataques de destilación”, pero no explica cómo.
La asimetría defensor/atacante
El argumento a favor de los modelos cyber restringidos es la asimetría: un defensor con acceso a Astra-Daybreak puede encontrar y parchear vulnerabilidades más rápido que un atacante sin acceso. Pero si los atacantes también obtienen acceso — o si destilan las capacidades — la asimetría se invierte. El debate sobre si estas capacidades deberían existir comercialmente en absoluto está lejos de resolverse.
Conclusión: el nuevo paradigma es permanente
Lo que pasó en la primera semana de septiembre de 2026 no es un evento único. Es la cristalización de un patrón que definirá todos los lanzamientos de modelos frontera desde ahora. Cuando un modelo de IA supera la capacidad de los equipos humanos de ciberseguridad en su propio dominio — y eso ya pasó — la pregunta deja de ser “¿deberíamos lanzarlo?” y pasa a ser “¿cómo lo lanzamos sin que nos exploten?”.
La respuesta de los tres laboratorios fue la misma: modelos duales, programas de verificación, y salvaguardas adaptativas. Es la primera vez que la industria de la IA trata la ciberseguridad ofensiva como una capacidad que requiere control de exportación, no como una feature de marketing. Que los tres lo hicieron simultáneamente sugiere que vieron evidencia similar en sus evaluaciones internas: el umbral se cruzó, y no hay vuelta atrás.
Para los desarrolladores, CTOs y responsables de producto, la consecuencia es directa: si tu stack de seguridad no está usando ya modelos con capacidades de nivel Crítico para defensa, estás operando con una ventaja que se evapora semana a semana. Y si estás construyendo sobre estos modelos, necesitas entender que las salvaguardas no son un detalle — son la diferencia entre un defensor y un arma.