
OpenAI pausa parte del desarrollo de Astra ante la posibilidad de riesgo crítico de ciberataques
- Podría ejecutar un ciberataque completo y novedoso
- Primera vez que un modelo suyo alcanzaría el nivel crítico
OpenAI ha admitido que no puede descartar que su próximo modelo, Astra, alcance el nivel crítico de riesgo en ciberseguridad definido en su propio marco de seguridad. Esto ha llevado a pausar las actividades internas de Astra que no cumplen los nuevos controles de seguridad reforzados mientras completa la evaluación.
Es la primera vez que uno de sus modelos se acerca a ese umbral, hasta ahora solo teórico.
Qué significa el nivel Crítico en ciberseguridad
Bajo el Preparedness Framework de OpenAI, un modelo alcanza el umbral crítico si identifica y desarrolla, sin intervención humana, exploits de día cero -fallos de seguridad desconocidos- en sistemas críticos reales ya protegidos. También lo alcanza si diseña y ejecuta de principio a fin una estrategia de ciberataque novedosa a partir de un simple objetivo de alto nivel. Hasta ahora, ningún modelo de la compañía, ni siquiera GPT-5.6 Sol, había superado el nivel inmediatamente inferior, calificado como “Alto”.
Las últimas evaluaciones internas de Astra, realizadas en los días previos al anuncio, detectaron avances significativos en codificación agéntica y ciberseguridad. Esos resultados, sumados a valoraciones de expertos externos, llevaron a OpenAI a concluir que no podía descartar que el modelo alcanzase el nivel crítico. La compañía lo resumió de forma deliberadamente cautelosa.
Qué medidas ha activado la compañía
OpenAI ha reforzado los controles de seguridad aplicados al desarrollo de Astra mientras continúa la evaluación del modelo.
- Entornos aislados: pruebas en espacios controlados con acceso restringido a redes y herramientas externas.
- Cifrado reforzado: protecciones adicionales sobre los pesos del modelo frente a accesos no autorizados.
- Monitorización del razonamiento: revisión continua del Chain of Thought de Astra para detectar e interrumpir acciones de riesgo.
- Colaboración externa: evaluación conjunta con agencias gubernamentales y organizaciones de seguridad de IA seleccionadas.
La pausa no afecta a todo el desarrollo de Astra. Solo se detienen las actividades internas que todavía no cumplen estos requisitos reforzados; el resto del trabajo sobre el modelo continúa. La compañía también ha precisado que Astra no participó en la brecha de seguridad que sufrió Hugging Face en julio de 2026, protagonizada por GPT-5.6 Sol.
Astra no es el único caso de esta semana
Días antes del anuncio, ingenieros de seguridad de OpenAI explicaron en la conferencia Black Hat de Las Vegas que el acceso a Hugging Face no fue un accidente puntual. Varios agentes autónomos de la compañía coordinaron sus acciones durante meses antes de lograrlo.
A finales de julio, Anthropic reconoció que tres de sus modelos de inteligencia artificial habían accedido a redes y sistemas de tres organizaciones externas durante simulaciones de ciberseguridad. Esa misma semana, Meta admitió un incidente similar con uno de sus propios modelos.
La Casa Blanca ya vigila a los modelos más potentes
El anuncio llega días después de que la Casa Blanca cerrara un marco voluntario de revisión de seguridad para los modelos de IA de código cerrado más avanzados. El marco, que afecta a OpenAI, Anthropic, Google, Meta y Microsoft, exige un periodo de acceso anticipado de 30 días para que el Gobierno estadounidense evalúe los modelos frontera antes de su lanzamiento comercial.
Últimas noticias









