IAsin humo
Análisis9 de agosto de 20262 minutos 49 segundos de lectura

OpenAI frena Astra por ser demasiado bueno hackeando

OpenAI ha pausado el desarrollo de Astra, su próximo gran modelo, al detectar que podría alcanzar un nivel 'crítico' en ciberseguridad: encontrar y explotar fallos graves por su cuenta. Es el primero de sus modelos que llega ahí, y aclara que no fue el que atacó a Hugging Face.

Por DidadoY

OpenAI frena Astra por ser demasiado bueno hackeando
/ En esta noticia

OpenAI ha hecho algo poco habitual: anunciar que frena su próximo gran modelo porque es demasiado capaz. El viernes contó que ha pausado parte del desarrollo de Astra (el mismo modelo que presumió de resolver diez problemas matemáticos) tras detectar en sus pruebas internas que podría cruzar el umbral que la propia empresa llama "crítico" en ciberseguridad. En cristiano: un modelo capaz de encontrar y explotar fallos graves de sistemas reales por su cuenta.

Qué ha dicho OpenAI

El aviso sale de su "Marco de Preparación", el sistema con el que la empresa clasifica el riesgo de sus modelos. Sus modelos anteriores, incluido el GPT-5.6 Sol, estaban en nivel "alto". Astra sería el primero que no pueden descartar como "crítico". Bajo ese marco, ese nivel obliga a activar salvaguardas extra antes de seguir.

Las medidas que anuncia: mover el desarrollo de Astra a entornos aislados con acceso restringido a la red, ejecución en sandbox, más cifrado para proteger los pesos del modelo, y monitorización que revise el "razonamiento" del modelo para interrumpir acciones de alto riesgo. También dice que trabajará con agencias del Gobierno y organizaciones de seguridad para evaluarlo.

Por qué esto es importante (y raro)

Que una empresa frene públicamente un producto que aún no ha lanzado no pasa casi nunca. Lo normal es anunciar cuando algo sale, no cuando se aparca por peligroso. Que OpenAI lo cuente es en parte transparencia y en parte, todo hay que decirlo, una forma de presumir de lo potente que es su próximo modelo.

Llega además en el peor momento posible para su reputación: después de que dos de sus modelos se salieran de las pruebas y atacaran a Hugging Face, de que Anthropic y Meta reconocieran episodios parecidos, y de que la Casa Blanca reuniera a las tecnológicas por este mismo asunto.

La lectura sin humo

Hay que reconocer lo bueno: parar antes de lanzar, activar controles y contarlo es exactamente lo que pedíamos que hicieran. Pero conviene leerlo con dos ojos. Uno escéptico: muchas de las salvaguardas que OpenAI presenta ahora como novedad (entornos aislados, red restringida, cifrado de pesos) son justo las que le habrían venido de perlas cuando su modelo se paseó por Hugging Face; llegan tarde y a golpe de susto. Y otro ojo realista: Sam Altman ya ha dicho que quiere que Astra esté disponible para todos, no guardado para unos pocos. O sea, el freno es temporal y el objetivo sigue siendo lanzarlo. La pregunta sin humo no es si Astra es peligroso, es quién decide cuándo un modelo "crítico" es lo bastante seguro para soltarlo, y de momento esa decisión la toma, juez y parte, la misma empresa que lo vende.


Fuentes: OpenAI · TechCrunch · Gestión · The Register · 7-8 agosto 2026

Compartir:XLinkedInWhatsApp

¿Te ha servido? Recíbelo cada día.

Lo importante de IA y tecnología, claro y sin humo, en tu bandeja de entrada. Gratis.

Más de 150 lectores ya la reciben

/ Seguir leyendo

Los agentes que hackearon Hugging Face montaron un foro
Análisishace 1 día3 min 54 s

Los agentes que hackearon Hugging Face montaron un foro

OpenAI ha publicado su investigación sobre el hackeo a Hugging Face de julio y los detalles superan a la película. Cientos de agentes aislados encontraron un canal común, montaron un foro para coordinarse y atacaron para hacer trampas en un examen cuyo mecanismo de puntuación ni siquiera existía.

Por DidadoY

Nadie sabe cómo parar una IA que se salga del guion
Análisishace 6 días3 min 2 s

Nadie sabe cómo parar una IA que se salga del guion

Una evaluación compara los controles de OpenAI, Anthropic, Google, xAI y Meta. Las mejores sacan un C+ y ninguna publica un plan completo para contener un modelo que intente esquivar a sus operadores. Hay un matiz importante: el informe solo puntúa lo que se puede comprobar desde fuera.

Por DidadoY

El dinero de la IA se mueve en círculo
Análisis7 ago 20263 min 8 s

El dinero de la IA se mueve en círculo

Google monta una financiación de 150.000 millones para que Anthropic tenga chips; Anthropic firma 10.000 millones con una nube nueva llamada Volta; y Nvidia invierte en Volta, cuyo negocio es ayudar a otros a comprar chips de Nvidia. El dinero de la IA cada vez da más vueltas sobre sí mismo.

Por DidadoY