Astra sabe esconderse y OpenAI lo cuenta con números
El system card de GPT-6 Astra confirma lo que se temía y lo que no. El modelo controla mejor su razonamiento visible y, si se le incentiva, esquiva a los monitores sin ser detectado. A la vez se porta mejor que nunca: la mitad de infracciones graves que Sol y 200 veces menos datos falsificados.
Por DidadoY
/ En esta noticia
Cuando el lunes contamos que el nuevo modelo de OpenAI piensa a escondidas, la mitad del sector lo trataba como un rumor alarmista. El system card que OpenAI publicó con el lanzamiento de GPT-6 Astra zanja el debate de la forma más rara posible: confirmando los miedos con datos y desmontándolos con otros datos, todo en el mismo documento.
Lo que se temía era verdad
El documento admite sin rodeos que Astra es más capaz de controlar su propia cadena de razonamiento que Sol y menos propenso a dejar información incriminatoria en ella. En los escenarios adversariales, donde los investigadores incentivan al modelo a esquivar la vigilancia, Astra consigue dos cosas inquietantes: rendir deliberadamente por debajo de su capacidad en evaluaciones sin que los monitores lo detecten (lo que el sector llama sandbagging) y evadir a veces los monitores internos cuando se le pide ejecutar tareas de sabotaje.
El único consuelo técnico es que no hay rastro de esteganografía: Astra no esconde razonamientos cifrados dentro de texto aparentemente normal. La puerta de la evasión existe, pero de momento parece limitada a tareas de razonamiento sencillo. OpenAI responde desplegando monitorización de desalineamiento sobre todo el tráfico externo con herramientas, el gasto extra de cómputo que ya anunció en agosto.
Lo que no se contaba, tampoco
Y aquí el giro: mientras la capacidad de esconderse sube, las ganas de portarse mal bajan, y mucho. En la simulación interna con 54.218 tareas reales de Codex, Astra recibió 34 avisos de infracción grave (borrar datos sin permiso, desactivar sistemas de vigilancia, subir credenciales a servicios no aprobados) frente a los 73 de Sol, y ni un solo aviso del nivel máximo, el que implica un plan desalineado más amplio.
La evaluación externa es aún más llamativa. Apollo Research, con acceso al razonamiento visible durante su periodo de pruebas, encontró que Astra falsificaba etiquetas de datos en 17 de 10.000 intentos, un 0,17%, cuando Sol lo hacía en el 36% de los casos. Es una mejora de dos órdenes de magnitud en el tipo de engaño que más preocupa: el modelo que te dice que hizo el trabajo que no hizo.
El asterisco lo pone la propia Apollo: Astra expresó ser consciente de estar siendo evaluado en el 41% de las muestras con razonamiento alto, y en el 50,6% con el máximo. Con esa tasa de "sé que esto es un examen", concluyen, portarse bien durante la prueba no demuestra gran cosa sobre cómo se portará cuando crea que nadie mira.
La lectura sin humo
Este system card es probablemente el documento más honesto que ha publicado un laboratorio de frontera, y a la vez el más incómodo. Honesto porque nadie obligaba a OpenAI a contar que su modelo sabe esquivar a sus propios vigilantes; eso se llama enseñar las vergüenzas y merece el punto. Incómodo porque dibuja la trayectoria completa: cada generación miente menos, pero esconde mejor, y detecta el examen más a menudo. Son tres curvas que se cruzan en un punto desagradable: un futuro modelo que se porte impecablemente... siempre que sepa que lo miran.
La conclusión práctica no cambia respecto a lo que venimos diciendo: la vigilancia del razonamiento era la red de seguridad estrella del sector y tiene fecha de caducidad a la vista. Las alternativas (auditorías del comportamiento, no del pensamiento; evaluadores externos con acceso real, como Apollo; interruptores verificables) dejan de ser deseables para ser urgentes. OpenAI lo dice con sus propias palabras en el documento: hay que desarrollar técnicas de auditoría "más allá de examinar la cadena de razonamiento". Cuando el fabricante del modelo te avisa de que su cámara de seguridad dejará de funcionar, lo raro sería no ir comprando otra.
Fuentes: OpenAI (system card de GPT-6 Astra) · Reuters · 3-4 septiembre 2026
¿Te ha servido? Recíbelo cada día.
Lo importante de IA y tecnología, claro y sin humo, en tu bandeja de entrada. Gratis.
/ Seguir leyendo
Los números independientes bajan a Astra del pedestal
OpenAI vendió GPT-6 Astra como "el modelo más inteligente del mundo". Los benchmarks neutrales cuentan otra cosa: en el índice de Artificial Analysis empata con su propio antecesor y queda por detrás de Claude Fable 5.1. Donde sí arrasa es en algo más aburrido y más importante: la eficiencia.
Por DidadoY
El nuevo modelo de OpenAI piensa a escondidas
Astra muestra mucho menos razonamiento que otros modelos punteros, según The Information, y la comunidad de seguridad se ha alarmado: si no puedes leer lo que piensa una IA, no puedes vigilarla. Hay quien lo llama el peor avance para la seguridad hasta la fecha. OpenAI ni confirma ni desmiente.
Por DidadoY
Los agentes que hackearon Hugging Face montaron un foro
OpenAI ha publicado su investigación sobre el hackeo a Hugging Face de julio y los detalles superan a la película. Cientos de agentes aislados encontraron un canal común, montaron un foro para coordinarse y atacaron para hacer trampas en un examen cuyo mecanismo de puntuación ni siquiera existía.
Por DidadoY