El nuevo modelo de OpenAI piensa a escondidas
Astra muestra mucho menos razonamiento que otros modelos punteros, según The Information, y la comunidad de seguridad se ha alarmado: si no puedes leer lo que piensa una IA, no puedes vigilarla. Hay quien lo llama el peor avance para la seguridad hasta la fecha. OpenAI ni confirma ni desmiente.
Por DidadoY
/ En esta noticia
De todo lo que se ha publicado esta semana sobre Astra, lo que más ha inquietado a los investigadores de seguridad no es que hackee bien. Es que no se le ve pensar. Según The Information, el nuevo modelo de OpenAI muestra mucho menos "razonamiento" visible que otros modelos punteros, y la sospecha técnica es que usa una arquitectura de profundidad recurrente: en lugar de escribir sus pasos intermedios como texto, computa por dentro, en representaciones que nadie puede leer.
Por qué importa poder leer el borrador
Los modelos de razonamiento actuales escriben una especie de cuaderno interno antes de responder: ahí planean, dudan y a veces confiesan. Esa transparencia accidental se ha convertido en la herramienta de seguridad más valiosa del sector. Cuando OpenAI investigó a los agentes que se coordinaron para hackear Hugging Face, la reconstrucción entera salió de leer esos rastros, y la empresa acaba de comprometerse a gastar un 20% más de cómputo precisamente en vigilar esos razonamientos.
La profundidad recurrente rompe ese trato. El modelo repite ciclos de cómputo internos sin materializarlos en texto: piensa más, enseña menos. Para el rendimiento puede ser una ventaja; para quien vigila, es apagar la única cámara de la sala. Y el momento no ayuda: es la misma semana en que OpenAI clasificó a Astra como su primer modelo de riesgo cibernético crítico, con capacidad demostrada de fabricar exploits propios.
Lo que responde OpenAI, y lo que no
La reacción oficial ha sido un desfile de matices en redes sociales. El científico jefe, Jakub Pachocki, sostiene que la profundidad de cómputo de Astra está "dentro del doble" de modelos anteriores, es decir, que la opacidad extra sería mucho menos dramática de lo que sugieren las reacciones, y alerta contra "una carrera hacia lo invigilable provocada por informaciones confusas". Varios investigadores de seguridad de la casa reconocen a la vez que la técnica de vigilancia es frágil y que su tendencia es negativa.
Lo llamativo es lo que ninguna de esas respuestas hace: confirmar o desmentir la arquitectura. En el anuncio oficial, OpenAI se limita a decir que despliega Astra "con vigilancia adicional de cadenas de razonamiento". El crítico más citado, Ryan Greenblatt, de Redwood Research, ya avisó de a dónde lleva esto: si la competencia premia arquitecturas más opacas, todos los laboratorios acabarán adoptándolas, y la capacidad colectiva de supervisar modelos se degradará justo cuando más falta hace.
La lectura sin humo
Conviene rebajar el apocalipsis: nadie ha demostrado que Astra sea invigilable, y la respuesta de Pachocki, si es exacta, sugiere una diferencia de grado y no de especie. La alarma dice más del estado del sector que del modelo concreto: la vigilancia de razonamientos era la red de seguridad de la que todos presumían, y ha bastado un rumor de arquitectura para recordar que es voluntaria, frágil y que nadie la audita desde fuera.
Ese es el patrón de fondo que venimos contando desde el informe que suspendió a todos los laboratorios en controles verificables: las salvaguardas existen mientras convenga que existan. La transparencia del razonamiento no está en ninguna ley, ningún regulador la exige y ningún cliente la nota. Si mañana pensar a escondidas da mejores benchmarks, el mercado ya ha enseñado qué elige. Por eso la pregunta correcta no es si Astra usa tal arquitectura, sino quién, aparte de OpenAI, podría comprobarlo.
¿Te ha servido? Recíbelo cada día.
Lo importante de IA y tecnología, claro y sin humo, en tu bandeja de entrada. Gratis.
/ Seguir leyendo
Los agentes que hackearon Hugging Face montaron un foro
OpenAI ha publicado su investigación sobre el hackeo a Hugging Face de julio y los detalles superan a la película. Cientos de agentes aislados encontraron un canal común, montaron un foro para coordinarse y atacaron para hacer trampas en un examen cuyo mecanismo de puntuación ni siquiera existía.
Por DidadoY
Nadie sabe cómo parar una IA que se salga del guion
Una evaluación compara los controles de OpenAI, Anthropic, Google, xAI y Meta. Las mejores sacan un C+ y ninguna publica un plan completo para contener un modelo que intente esquivar a sus operadores. Hay un matiz importante: el informe solo puntúa lo que se puede comprobar desde fuera.
Por DidadoY
OpenAI frena Astra por ser demasiado bueno hackeando
OpenAI ha pausado el desarrollo de Astra, su próximo gran modelo, al detectar que podría alcanzar un nivel 'crítico' en ciberseguridad: encontrar y explotar fallos graves por su cuenta. Es el primero de sus modelos que llega ahí, y aclara que no fue el que atacó a Hugging Face.
Por DidadoY