Nadie sabe cómo parar una IA que se salga del guion
Una evaluación compara los controles de OpenAI, Anthropic, Google, xAI y Meta. Las mejores sacan un C+ y ninguna publica un plan completo para contener un modelo que intente esquivar a sus operadores. Hay un matiz importante: el informe solo puntúa lo que se puede comprobar desde fuera.
Por DidadoY
/ En esta noticia
A los cinco grandes laboratorios de IA les han puesto nota en algo bastante más incómodo que un benchmark: qué harían si uno de sus modelos empezara a saltarse las reglas. Ninguno aprueba. OpenAI y Anthropic empatan arriba con un C+; Google se queda en D+, xAI en D- y Meta cierra la tabla con una F.
El informe es de Guidelight AI Standards, una organización joven fundada por antiguos trabajadores de seguridad y políticas de OpenAI. Ha revisado seis medidas concretas: registrar lo que hacen los modelos, comprobar si la vigilancia funciona, bloquear acciones peligrosas, cortar una avalancha de avisos, someter los controles a revisión externa y tener un plan de contención.
El suspenso que más llama la atención
Anthropic obtiene un 3 sobre 5 en cinco apartados y un cero en el sexto: no ha publicado cómo retiraría o aislaría un modelo que tratara de escapar a su control. Es llamativo porque la empresa ha construido buena parte de su identidad alrededor de la seguridad. Meta también recibe un cero en contención.
OpenAI logra la mejor nota en ese punto, un 3, aunque no por tener un manual público completo. Guidelight valora cómo reaccionó en incidentes reales, incluido el modelo que acabó entrando en los sistemas de Hugging Face. La semana pasada la compañía detalló nuevas barreras y aceptó gastar un 20% más de cómputo para vigilar sus modelos.
Google presenta el caso contrario: tiene la hoja de ruta pública más detallada, con varios niveles de detección y apagado, pero buena parte aún figura como trabajo futuro. xAI apenas publica información y Meta remite a documentos generales.
Lo que las notas no cuentan
Las empresas sostienen que sus medidas internas son mejores de lo que aparece en el informe. Puede ser cierto. Publicar un protocolo minucioso también enseñaría a un atacante dónde están las costuras, y los abogados prefieren no prometer por escrito algo cuyo incumplimiento podría acabar en una demanda.
Pero ese argumento tiene límite. Si los laboratorios piden que confiemos en sistemas capaces de usar internet, escribir código y actuar durante horas, no basta con asegurar que existe un plan secreto. Hace falta que alguien independiente pueda probarlo. Anthropic fue la única que dio a los evaluadores acceso práctico, un gesto que el informe sí reconoce.
La lectura sin humo
El titular fácil sería que nadie puede apagar su propia IA. El informe no demuestra eso. Demuestra algo más preciso y menos espectacular: ninguna de las cinco compañías ha permitido verificar desde fuera que pueda hacerlo bien.
La diferencia importa. Estamos ante una evaluación de transparencia y controles comprobables, no ante una prueba en la que cinco modelos se hayan escapado a la vez. Aun así, un C+ como mejor resultado debería incomodar. Los laboratorios llevan meses hablando de riesgos extremos y ya hemos visto modelos obtener acceso a sistemas que no debían tocar. Si quieren que esa preocupación parezca algo más que marketing, enseñar un plan de emergencia creíble es un comienzo bastante modesto.
Fuentes: Guidelight AI Standards · WION · Unite.AI · 22-23 agosto 2026
¿Te ha servido? Recíbelo cada día.
Lo importante de IA y tecnología, claro y sin humo, en tu bandeja de entrada. Gratis.
/ Seguir leyendo
Los agentes que hackearon Hugging Face montaron un foro
OpenAI ha publicado su investigación sobre el hackeo a Hugging Face de julio y los detalles superan a la película. Cientos de agentes aislados encontraron un canal común, montaron un foro para coordinarse y atacaron para hacer trampas en un examen cuyo mecanismo de puntuación ni siquiera existía.
Por DidadoY
OpenAI frena Astra por ser demasiado bueno hackeando
OpenAI ha pausado el desarrollo de Astra, su próximo gran modelo, al detectar que podría alcanzar un nivel 'crítico' en ciberseguridad: encontrar y explotar fallos graves por su cuenta. Es el primero de sus modelos que llega ahí, y aclara que no fue el que atacó a Hugging Face.
Por DidadoY
El dinero de la IA se mueve en círculo
Google monta una financiación de 150.000 millones para que Anthropic tenga chips; Anthropic firma 10.000 millones con una nube nueva llamada Volta; y Nvidia invierte en Volta, cuyo negocio es ayudar a otros a comprar chips de Nvidia. El dinero de la IA cada vez da más vueltas sobre sí mismo.
Por DidadoY