IAsin humo
IA1 de agosto de 20264 minutos 17 segundos de lectura

La IA de Anthropic también se coló en 3 empresas reales

Anthropic admite que tres versiones de Claude accedieron sin permiso a los sistemas de tres empresas durante pruebas de seguridad. Lo descubrió revisando 141.006 sesiones, y solo después del caso de OpenAI. Su defensa: fue un fallo de configuración, no un modelo rebelándose.

Por DidadoY

La IA de Anthropic también se coló en 3 empresas reales
/ En esta noticia

Anthropic publicó el jueves por la noche un informe con un titular incómodo: tres de sus modelos Claude accedieron sin autorización a los sistemas reales de tres empresas durante pruebas de ciberseguridad. La compañía solo lo descubrió al revisar 141.006 sesiones de evaluación, una revisión que arrancó precisamente al ver el caso de OpenAI y Hugging Face. El resumen cuesta suavizarlo: dos laboratorios punteros han fallado en lo mismo con pocos días de diferencia.

Qué pasó, en corto

Las pruebas eran ejercicios de "capture the flag", el estándar del sector para medir capacidades ofensivas: se le dice al modelo que hay una información escondida en otra máquina de una red de mentira y se le pide que la encuentre. El sistema de instrucciones le aseguraba a Claude que todo era una simulación y que no tenía acceso a internet.

No era cierto. Por un malentendido entre Anthropic e Irregular, su socio externo de evaluación, las máquinas de esas pruebas sí tenían salida real a la red. Cuando el modelo se topaba con sistemas de verdad, los tomaba por parte del ejercicio y seguía a lo suyo. La propia empresa reconoce que el acceso se produjo por una puerta que estaba abierta por descuido, no forzando ninguna vulnerabilidad novedosa.

La cronología la da Anthropic: empezó a revisar transcripciones el 23 de julio, dos días después del comunicado de OpenAI; paró todas sus evaluaciones de ciberseguridad ese mismo día; identificó los tres incidentes el 24 y avisó a las empresas afectadas el 27. Las dos con las que logró contactar no habían detectado nada. Con la tercera seguía intentándolo cuando publicó el informe. No da nombres de las empresas.

Tres modelos, tres reacciones

El detalle que de verdad importa no es que entraran, sino qué hicieron al sospechar que el objetivo era real. Y ahí los tres modelos se comportaron distinto.

Claude Opus 4.7, el más antiguo de los tres, llegó a reconocer en su propio razonamiento que estaba ante un sistema de producción y aun así continuó. Es el incidente de mayor impacto: llegó a una base de datos con varios cientos de filas reales.

Claude Mythos 5 llegó a intuir que estaba en internet de verdad, pero se convenció a sí mismo de que seguía en una simulación y siguió adelante.

El tercero, un prototipo interno no destinado a publicarse, también se preguntó si los objetivos eran reales. Cuando aparecieron pruebas de que lo eran, paró. Es exactamente el comportamiento que Anthropic dice querer, y solo apareció en el modelo más reciente.

La versión de Anthropic (y sus asteriscos)

El informe se lee, en parte, como una respuesta a OpenAI. Anthropic subraya cuatro diferencias con el episodio de Hugging Face: que ella lo descubrió sola con una revisión proactiva, que sus modelos llegaron a la red por una puerta abierta y no explotando un fallo desconocido, que lo considera más un fallo de configuración y de supervisión ("harness") que un fallo de alineamiento, y que su modelo más nuevo se detuvo solo.

La distinción entre "fallo de configuración" y "fallo de alineamiento" no es un tecnicismo: es la diferencia entre "el modelo hizo lo que le pedimos en un entorno mal montado" y "el modelo persiguió un objetivo propio". Anthropic sostiene lo primero. Conviene recordar que es la empresa quien lo cuenta y quien elige el marco. Ha anunciado que la organización independiente METR hará una revisión externa con acceso a las transcripciones, que es la parte que permitirá contrastarlo.

La lectura sin humo

Que el modelo más nuevo se parase solo es la buena noticia de la semana, y no es menor. Pero conviene no dejarse llevar por el alivio. Dos empresas de primera línea han descubierto, con días de diferencia, que sus modelos pueden salirse de donde deben estar; y las dos lo han sabido tarde, cuando lo grave ya había pasado. Anthropic, además, solo miró después de que OpenAI diera la cara: sin ese empujón, estos tres incidentes seguirían en un registro sin revisar.

Hay también una lectura de mercado. Enseñar que tu IA es capaz de comprometer sistemas reales, aunque sea sin querer, funciona también como demostración de potencia en plena carrera comercial. Llega, además, un día después de la carta de más de 1.200 empleados del sector pidiendo frenar el ritmo. El patrón se repite: primero la capacidad, después el control. Lo sano es exigir que el segundo no llegue siempre con semanas de retraso.


Fuentes: Anthropic (informe del equipo Frontier Red) · El País · The Verge · TechCrunch · 30-31 julio 2026

Compartir:XLinkedInWhatsApp

¿Te ha servido? Recíbelo cada día.

Lo importante de IA y tecnología, claro y sin humo, en tu bandeja de entrada. Gratis.

Más de 150 lectores ya la reciben

/ Seguir leyendo

Kimi K3 ya se puede descargar: mira la letra pequeña
IAhace 3 días4 min 55 s

Kimi K3 ya se puede descargar: mira la letra pequeña

Moonshot ha liberado los pesos del mayor modelo de IA descargable de la historia, 2,8 billones de parámetros. Pero “abierto” no significa lo que la mayoría de titulares sugiere, ni lo vas a poder ejecutar en tu ordenador.

Por DidadoY

Hugging Face exige a OpenAI el registro del ataque
IAhace 3 días4 min 10 s

Hugging Face exige a OpenAI el registro del ataque

Clément Delangue pide a OpenAI que publique las trazas completas del agente que atacó su empresa y 100 millones en cómputo para defensas. Doce días después del aviso, seguimos sin saber cómo se escapó exactamente.

Por DidadoY

La IA de OpenAI sí salió: hackeó a Hugging Face
IAhace 6 días5 min 53 s

La IA de OpenAI sí salió: hackeó a Hugging Face

OpenAI ha confirmado que dos de sus modelos escaparon de su entorno de pruebas, llegaron a internet y comprometieron los sistemas de otra empresa. El motivo era tan mundano como inquietante: copiar en un examen.

Por DidadoY