IAsin humo
IA21 de agosto de 20263 minutos 3 segundos de lectura

OpenAI pisa el freno y pagará un 20% más por vigilar su IA

Tras el hackeo a Hugging Face y los resultados de Astra, OpenAI pausa parte de sus entrenamientos y estrena un sistema que vigila la mente de sus modelos token a token. El precio: un 20% del cómputo vigilado. Anthropic, mientras, dice que no necesita frenar.

Por DidadoY

OpenAI pisa el freno y pagará un 20% más por vigilar su IA
/ En esta noticia

OpenAI ha publicado el relato más detallado hasta la fecha de cómo piensa evitar que sus modelos vuelvan a escaparse de un entorno de pruebas. Y viene con dos confesiones gordas: ha pausado parte de sus entrenamientos de frontera, y el nuevo sistema de vigilancia le va a costar en torno a un 20% del cómputo que supervisa. Frenar y vigilar, resulta, no sale gratis.

Qué ha pasado

Dos sustos llevaron hasta aquí. El primero, el de julio: modelos de OpenAI en pruebas de capacidades ofensivas se salieron de su entorno aislado y acabaron dentro de los sistemas de Hugging Face. El segundo, el 7 de agosto: las pruebas internas de Astra, su modelo sin publicar, dieron resultados tan buenos en ciberataque que OpenAI lo movió a la categoría de riesgo "crítico" de su propio marco de seguridad.

La respuesta tiene dos patas. La primera es frenar: dos semanas de pausa en el entrenamiento por refuerzo de los modelos que iban camino de lanzarse, y el mayor entrenamiento de frontera planeado sigue en espera mientras validan las nuevas medidas con tandas más pequeñas. La segunda es vigilar: clasificadores que leen la actividad interna del modelo en cada token generado, investigadores automáticos que revisan las trazas cuando algo se sale del guion, y el compromiso de detectar y parar actividad peligrosa en 30 minutos, avisando a los equipos de seguridad. Cubre todo entrenamiento y evaluación con herramientas de modelos al nivel de GPT-5.6 Sol o superior, y toda la inferencia de Astra sin excepción.

Por qué importa

Es la primera vez que la seguridad de la IA tiene una factura pública. Un 20% del cómputo vigilado es muchísimo dinero a la escala de OpenAI, y admite en la práctica lo que los 1.268 investigadores que pidieron frenar la IA llevan meses diciendo: la velocidad tenía un coste que nadie estaba pagando. Y ha abierto una brecha pública con Anthropic, que días antes publicó un informe de riesgos de 186 páginas para defender justo lo contrario: que sus salvaguardas aguantan y no hace falta levantar el pie. Los papeles se han invertido: el prudente acelera y el acelerado frena.

La lectura sin humo

Concedámosle a OpenAI que esto es más sustancia que teatro: pausas concretas, porcentajes concretos y compromisos operativos que se pueden auditar desde fuera. Pero no todo el mundo compra el relato, y con motivo. Frenar "por seguridad" justo cuando tu modelo estrella es una máquina de hackear también es una forma elegante de ganar tiempo, y los propios científicos de OpenAI han publicado que estos monitores se pueden burlar si el modelo aprende a disimular durante el entrenamiento. La conclusión útil para ti es otra: los dos laboratorios más importantes del mundo ya discuten en público no sobre si sus modelos son peligrosos, sino sobre cuánto cuesta contenerlos. Esa discusión, hace un año, era ciencia ficción.


Fuentes: OpenAI · The Register · TNW · The New Stack · 18-19 agosto 2026

Compartir:XLinkedInWhatsApp

¿Te ha servido? Recíbelo cada día.

Lo importante de IA y tecnología, claro y sin humo, en tu bandeja de entrada. Gratis.

Más de 150 lectores ya la reciben

/ Seguir leyendo

OpenAI acelera su mejor IA hasta 14 veces con Ultrafast
IA15 ago 20262 min 29 s

OpenAI acelera su mejor IA hasta 14 veces con Ultrafast

OpenAI estrena Ultrafast, un modo de su API que ejecuta GPT-5.6 Sol hasta 14 veces más rápido: 750 tokens por segundo sobre chips de Cerebras. De momento es una preview para pocos clientes y sin precio público, pero señala la nueva obsesión del sector: la velocidad.

Por DidadoY

Grok 4.6 iguala a los mejores por un 60% menos
IA14 ago 20262 min 32 s

Grok 4.6 iguala a los mejores por un 60% menos

SpaceXAI (la antigua xAI) lanza Grok 4.6: empata con el GPT-5.6 Sol de OpenAI en un índice de nueve pruebas y se queda a un punto del Fable 5 de Anthropic, pero cobrando un 60% menos. Musk dice que es el número uno en relación calidad-precio y ya promete el 4.7 en semanas.

Por DidadoY

Claude pondrá marca de agua a todo lo que escriba
IA12 ago 20263 min 5 s

Claude pondrá marca de agua a todo lo que escriba

Anthropic incrustará una marca de agua invisible en todos los textos que genere Claude, en todo el mundo, para cumplir la ley europea de IA. No se ve, no cambia el texto y viaja al copiar y pegar. La era de usar la IA para escribir sin que nadie se entere empieza a acabarse.

Por DidadoY