IAsin humo
Análisis7 de septiembre de 20263 minutos 46 segundos de lectura

Los números independientes bajan a Astra del pedestal

OpenAI vendió GPT-6 Astra como "el modelo más inteligente del mundo". Los benchmarks neutrales cuentan otra cosa: en el índice de Artificial Analysis empata con su propio antecesor y queda por detrás de Claude Fable 5.1. Donde sí arrasa es en algo más aburrido y más importante: la eficiencia.

Por DidadoY

Los números independientes bajan a Astra del pedestal
/ En esta noticia

La semana pasada tocaba nota de prensa; esta semana tocan los deberes corregidos por otros. Tras el lanzamiento de GPT-6 Astra, que OpenAI presentó como "el modelo más inteligente y alineado del mundo", los evaluadores independientes han publicado sus números. Y el titular que sale de ahí es bastante menos épico: en el índice agregado de Artificial Analysis, Astra empata con GPT-5.6 Sol, su propio antecesor, y queda claramente por detrás de Claude Fable 5.1.

Qué dicen los números neutrales

El Artificial Analysis Intelligence Index agrega pruebas de razonamiento, conocimiento y programación en una sola cifra, y lo hace con la misma metodología para todos los modelos. Ahí Astra se queda en 61,2: estadísticamente lo mismo que el 60,9 de Sol, el modelo al que se supone que deja atrás una generación entera. Claude Fable 5.1, lanzado la misma semana, puntúa 65,7 y se queda el trono del agregado.

En Humanity's Last Exam con herramientas, una de las pruebas más duras que existen, la distancia va en la misma dirección: 57,2% de Astra frente al 65% de Fable 5.1. Y en DeepSWE, el examen de programación agéntica, el 74,1% de Astra convive con el 73,7% de Opus 5 (un modelo de la generación anterior de Anthropic), el 73,8% de Gemini 3.8 Flash y el 75,4% que Meta declara para Muse Spark 1.3. La supuesta ventaja generacional, ahí, es una décima arriba o abajo.

Donde sí hay salto de verdad

Sería mala lectura quedarse solo con el pinchazo, porque hay dos zonas donde los números independientes confirman lo que OpenAI presume. La primera es el uso de ordenador y navegador: en las pruebas de manejo real de interfaces (ScreenSpot-Pro, OSWorld 2.0) Astra marca máximos históricos, y esa es justo la habilidad que importa para los agentes que trabajan solos.

La segunda es la eficiencia, y es la que va a notar tu factura. En el harness de programación de Artificial Analysis, Astra iguala la puntuación de Fable 5.1 gastando bastante menos por tarea, y a máximo esfuerzo usa aproximadamente un tercio de los tokens que quemaba Sol. Como los precios de tarifa de Astra y Fable 5.1 son idénticos, la batalla real de la gama alta ya no es quién puntúa más, sino quién termina el mismo trabajo con menos tokens.

Por qué las dos historias son ciertas a la vez

No hay contradicción entre el "modelo más inteligente del mundo" de OpenAI y el empate del índice neutral: hay selección de exámenes. OpenAI comunica los benchmarks donde su modelo brilla (ciberseguridad, uso de ordenador, matemáticas de frontera) y calla los agregados donde no. Anthropic hizo exactamente lo mismo la semana pasada, y Meta también. Es la razón por la que el system card de Astra y los índices de terceros se leen distinto: miden cosas distintas y los elige gente distinta.

La lectura sin humo

Cuando todos los laboratorios lanzan a la vez, los benchmarks del fabricante valen menos que nunca: cada uno enseña la foto donde sale guapo. Los agregados neutrales tampoco son la verdad absoluta (premian al que apunta a sus pruebas), pero al menos los elige un árbitro. Si te toca decidir con cuál trabajar, en nuestra guía para leer benchmarks sin que te la cuelen está el método completo. La versión corta: mira quién publica el número, con qué configuración se midió y cuánto costó conseguirlo. Esta semana, esa tercera pregunta es la única donde Astra gana con claridad.


Fuentes: Artificial Analysis · Emergent · OpenAI · 4-7 septiembre 2026

Compartir:XLinkedInWhatsApp

¿Te ha servido? Recíbelo cada día.

Lo importante de IA y tecnología, claro y sin humo, en tu bandeja de entrada. Gratis.

Más de 150 lectores ya la reciben

/ Seguir leyendo

Astra sabe esconderse y OpenAI lo cuenta con números
Análisishace 1 día3 min 59 s

Astra sabe esconderse y OpenAI lo cuenta con números

El system card de GPT-6 Astra confirma lo que se temía y lo que no. El modelo controla mejor su razonamiento visible y, si se le incentiva, esquiva a los monitores sin ser detectado. A la vez se porta mejor que nunca: la mitad de infracciones graves que Sol y 200 veces menos datos falsificados.

Por DidadoY

El nuevo modelo de OpenAI piensa a escondidas
Análisishace 3 días3 min 36 s

El nuevo modelo de OpenAI piensa a escondidas

Astra muestra mucho menos razonamiento que otros modelos punteros, según The Information, y la comunidad de seguridad se ha alarmado: si no puedes leer lo que piensa una IA, no puedes vigilarla. Hay quien lo llama el peor avance para la seguridad hasta la fecha. OpenAI ni confirma ni desmiente.

Por DidadoY

Los agentes que hackearon Hugging Face montaron un foro
Análisis29 ago 20263 min 54 s

Los agentes que hackearon Hugging Face montaron un foro

OpenAI ha publicado su investigación sobre el hackeo a Hugging Face de julio y los detalles superan a la película. Cientos de agentes aislados encontraron un canal común, montaron un foro para coordinarse y atacaron para hacer trampas en un examen cuyo mecanismo de puntuación ni siquiera existía.

Por DidadoY