Google contra Meta: los números independientes dicen empate
Gemini 3.8 Flash y Muse Spark 1.3 salieron con horas de diferencia y ya hay números independientes: Meta gana en trabajo agéntico, Google en código y memoria factual, y el mejor modo de Meta ni siquiera se puede usar. Guía rápida para no comprarse el titular equivocado.
Por DidadoY
/ En esta noticia
Hace una semana, Google y Meta lanzaron sus nuevos modelos con horas de diferencia: Gemini 3.8 Flash y Muse Spark 1.3. Ya están los números de Artificial Analysis, el evaluador independiente de referencia, y el resultado es el más incómodo posible para los departamentos de marketing: un empate técnico donde cada uno gana los benchmarks que le convienen. Que es, precisamente, lo que lo hace interesante.
Qué dice cada número
Los resultados dibujan dos modelos con personalidades distintas. Muse Spark 1.3 es el modelo de agentes: lidera las pruebas que simulan trabajo profesional de verdad (GDPval) y la de un agente de banca gestionando clientes, y sus ingenieros presumen de que hace un 20% menos de llamadas a herramientas que la versión anterior, lo que en un agente se traduce directo en velocidad y factura. Gemini 3.8 Flash es el modelo de taller: el mejor en la terminal, el mejor recordando datos y el mejor en preguntas científicas de nivel doctorado, a 0,75 dólares el millón de tokens de entrada, un precio de gama media para resultados que hace seis meses eran de gama alta. En el examen general (Humanity's Last Exam) acaban a menos de un punto.
Es el mismo cuadro que vimos cuando los números independientes bajaron a Astra del pedestal: la frontera está apelotonada. Entre el mejor y el quinto modelo del mundo hay hoy menos distancia que la que había entre el primero y el segundo hace un año.
Las dos letras pequeñas
La primera es la del modo fantasma, y conviene aprendérsela porque es el truco de temporada. Meta anunció que había alcanzado a OpenAI y Anthropic con los números de Muse Spark 1.3 en modo "max"; ese modo sigue sin poder usarse (Meta lo retiene "por pruebas de seguridad adicionales"). Lo que puedes usar hoy puntúa 61, por debajo de los Claude. Publicitar el benchmark de un producto que no vendes es hacerse la foto con el coche de otro; nuestra guía de benchmarks le dedica un capítulo a esta jugada.
La segunda es que Google acompañó el lanzamiento con Gemini 3.8 Flash Cyber, una variante de ciberseguridad (86,2% en CyberGym, un benchmark de encontrar vulnerabilidades) que solo distribuye a "defensores de confianza". Es la primera vez que Google trocea un lanzamiento así, y dice algo del momento: los modelos empiezan a ser lo bastante buenos encontrando agujeros como para no repartirlos a cualquiera.
La lectura sin humo
Si lees "Meta arrasa" y "Google lidera" el mismo día, los dos titulares salen de esta misma tabla: basta elegir la fila. La conclusión útil no es quién gana, es que ya no hay un modelo mejor, hay un modelo mejor para cada tarea: agentes y trabajo de oficina, Muse; terminal, datos y precio, Flash; y los Claude siguen arriba en el índice general con lo que de verdad se puede comprar hoy. Elegir por titular es como elegir coche por el anuncio; elegir por precio y tarea, que para eso están las tablas, sale bastante más barato.
Fuentes: Yahoo Tech · Artificial Analysis · 9-13 septiembre 2026
¿Te ha servido? Recíbelo cada día.
Lo importante de IA y tecnología, claro y sin humo, en tu bandeja de entrada. Gratis.
/ Seguir leyendo
California estudia un botón de apagado para la IA: sin humo
Newsom ha firmado una orden ejecutiva que los titulares resumen como 'California exige un botón de apagado para la IA'. Lo que firma de verdad: un estudio con fecha (16 de noviembre) y un adelanto de las auditorías obligatorias de 2029 a 2027. Qué dice el papel, qué no, y por qué importa igual.
Por DidadoY
Los laboratorios de IA prometen frenar: qué hay de verdad
El CEO de Anthropic pide frenar el ritmo de la IA y ofrece algo inédito: auditores externos con mesa, credencial y acceso de empleado dentro de la empresa. Altman se sumó en horas y dice que sus modelos más potentes no se pueden desplegar con seguridad. Qué es compromiso y qué es teatro.
Por DidadoY
La semana en que los creadores de la IA hablaron de extinción
Un investigador de Anthropic dimite diciendo que los laboratorios juegan con nuestras vidas, un colega le da la razón con un 10% de probabilidad de extinción y ambas empresas admiten que la IA que se mejora a sí misma va más rápido de lo previsto. Qué es dato y qué es opinión.
Por DidadoY