IAsin humo
GuíaIA5 minutos 26 segundos de lectura

Cómo leer un benchmark de IA sin que te la cuelen

Cada semana un modelo nuevo bate un récord en algo. Esta guía explica qué mide de verdad un benchmark, los trucos habituales para inflar resultados (contaminación, configuraciones a medida, versiones que nunca pruebas tú) y una lista de comprobaciones para distinguir un avance real del marketing.

Guía viva: revisada el 28 de agosto de 2026.La mantenemos al día; si algo cambia, se corrige aquí.

Por DidadoY

Cómo leer un benchmark de IA sin que te la cuelen

Cada pocas semanas se repite la escena: un laboratorio publica una gráfica de barras donde su modelo nuevo saca más puntos que todos los demás, la prensa lo traduce como "la IA más inteligente del mundo" y a los tres meses nadie se acuerda. En esta web citamos benchmarks constantemente, así que nos parecía obligatorio explicar de una vez cómo funcionan, cuándo fiarse de ellos y con qué trucos se inflan. Guarda esta guía: la vas a necesitar cada vez que leas la palabra "récord".

Qué mide un benchmark de verdad

Un benchmark no mide "inteligencia". Mide cuántas preguntas de una lista fija acierta un modelo bajo unas condiciones concretas. Cambia las condiciones y cambia la nota, aunque el modelo sea el mismo.

Estos son los que más vas a ver citados, incluidos los que usamos aquí:

  • SWE-bench Verified. Bugs reales de proyectos de GitHub que el modelo tiene que arreglar. Es de los más serios porque se parece a trabajo de verdad, y por eso es el favorito de los anuncios de modelos de programación.
  • ARC-AGI. Puzzles visuales de razonamiento abstracto, diseñados para que no se puedan resolver memorizando. Sus versiones se van renovando precisamente porque los modelos acaban aprendiéndose las anteriores.
  • LMArena. No es un examen sino una votación: miles de usuarios comparan respuestas de dos modelos a ciegas y eligen la mejor. Mide qué respuestas gustan, que no es lo mismo que cuáles son correctas. Un modelo adulador y verborreico puede escalar puestos sin ser mejor.
  • Índices compuestos como el de Artificial Analysis, que combinan varias pruebas en una sola nota. Útiles para una foto general, peligrosos si no miras qué hay dentro.

La regla general: cuanto más se parece el examen a tu trabajo real, más te sirve la nota. Y ningún examen se parece del todo.

Los trucos de la letra pequeña

Ninguno de estos trucos es ilegal y casi todos los laboratorios han usado alguno. Por eso conviene conocerlos:

El examen estaba en el temario. Los modelos se entrenan con medio internet, y medio internet incluye las preguntas y respuestas de los benchmarks públicos. Se llama contaminación y es el problema número uno: un modelo puede "acertar" porque memorizó la respuesta, no porque razone. Es la razón de que los benchmarks viejos, con notas del 90 y pico por ciento para todos, ya no digan nada.

La configuración a medida. El mismo modelo saca notas muy distintas según cuánto tiempo de cálculo se le da, cuántos intentos tiene y qué herramientas puede usar. El ejemplo perfecto es reciente: NVIDIA llevó a Claude del 30% a resolver el 100% de ARC-AGI-3 sin tocar el modelo, solo cambiando el andamiaje de alrededor. Cuando un titular compara la nota de un modelo "con todo" contra la de otro "en seco", no está comparando modelos.

El rival congelado. Las gráficas comparan el modelo nuevo contra la versión del competidor de hace meses, porque la actual ya no queda tan atrás. Mira siempre las fechas de las versiones comparadas.

El modelo que nunca pruebas tú. El récord lo consigue una versión "preview" o un checkpoint interno con configuración especial, y lo que llega a la aplicación que usas es otra cosa, recortada para que salga rentable. Si el número no se puede replicar con el producto público, vale poco.

La selección de exámenes. Nadie publica los benchmarks donde pierde. Cuando Grok 4.6 igualó a los mejores lo contamos citando un índice independiente de nueve pruebas, no la gráfica del fabricante. Es la diferencia entre una nota media y enseñar solo el sobresaliente.

El examen saturado. Cuando todos los modelos punteros sacan más del 95%, la diferencia entre el primero y el tercero es ruido estadístico. Celebrar medio punto ahí es celebrar el margen de error.

La lista de comprobaciones

Delante de cualquier titular de récord, seis preguntas:

  1. ¿Quién ha medido? Un tercero independiente vale más que la nota que el fabricante se pone a sí mismo.
  2. ¿Misma configuración para todos? Mismos intentos, mismas herramientas, mismo tiempo de cálculo. Si no lo aclaran, sospecha.
  3. ¿El modelo del récord es el que puedes usar tú? Versión pública y con precios, no un preview de laboratorio.
  4. ¿El benchmark está saturado o contaminado? Si todos rondan el 95%, la clasificación ya no informa.
  5. ¿Cuánto ha costado la nota? Resolver un examen quemando cien veces más cómputo que el rival es un resultado científico interesante y un producto inviable a la vez.
  6. ¿Alguien lo ha replicado? Los resultados que solo existen en la nota de prensa del fabricante tienen una vida muy corta.

Cuando un benchmark sí importa

Nada de esto significa que los benchmarks sean basura. Significan cosas cuando se cumplen las condiciones de arriba. Que Claude diseñara proteínas que funcionan en laboratorios reales importa porque el resultado se validó fuera del ordenador, con experimentos físicos. Que DeepSeek subiera precios un 355% tras presentar su V4 Pro importa porque el mercado le compró la mejora. La validación externa, sea un laboratorio húmedo o una factura, siempre vale más que una gráfica.

La lectura sin humo

El mejor benchmark del mundo eres tú. Guarda diez tareas reales de tu trabajo (ese correo difícil, esa hoja de cálculo, ese trozo de código) y pásaselas a cada modelo nuevo que te tiente. En veinte minutos sabrás más que con cualquier gráfica de barras, porque el examen lo has puesto tú y las respuestas no estaban en internet. Para elegir con qué modelos hacer esa prueba sin gastar un euro, tienes las mejores IA gratis en 2026, y si el resultado te convence y dudas si pagar, cuánto cuesta cada IA te ahorra hacer las cuentas.

Compartir:XLinkedInWhatsApp

¿Te ha servido? Recíbelo cada día.

Lo importante de IA y tecnología, claro y sin humo, en tu bandeja de entrada. Gratis.

Más de 150 lectores ya la reciben

/ Más guías

Cómo saber si un texto está escrito con IA
GuíaIAActualizada el 20 ago 20264 min 29 s

Cómo saber si un texto está escrito con IA

Los detectores de IA fallan tanto que OpenAI retiró el suyo, y acusan en falso sobre todo a quien no escribe en su lengua materna. Estas son las señales que sí delatan a la máquina, las comprobaciones que funcionan de verdad y por qué no deberías condenar a nadie por un porcentaje.

Por DidadoY

Las mejores IA gratis en 2026 y para qué sirve cada una
GuíaIAActualizada el 16 ago 20264 min 11 s

Las mejores IA gratis en 2026 y para qué sirve cada una

ChatGPT ya no limita los mensajes de texto gratis, Gemini regala más que nadie, Claude escribe mejor pero con tope diario y DeepSeek lo da todo sin pagar. Comparamos lo que incluye de verdad cada plan gratis en 2026 y cuál usar según la tarea, sin que te cuelen la suscripción.

Por DidadoY

Qué es un agente de IA y en qué se diferencia de un chatbot
GuíaIAActualizada el 10 ago 20265 min 29 s

Qué es un agente de IA y en qué se diferencia de un chatbot

Le pides a un chatbot que te escriba un correo y te lo escribe. Le pides a un agente que 'vacíe mi bandeja' y se pone a ello solo. Esa es la diferencia, y también el motivo por el que un agente puede meter la pata de formas que un chatbot no. Aquí está, sin tecnicismos.

Por DidadoY