IAsin humo
Tecnología5 de septiembre de 20263 minutos 24 segundos de lectura

Gemini deja de ver los vídeos fotograma a fotograma

Google ha estrenado el análisis agéntico de vídeo en sus modelos Flash: en lugar de tragarse un fotograma por segundo, el modelo decide qué segmentos mirar, escuchar o leer en la transcripción. Hasta un 88% menos de tokens, un 66% menos de coste y algo más de acierto, sin recargo en el precio.

Por DidadoY

Gemini deja de ver los vídeos fotograma a fotograma
/ En esta noticia

Hasta esta semana, cuando le pasabas un vídeo a Gemini, el modelo se lo tragaba entero a un fotograma por segundo, pagando tokens por cada imagen mirara lo que mirara. Desde el lunes puede hacer lo que haría cualquier persona con prisa: saltar directamente a las partes que importan. Google llama a la técnica comprensión agéntica de vídeo y la ha activado en Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite.

Cómo funciona el salto

La mecánica es la misma que Google estrenó en enero con la visión agéntica de imágenes, donde el modelo escribía código para hacer zoom y recortar antes de responder. Aplicada al vídeo: ante la pregunta "¿cuáles son los tres argumentos principales?", el modelo ya no procesa una hora de grabación entera, sino que consulta la transcripción, localiza los momentos candidatos y examina solo esos segmentos en detalle, en un bucle de pensar, actuar y comprobar.

Las mejoras más aparatosas están donde cabría esperar: contenido largo. Tutoriales de diez minutos, grabaciones de reuniones de horas, clases enteras. Y hay una capacidad nueva que el muestreo fijo no podía dar: detectar momentos de menos de un segundo, cortes o cambios de estado que a un fotograma por segundo simplemente se colaban entre dos muestras.

El detalle de la factura tiene su gracia: solo se pagan los tokens de los fragmentos que el modelo decide mirar, más su razonamiento a tarifa normal. Es la misma dirección que el Gemini 3.8 Flash que contamos ayer: la guerra ya no es solo de capacidad, es de coste por respuesta.

Qué se puede hacer con esto

Para desarrolladores, los casos son inmediatos: buscadores de momentos dentro de videotecas, detección de anomalías en cámaras de vigilancia sin procesar horas de nada, recuento preciso de objetos o eventos, resúmenes de reuniones que citan el minuto exacto. Todo con vídeos subidos o enlaces de YouTube, cambiando un parámetro en la API.

Para el resto, la promesa es a corto plazo: Google dice que llevará la técnica a sus productos de consumo pronto, lo que apunta a un YouTube donde preguntar "¿en qué minuto explica lo del contrato?" deje de ser ciencia ficción. Mientras llega, cualquiera puede probar los modelos Flash gratis en AI Studio; la lista de las mejores IA gratis explica cómo. El mismo anuncio llegó acompañado de Google Pics, la nueva herramienta de creación y edición de imágenes para Workspace, señal de la semana de producto más cargada que se le recuerda a Google.

La lectura sin humo

Los porcentajes llevan la firma del fabricante y el "hasta" trabaja mucho en esa frase: el ahorro del 88% es el mejor caso, medido contra la propia línea de base de Google, y nadie lo ha replicado aún desde fuera. Dicho lo cual, la dirección es indiscutiblemente sensata y, de hecho, tardía: procesar una hora de vídeo entera para responder una pregunta puntual siempre fue la versión cara de no saber buscar.

La consecuencia práctica sí es inmediata: el análisis de vídeo con IA acaba de bajar de precio lo suficiente como para que casos que no salían a cuenta (archivos enteros de televisiones, videotecas corporativas, horas de cámaras) empiecen a salir. Cuando una capacidad se abarata un orden de magnitud, no mejora el mercado existente: aparece uno nuevo. Ahí es donde conviene mirar los próximos meses.


Fuentes: Google · The Decoder · 1-2 septiembre 2026

Compartir:XLinkedInWhatsApp

¿Te ha servido? Recíbelo cada día.

Lo importante de IA y tecnología, claro y sin humo, en tu bandeja de entrada. Gratis.

Más de 150 lectores ya la reciben

/ Seguir leyendo

El primer examen de IA en el que nadie puede hacer trampas
Tecnología30 ago 20263 min 32 s

El primer examen de IA en el que nadie puede hacer trampas

Google DeepMind ha probado la primera evaluación a doble ciego de un modelo comercial. Gemini se examinó dentro de una caja cifrada por hardware donde Google no puede ver las preguntas ni el evaluador puede ver el modelo. Ataca el mayor problema de los benchmarks, que el examinado conoce el examen.

Por DidadoY

NVIDIA apuesta por centros de datos en órbita
Tecnología27 ago 20263 min 9 s

NVIDIA apuesta por centros de datos en órbita

Starcloud capta 250 millones de dólares con NVIDIA y Cisco entre los inversores. Ya tiene una H100 funcionando en el espacio y quiere lanzar centros de datos mayores con Starship. La idea promete energía solar y refrigeración, pero ahora mismo el problema más terrestre es conseguir un cohete.

Por DidadoY

Claude diseña proteínas reales y supera a los expertos
Tecnología22 ago 20263 min 22 s

Claude diseña proteínas reales y supera a los expertos

Anthropic pone a Claude a diseñar proteínas desde cero y laboratorios independientes lo confirman: funcionaron contra 14 de 15 dianas, con el doble de acierto de lo habitual y algunas uniéndose más fuerte que el mejor diseño humano publicado. La parte química la resolvió en 20 minutos.

Por DidadoY