Google hace que Gemini analice video solo donde importa, ahorrando un 88% en tokens
El modelo deja de leer frame a frame a velocidad fija. Ahora decide qué partes ver y a qué ritmo, bajando costes drásticamente sin perder precisión.

Google ha cambiado la forma en que Gemini procesa videos. Hasta ahora, el modelo analizaba el contenido de forma estática, extrayendo un frame por segundo por defecto. Era un enfoque predecible pero ineficiente: si pasaba algo rápido en medio de un segundo, el modelo lo perdía. Si querías más detalle, tenías que subir la tasa de muestreo manualmente, lo que disparaba el consumo de tokens y el coste. La nueva implementación usa agentes. En lugar de escanear todo el archivo linealmente, el modelo ahora decide por sí mismo qué segmentos son relevantes. Determina qué partes ver, a qué velocidad y mediante qué modalidad (video, audio o transcripción). Solo extrae la información necesaria para la tarea específica. Google aplica esto a Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite. El sistema puede detectar cambios de estado o cortes inferiores a un segundo que antes se escapaban. Esto mejora la edición automática y permite rastrear escenas específicas en horas de grabación sin gastar millones de tokens. El modelo aumenta la tasa de fotogramas solo en las ventanas de tiempo sospechosas donde detecta anomalías. También cuenta movimientos repetidos y objetos individuales con mayor exactitud. Los datos de Google son contundentes. En los benchmarks 1H-VideoQA y LVBench, el uso de tokens cae un 88%. Curiosamente, la precisión sube ligeramente. Es decir, gastas mucho menos y obtienes respuestas mejoradas. Hasta ahora, los desarrolladores podían construir este enfoque selectivo manualmente, pero siempre requería código adicional. Ahora, el modelo maneja el bucle de "pensar-actuar-observar" internamente. Se basa en "agentic vision", una capacidad que Google lanzó para Gemini 3 Flash en enero. Aquel sistema permitía al modelo ejecutar código Python para recortar o anotar imágenes. No funcionaba perfectamente al inicio, pero sentó las bases. La eficiencia brilla con videos largos. Tutoriales de 10 minutos, clases de 90 o grabaciones de varias horas. Con el procesamiento estático, había que elegir entre costes altos o perder detalles. Con agentes, Gemini 3.7 Flash lidera en calidad general y equilibrio coste-precisión según LongVideoBench. La función ya está activa en la API de Gemini en Google AI Studio y en la plataforma empresarial. No hay cargo extra. Los desarrolladores solo deben configurar el modo de procesamiento como "agentic" en la configuración. Google también trae estos cambios a sus propios productos. Próximamente llegue a todos los usuarios de la app de Gemini en dispositivos Flash y Flash Lite. Además, potenciará "Ask YouTube" en las páginas de reproducción. Las respuestas se vincularán más estrechamente con lo que realmente se ve en el video. Es un paso lógico. La industria de la IA generativa busca desesperadamente reducir la latencia y el coste de entrada de contexto. Analizar video completo es caro. Permitir que el modelo ignore el ruido y se centre en la señal es una optimización natural. Queda por ver cómo escala esto en entornos reales con videos de baja calidad o ruido visual extremo. Pero en laboratorio, los números hablan claro.
##Relacionado

Un clip de 7 dólares usa IA y LED para detectar cámaras ocultas con 94% de precisión
Investigadores de KAIST y NUS crean un accesorio magnético para el móvil que separa reflejos de lentes usando una cuadrícula de luz dinámica.

Google lanza Pics, una herramienta de diseño basada en IA dentro de Workspace
Google Pics llega a los usuarios de Workspace y suscriptores de Google AI Pro, ofreciendo generación y edición de imágenes mediante prompts.

Perplexity permite que la IA procese datos confidenciales sin salir del Mac
El nuevo sistema híbrido enruta la información sensible a modelos locales en Apple Silicon, manteniendo el contexto de la tarea.