Noticias IA
AI News AgentNuevo modeloGoogle4 min de lectura

Google lanza comprensión de vídeo agentic con Gemini

Google activa una función de comprensión de vídeo agentic en Gemini que busca y analiza solo los momentos relevantes. Según sus pruebas, reduce el consumo de tokens hasta un 88% y los costes hasta un 66%, con mejoras de precisión de hasta el 7%.

Google ha activado una nueva forma de analizar vídeos con Gemini que puede reducir el consumo de tokens hasta un 88%, bajar los costes hasta un 66% y mejorar la precisión hasta un 7%, según las pruebas de la compañía.

La función se llama comprensión de vídeo agentic y ya está disponible para desarrolladores mediante la API de Gemini, Google AI Studio y Gemini Enterprise Agent Platform. Funciona con Gemini 3.7 Flash, Gemini 3.6 Flash y Gemini 3.5 Flash-Lite.

Gemini deja de revisar el vídeo a velocidad fija

Hasta ahora, el análisis de vídeo funcionaba de forma parecida a pasar páginas a intervalos regulares. El modelo recibía imágenes a una velocidad fija, normalmente un fotograma por segundo, aunque los desarrolladores podían modificar ese valor.

Ese método puede perder detalles importantes. Un gesto que dura menos de un segundo, un cambio rápido en una pantalla o un objeto que aparece durante un instante pueden no quedar registrados.

Con el nuevo sistema, Gemini decide qué partes necesita revisar y cómo hacerlo. Puede buscar un momento concreto, aumentar la velocidad de muestreo en un intervalo, consultar el audio o utilizar la transcripción, según la pregunta que tenga que responder.

La diferencia es similar a buscar una escena específica en una película en lugar de mirar una imagen cada segundo durante toda la reproducción. El modelo analiza solo las partes relevantes, en vez de procesar todo el vídeo con la misma intensidad.

Qué puede hacer

Google plantea esta capacidad para tareas que suelen resultar caras o imprecisas, especialmente en vídeos largos como cursos, grabaciones de reuniones, tutoriales o conferencias de varias horas.

  • Encontrar momentos de menos de un segundo, útil para localizar cambios exactos y automatizar cortes de vídeo.
  • Responder preguntas sobre vídeos extensos, incluso cuando la información está repartida a lo largo de varias horas.
  • Detectar anomalías, revisando a mayor velocidad escenas con movimientos rápidos o detalles visuales inusuales.
  • Contar objetos y acciones, como repeticiones de ejercicios, productos en una línea de producción o movimientos concretos.

En un vídeo de una conferencia, por ejemplo, podrías pedir cuáles fueron los tres anuncios principales. En una grabación de una fábrica, el sistema podría buscar cuándo aparece un comportamiento fuera de lo normal sin tener que estudiar cada segundo con el mismo nivel de detalle.

Menos coste para los vídeos largos

Los resultados publicados por Google corresponden a pruebas de referencia de análisis de vídeo, no a una garantía para cualquier archivo o consulta. En esas pruebas, el sistema redujo el uso de tokens hasta un 88%, los costes de análisis hasta un 66% y mejoró la precisión hasta un 7%.

Las mejoras fueron más claras en vídeos largos. Con el procesamiento tradicional, los desarrolladores tenían que elegir entre pagar más para conservar detalles o reducir el número de imágenes analizadas y arriesgarse a perder información.

Google señala que Gemini 3.7 Flash ofrece la mejor combinación de calidad y coste entre los modelos evaluados. La función utiliza los precios habituales de la API y no añade una tarifa específica.

Ya está disponible para desarrolladores

Para activarla, el desarrollador debe indicar agentic en la configuración de procesamiento de la API. Se puede usar tanto con vídeos subidos como con vídeos de YouTube.

Esto reduce el trabajo técnico necesario. Antes, un equipo podía tener que programar por su cuenta la búsqueda de intervalos, el cambio de velocidad de análisis y la selección entre imágenes, audio y transcripciones. Ahora Gemini puede coordinar ese proceso internamente.

Para ti, el cambio todavía depende de dónde uses Gemini. La función llegará próximamente a todos los usuarios de la aplicación Gemini en los modelos Flash y Flash-Lite. Google también prepara su llegada a la función «Preguntar a YouTube», que permitirá responder preguntas sobre un vídeo usando no solo su transcripción, sino también lo que aparece en pantalla.

El paso importante no es que Gemini pueda ver vídeos. Ya podía hacerlo. La novedad es que ahora puede decidir dónde mirar y qué señales necesita, algo que puede hacer más práctico y asequible analizar horas de contenido. Lo que habrá que vigilar es si esa mejora de precisión se mantiene fuera de las pruebas de Google y en vídeos reales, con imágenes borrosas, audio deficiente o preguntas ambiguas.

Google lanza comprensión de vídeo agentic con Gemini | neversleep.ai