Gemini 3.7 Flash activa video agentico: 88% menos tokens

¿Qué cambia con la comprensión agentica de video en Gemini?

Google DeepMind anunció este 1 de septiembre el lanzamiento de agentic video understanding (comprensión agentica de video) en sus últimos modelos Flash: Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite. La función ya está disponible para subidas de video y videos de YouTube a través de la API de Gemini en Google AI Studio y en la plataforma Gemini Enterprise Agent Platform, según el blog oficial de DeepMind.

Hasta ahora, analizar un video con un modelo multimodal implicaba procesarlo de forma estática: el sistema ingería el video a una tasa fija de fotogramas por segundo (1 FPS por defecto, ajustable por API). Esto generaba un costo predecible pero brutal para videos largos: un tutorial de 10 minutos o una clase de 90 minutos consumía millones de tokens aunque la mayoría de los fotogramas fueran irrelevantes para la pregunta del usuario.

El nuevo modo agentico invierte la lógica: en lugar de tragar el video completo, Gemini toma un rol activo y dirigido por objetivos, decidiendo qué mirar, a qué velocidad y por qué modalidad (frames, audio o transcripción). Solo carga los momentos y señales que necesita para responder.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

¿Cómo funciona el bucle agentico de video?

El blog de DeepMind lo explica así: cuando recibe una consulta sobre un video, Gemini puede entrar en un bucle agentico e invocar una herramienta interna para cargar solo la parte relevante del archivo. El desarrollador ya podía hacer esto manualmente programando saltos temporales; ahora el modelo lo hace solo.

La diferencia no es trivial. Un ejemplo concreto que aparece en el blog: pedirle a Gemini los «3 anuncios más importantes» de un keynote de una hora. Con el procesamiento estático, la API tendría que muestrear 3.600 frames a 1 FPS para encontrar la respuesta. Con el modo agentico, el modelo salta entre los segmentos donde detecta anuncios, lee los títulos en pantalla o procesa el audio, y devuelve la respuesta con una fracción del costo.

El mismo patrón habilita cuatro casos de uso que DeepMind destaca:

  • Sub-second moment retrieval: detectar cortes de sub-segundo y cambios de estado invisibles a 1 FPS, base para edición automatizada.
  • Long-form needle-in-a-haystack: responder consultas sobre videos de varias horas sin consumir millones de tokens.
  • Anomaly detection: resamplear ventanas de tiempo interesantes a mayor FPS para inspeccionar movimiento rápido o artefactos visuales sutiles.
  • Conteo de acciones y objetos: rastrear movimientos físicos repetidos y objetos distintos a lo largo del video.

¿Qué resultados da en benchmarks reales?

Las cifras del comunicado de DeepMind son concretas: hasta 88% menos consumo de tokens, hasta 66% menos costo de análisis y hasta 7% más de precisión frente al procesamiento estático.

Las ganancias son especialmente pronunciadas en videos largos (tutoriales, clases, grabaciones multi-hora), donde el modo estático obligaba a los desarrolladores a elegir entre pagar tokens altísimos o aplicar técnicas de submuestreo que se comían detalles críticos.

DeepMind coloca a Gemini 3.7 Flash con comprensión agentica en la «frontera pareto» de precisión vs. costo entre los modelos que probaron: es el que ofrece la mejor calidad absoluta y, al mismo tiempo, la mejor combinación de calidad y eficiencia.

Vale la pena recordar el contexto de 3.7 Flash: según Ars Technica, Google lo presentó apenas tres semanas después de Gemini 3.6 Flash. La nueva versión mejoró el puntaje DeepSWE v1.1 de 49 a 65,3 y el FrontierCode 1.1 Main de 34,4 a 43,6, además de subir en WebDev Arena de 1.538 a 1.588, según la misma cobertura. Para developers que ya usan Flash como modelo workhorse, la mejora en código y agentes era esperada; lo nuevo es que esta versión también hereda la capacidad de video agentico.

¿Cuánto cuesta y dónde se puede usar?

DeepMind confirma que la función usa la tarifación estándar de la API de Gemini, sin un fee adicional por la capacidad agentica. Para referencia, Gemini 3.7 Flash tiene un precio introductorio de US$0,75 por millón de tokens de entrada y US$3,75 por millón de tokens de salida hasta fin de 2026, según reportó OnMSFT; el precio de salida es 50% más bajo que el de 3.6 Flash.

Activar el modo es de una línea. El snippet de ejemplo publicado por DeepMind:

from google import genai
client = genai.Client()
interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[{"type": "video", "uri": "https://youtu.be/7Z5Vy9JBANs", "processing": "agentic"},
           {"type": "text", "text": "What are the 3 most important announcements in this keynote?"}]
)

Solo hay que setear processing: "agentic" en la configuración de la API.

Además de los developers, la función se está llevando al consumidor: DeepMind anunció que pronto se desplegará a todos los usuarios de la app de Gemini en los modelos Flash y Flash-Lite, y en los próximos meses potenciará la función «Ask YouTube» en la página de reproducción de videos, entregando respuestas mejor fundamentadas en lo visual.

El contexto: la presión por eficiencia de tokens es la tendencia del sector

Google no está bajando el precio de su API por generosidad. El recorte agresivo en 3.7 Flash y la búsqueda de modos de inferencia más baratos llegan en un mercado donde la factura de IA se ha vuelto un problema de CFO, no solo de CTO.

OpenAI presentó en julio de 2026 su familia GPT-5.6 con tres variantes (Sol, Terra y Luna) y, apenas tres semanas después, recortó el precio de Terra 20% (US$2 entrada / US$12 salida por millón de tokens) y de Luna 80% (US$0,20 entrada / US$1,20 salida), según CNBC. Anthropic respondió con Claude Opus 5 a la mitad del precio de Claude Fable 5, y modelos abiertos chinos como Kimi K3 de Moonshot AI ya compiten en varios benchmarks, de acuerdo con la misma cobertura.

Cuando el proveedor de video más usado del mundo te dice que puede cobrarte 66% menos por hacer lo mismo (o más), la pregunta deja de ser «¿me conviene probarlo?» y pasa a ser «¿puedo seguir justificando mi arquitectura actual de video?».

¿Qué significa esto para tu startup?

Tres acciones concretas para esta semana:

  • Audita dónde pagas por video estático. Si tu producto ingiere videos de YouTube, transcripciones de reuniones o cámaras de seguridad con muestreo a 1 FPS, probablemente estás quemando tokens en frames vacíos. El primer paso es contar cuántos tokens gastas hoy por minuto de video y comparar contra el techo de 88% de ahorro que reporta DeepMind.

  • Migra los casos de «aguja en pajar» primero. Búsqueda sobre horas de grabación, QA de clases grabadas, análisis de partidos, compliance sobre cámaras: todos son escenarios donde el modo agentico muestra su mejor versión. Empieza por un solo caso, mide costo y latencia, y expande desde ahí.

  • Reescala tu pricing si vendes features de video. Si cobras por minuto de video procesado o por número de análisis, una caída del 66% en tu costo marginal te permite o bajar precios para ganar mercado, o mantenerlos y ampliar margen. Cualquiera de las dos funciona; lo que no funciona es ignorar el cambio.

El comunicado oficial confirma que Sergi Caelles, Filip Pavetić, Ahmet Iscen, Suhas Yogin y el equipo de Agentic Vision son los responsables técnicos del lanzamiento.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...