Qué son Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking
Google lanzó este 15 de septiembre de 2026 sus nuevos modelos de diálogo en tiempo real: Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, disponibles a través de la API de Gemini, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live y Google Workspace, según reportó Unite.ai.
Ambos modelos están pensados para conversaciones por voz naturales y continuas, pero apuntan a perfiles de uso distintos:
- Gemini 3.8 Live: optimizado para escala y eficiencia de costo. Procesa audio en tiempo real, ofrece visual grounding (entiende lo que «ve» por cámara o pantalla) y cambia automáticamente entre 97 idiomas sin interrumpir la conversación. Además, ejecuta llamadas a herramientas y APIs en segundo plano mientras el diálogo continúa.
- Gemini 3.8 Live Extended Thinking: añade razonamiento multi-paso que corre en paralelo con la voz, lo que le permite confirmar la petición, narrar el progreso y resolver tareas complejas sin romper el flujo conversacional.
Google sostiene que la versión Extended Thinking alcanzó el primer puesto en el Speech to Speech Quality Index de Artificial Analysis con 82.6 puntos, y lidera en tareas agentic con 68.6% en τ-Voice y 35.1% en τ-Voice-banking de Sierra, además de 97.7% en Big Bench Audio. La versión base, según la compañía, se posicionó segunda en el Speech Agent Arena.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadQué cambia con Vercel AI Gateway
El lanzamiento en Vercel AI Gateway —anunciado en el changelog oficial de la plataforma— es relevante porque elimina varias de las fricciones típicas para productizar estos modelos:
- API unificada: los equipos pueden enrutar a Gemini 3.8 Live o a cualquier otro modelo soportado desde un mismo punto, sin gestionar credenciales separadas por proveedor.
- Tokens de corta duración:
gateway.experimental_realtime.getToken()genera un token efímero que abre la sesión WebSocket, reduciendo la superficie de exposición de claves largas. - Failover y retries integrados: el gateway ya ofrece reintentos, conmutación por error y optimizaciones de uptime por encima de lo que da cada proveedor.
- Adaptador listo para WebSocket: el SDK de Vercel se encarga de serializar y parsear eventos de realtime, lo que evita escribir a mano el protocolo de streaming.
El ejemplo publicado en el changelog muestra el flujo completo: instalar @ai-sdk/gateway@latest y ws, pedir el token, abrir el WebSocket con la configuración que devuelve el adaptador y consumir eventos como audio-transcript-delta, response-done y error.
Por qué importa para el ecosistema realtime
La integración con AI Gateway llega en un momento en que el tráfico de modelos de voz en vivo está creciendo con fuerza. Google enumera entre sus partners de Live API a Agora, Fishjam, LiveKit, Pipecat, Vercel y Vision Agents para el transporte de medios, y a Salesforce, Genspark y Lumeris como integradores empresariales, según Unite.ai.
Para los founders hispanohablantes esto significa que construir asistentes de voz producción en español —o en configuraciones multilingües con 97 idiomas y cambio automático como ofrece Gemini 3.8 Live— ya no requiere levantar la infraestructura de streaming desde cero.
El propio CEO de Vercel, Guillermo Rauch, explicó en entrevista con TechCrunch la tesis que sustenta este movimiento: «Ahora dicen: entiendo cómo funciona esto — modelo, harness, plataforma de datos, sandbox, gateway — cada pieza es plug and play». En esa misma nota, Vercel reportaba más de 6 millones de despliegues diarios y más de 1 billón de tokens diarios fluyendo por su AI Gateway.
¿Qué significa esto para tu startup?
Si estás construyendo o evaluando un producto con voz en vivo, el anuncio de hoy te da tres palancas concretas:
- Prototipar sin atarte a un proveedor: usar AI Gateway como capa de abstracción te permite arrancar con Gemini 3.8 Live por latencia y costo, y migrar después a otro modelo (OpenAI, Anthropic o un open-source como DeepSeek) cambiando solo el
modelId. - Diseñar UX «voz + razonamiento»: la variante Extended Thinking es la primera en permitir que el asistente piense y hable al mismo tiempo. Úsala para casos donde el usuario necesita feedback mientras una tarea larga corre en background —por ejemplo, conciliaciones bancarias, generación de planes de marketing o troubleshooting técnico.
- Aprovechar el multilingüismo automático: el cambio entre 97 idiomas sin cortar la conversación es útil para productos B2C en LATAM y España, donde un mismo usuario puede mezclar español, inglés y portugués en una misma sesión.
Acciones concretas esta semana
- Replicar el quickstart de Vercel: clona el ejemplo del changelog, conecta un cliente WebSocket y mide latencia y costo por minuto de audio frente a tu proveedor actual. Tener números propios te deja negociar con proveedores.
- Auditar qué partes de tu producto realmente necesitan «voz en vivo»: si solo requieres transcripción o comandos cortos, un endpoint batch sigue siendo más barato. Reservá Gemini 3.8 Live para flujos conversacionales que justifiquen la tarifa de streaming.
- Probar Extended Thinking en un caso agentic: por ejemplo, un asistente que combine llamada a una API de tu producto con narración del progreso. Es el patrón que Google mostró en su demo coordinando reservas de restaurantes sin interrumpir la conversación.
Lo que aún falta verificar
- Precios por minuto/segundo de Gemini 3.8 Live y de su variante Extended Thinking en AI Gateway: Vercel no publica la tabla específica para estos modelos y Google, según Unite.ai, solo indica que Extended Thinking mantiene un precio «altamente competitivo» frente a modelos frontera, sin cifras concretas.
- Disponibilidad regional y de cuotas: el anuncio menciona preview privada en Gemini Enterprise y rollout escalonado en Workspace, pero no detallan ventanas de acceso por país.
- Latencia end-to-end en WebSockets a través de AI Gateway frente a la conexión directa con Google: no se encontró un benchmark público que permita compararlos.
Si esos datos son críticos para tu decisión, el camino más rápido es medirlos tú mismo con el playground de modelos que el changelog habilita dentro de AI Gateway.
Fuentes
- Gemini 3.8 Live models now available on AI Gateway — Vercel Changelog (fuente original)
- Google Launches Gemini 3.8 Live and Extended Thinking Voice Models — Unite.ai
- Vercel CEO Guillermo Rauch on the fight to split off models from agents — TechCrunch
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













