Google reduce costes de IA con 350 tokens por segundo y pricing desde US$ 0,30 por millón
Google acaba de lanzar tres nuevos modelos de la familia Gemini que cambian la ecuación coste-rendimiento para founders que construyen agentes de IA en producción: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite (capaz de generar 350 tokens de salida por segundo) y Gemini 3.5 Flash Cyber (especializado en ciberseguridad). El lanzamiento, anunciado el 21 de julio de 2026, llega con pricing competitivo: desde US$ 0,30 por millón de tokens de entrada para Flash-Lite y US$ 1,50 por millón para 3.6 Flash. Para un founder que escala agentes IA, esto significa reducir la factura mensual de API sin sacrificar velocidad ni calidad.
¿Qué ofrece cada modelo y cuándo usarlo?
Google ha segmentado claramente los tres modelos según el caso de uso, evitando la confusión habitual de lanzamientos anteriores.
Gemini 3.6 Flash es el "caballo de batalla" optimizado para coding, trabajo de conocimiento y tareas multimodales. Según datos de Google citados en el Artificial Analysis Index, este modelo reduce el uso de tokens de salida en 17% frente a Gemini 3.5 Flash, y en algunos benchmarks alcanza hasta 65% menos consumo. Esto no es marginal: si tu startup ejecuta agentes que procesan documentos largos o generan código extenso, el ahorro se acumula rápidamente. Está disponible de forma general (GA) en Google AI Studio y Gemini API desde el 21 de julio de 2026.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadGemini 3.5 Flash-Lite apunta al extremo opuesto: velocidad máxima y coste mínimo. Con 350 tokens de salida por segundo, es la opción más rápida de la línea Flash-Lite, diseñada para flujos de alto volumen como traducción masiva, clasificación de datos, extracción de información y automatización de tareas repetitivas. Su pricing de US$ 0,30 por millón de tokens de entrada y US$ 2,50 por millón de salida lo posiciona como la alternativa económica para startups que procesan grandes volúmenes con latencia crítica.
Gemini 3.5 Flash Cyber es el modelo especializado en seguridad cibernética, diseñado para detectar, validar y corregir vulnerabilidades en código a gran escala. A diferencia de los otros dos, su disponibilidad es restringida: opera en piloto con gobiernos y socios de confianza a través de CodeMender, la plataforma de Google para hardening de código. Google no ha publicado el pricing exacto, pero indica que el coste por token es inferior al de modelos más grandes como Gemini Pro.
Pricing y eficiencia: la nueva ventaja competitiva
La estrategia de pricing de Google para estos modelos revela una apuesta clara por capturar el mercado de agentes IA en producción, donde el coste por tarea es más relevante que el rendimiento bruto.
| Modelo | Input (US$/M tokens) | Output (US$/M tokens) | Tokens/segundo | Caso de uso principal |
|---|---|---|---|---|
| Gemini 3.6 Flash | 1,50 | 7,50 | No especificado | Coding, agentes, multimodal |
| Gemini 3.5 Flash-Lite | 0,30 | 2,50 | 350 | Alto volumen, baja latencia |
| Gemini 3.5 Flash Cyber | No publicado | No publicado | No especificado | Ciberseguridad, CodeMender |
Para ponerlo en perspectiva: si tu startup procesa 10 millones de tokens de salida al mes con Gemini 3.5 Flash estándar, la factura sería de aproximadamente US$ 75. Con Gemini 3.6 Flash, ese mismo volumen costaría US$ 63,75 (ahorro de 17%), y si logras las optimizaciones de benchmark (65% menos tokens), la factura caería a US$ 26,25. En escala, esto representa miles de dólares mensuales para startups con agentes IA intensivos.
La reducción de tokens no es solo un truco de pricing: Gemini 3.6 Flash genera respuestas más concisas sin perder calidad, lo que también reduce la latencia percibida por el usuario final. Para productos B2C o B2B con experiencia de usuario sensible al tiempo de respuesta, esto es tan valioso como el ahorro económico.
Ciberseguridad con IA: el nicho que Google prioriza
El lanzamiento de Gemini 3.5 Flash Cyber responde a una tendencia creciente: la integración de IA en pipelines de DevSecOps y revisión de código automatizada. Google posiciona este modelo como una herramienta para equipos de AppSec que necesitan triage rápido de vulnerabilidades, hardening de código y detección de patrones de riesgo.
Lo distintivo de Flash Cyber es su integración con CodeMender, la plataforma de Google que combina IA con reglas de seguridad validadas. A diferencia de modelos generales que pueden generar falsos positivos o pasar por alto vulnerabilidades contextuales, Flash Cyber está afinado específicamente para:
- Detección de vulnerabilidades en código fuente
- Validación de parches de seguridad
- Revisión automatizada antes de despliegue
- Orquestación con agentes de seguridad existentes
La disponibilidad restringida (piloto con gobiernos y socios) sugiere que Google está priorizando casos de uso de alta criticidad antes de una apertura general. Para startups de ciberseguridad o equipos internos de seguridad, vale la pena solicitar acceso temprano a través de Google AI Studio o contactar directamente con el equipo de CodeMender.
¿Qué significa esto para tu startup?
Si estás construyendo agentes de IA, automatizando flujos de trabajo o integrando capacidades de lenguaje natural en tu producto, estos lanzamientos te dan tres palancas concretas para optimizar costes y rendimiento.
Acción 1: Audita tu consumo actual de tokens y evalúa migrar a 3.6 Flash
Revisa tu facturación de Gemini API de los últimos 3 meses. Si usas Gemini 3.5 Flash o modelos anteriores para tareas de coding, análisis de documentos o generación de contenido largo, calcula el impacto de migrar a 3.6 Flash. Con una reducción de 17% en tokens de salida (y hasta 65% en algunos casos), el ROI de la migración es inmediato. La API es compatible sin cambios de código: solo actualiza el model ID a gemini-3.6-flash en tus llamadas.
Acción 2: Segmenta tus flujos por modelo según latencia y coste
No todos tus casos de uso necesitan el mismo modelo. Implementa una lógica de enrutamiento:
- Usa Gemini 3.5 Flash-Lite para tareas de alto volumen y baja criticidad (clasificación, extracción, traducción masiva) donde los 350 tokens/segundo marcan diferencia en experiencia de usuario.
- Usa Gemini 3.6 Flash para tareas complejas que requieren razonamiento, coding o multimodalidad (análisis de PDFs con imágenes, generación de código, agentes con herramientas).
- Reserva modelos Pro o Ultra solo para casos donde el rendimiento de 3.6 Flash no sea suficiente (benchmarks internos te dirán cuándo).
Esta segmentación puede reducir tu factura de API entre 30-50% sin impacto perceptible en calidad.
Acción 3: Explora Flash Cyber si tienes pipeline de seguridad
Si tu startup desarrolla software con requisitos de seguridad (fintech, healthtech, enterprise B2B), solicita acceso al piloto de Gemini 3.5 Flash Cyber a través de CodeMender. Integrar revisión de código automatizada con IA especializada puede reducir el tiempo de auditoría de seguridad de semanas a horas, y detectar vulnerabilidades antes de que lleguen a producción.
Competencia directa: Claude, GPT y la guerra de los agentes
Este lanzamiento no ocurre en el vacío. Anthropic con Claude Sonnet/Haiku y OpenAI con GPT-4o / GPT-4.1 compiten directamente en el mismo segmento: modelos eficientes para agentes de IA en producción. La ventaja de Gemini 3.6 Flash es su integración nativa con el ecosistema Google (Android Studio, Workspace, Cloud) y su pricing agresivo. Para founders hispanohablantes que ya usan Google Cloud, la migración es más sencilla que cambiar de proveedor.
Sin embargo, si tu stack ya está en Azure (GPT) o valoras capacidades específicas de Claude (ventana de contexto de 200K tokens, menor tasa de alucinaciones en benchmarks independientes), la decisión depende de pruebas A/B con tus casos de uso reales. Lo crítico es no quedarte en un modelo ineficiente por inercia: la diferencia de coste entre modelos puede ser de 5-10x para el mismo volumen de tareas.
Disponibilidad y próximos pasos
Gemini 3.6 Flash y Gemini 3.5 Flash-Lite están disponibles de forma general (GA) desde el 21 de julio de 2026 en:
- Google AI Studio (interfaz web para prototipado)
- Gemini API (integración programática)
- Android Studio (para desarrollo móvil con IA)
- Selectos productos de Google (integraciones progresivas)
Gemini 3.5 Flash Cyber está en piloto restringido con gobiernos y socios de confianza. Si tu startup trabaja en ciberseguridad o tiene requisitos de compliance estrictos, contacta a Google Cloud o explora CodeMender para solicitar acceso.
Google también anunció que Gemini 3.5 Pro estará disponible "tan pronto como esté listo", sin fecha concreta. Esto sugiere que la compañía priorizó los modelos eficientes (Flash) sobre los de máximo rendimiento (Pro), alineándose con la demanda del mercado: founders que necesitan coste predecible y latencia baja más que benchmarks de laboratorio.
Fuentes
- Google lanza Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber
- Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber - Google Blog
- Gemini 3.6 Flash | Gemini API - Google AI for Developers
- Los nuevos Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber - Infobae
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













