Google aprieta el acelerador: tres Flash en seis semanas
El 2 de septiembre, Google presentó Gemini 3.8 Flash, su tercera variante Flash en apenas seis semanas, tras los lanzamientos de Gemini 3.6 Flash a finales de julio y Gemini 3.7 Flash semanas después. El nuevo modelo llega en dos versiones: una general, que Google describe como su «workhorse» más inteligente hasta la fecha, y una especializada en ciberseguridad llamada Gemini 3.8 Flash Cyber.
Lo que más llama la atención no es el ritmo de publicación, sino el salto en programación: en el benchmark DeepSWE v1.1, que mide la capacidad de resolver problemas complejos de ingeniería de software de forma autónoma, Gemini 3.8 Flash obtuvo 73,7%, apenas por debajo del 74% de Claude Opus 5 y muy por encima de Gemini 3.7 Flash, Claude Sonnet 5, GPT-5.6 Sol y GPT-5.6 Terra, según los datos publicados por Google y recogidos por Android Authority.
Qué mide DeepSWE v1.1 y por qué importa
DeepSWE v1.1 es una prueba diseñada para evaluar si un modelo puede completar tareas de ingeniería de software de principio a fin, sin intervención humana: entender un ticket, escribir código, ejecutarlo y corregir errores. No se trata de generar snippets aislados, sino de mantener el hilo durante sesiones largas.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadQue un modelo del tamaño de Flash quede a 0,3 puntos de Claude Opus 5 sugiere un cambio relevante en la relación rendimiento/costo para equipos técnicos. Para una startup que necesita automatizar revisiones, refactors o migraciones de código, la diferencia entre 74% y 73,7% suele ser marginal; la diferencia de precio, no.
Google también destaca que Gemini 3.8 Flash supera a los modelos mencionados en otros benchmarks relevantes para founders: Vals Finance Agent V2 (análisis financiero agéntico), Harvey’s Legal Agent Benchmark (flujos legales complejos), CharXiv Reasoning (síntesis de información), Terminal-bench 2.1 (codificación agéntica en terminal) y LVBench (comprensión de vídeo largo), según la cobertura de Android Authority. En el test HLE-Verified, que evalúa razonamiento en STEM, humanidades y áreas profesionales, el modelo alcanzó 54,9%, de acuerdo con la nota original de Geekzilla.
El precio: barato por token, pero cuidado con el consumo real
Google mantiene el precio introductorio de 3.7 Flash: US$0,75 por millón de tokens de entrada y US$3,75 por millón de tokens de salida, vigente hasta el 31 de diciembre de 2026, cuando pasará a US$1,50 / US$7,50. Ars Technica y The Verge confirman que, incluso al nuevo precio, sigue siendo más económico que Claude Opus 5 y GPT-5.6 Sol.
Sin embargo, hay un matiz clave que Artificial Analysis (citado por The Verge) pone sobre la mesa: aunque el precio por token no cambia respecto a 3.7 Flash, el costo efectivo por tarea sube alrededor de un 40%, porque el modelo usa un 30% más de tokens de salida y da más «vueltas» en evaluaciones agénticas. Es la consecuencia directa del eslogan interno de Google: «3.8 Flash works harder». El modelo ejecuta más pasos de razonamiento y llama a herramientas de forma iterativa cuando la tarea lo requiere.
Para un founder, esto significa que comparar solo el precio por token es una trampa: hay que medir el costo por tarea completada. Si tu producto automatiza flujos con muchas iteraciones, el ahorro real podría ser menor del esperado. Si tus tareas son cortas y deterministas, el ahorro es claro.
Gemini 3.8 Flash Cyber: el gemelo blindado
Junto al modelo general, Google lanzó Gemini 3.8 Flash Cyber, una variante afinada para detección y parcheo de vulnerabilidades. No estará abierta al público: el acceso se canaliza a través del nuevo Fairwind Program, un programa cerrado para «socios de confianza» que, según The Verge, ya cuenta con unos 650 miembros, entre ellos CrowdStrike y el Center for Internet Security.
Los números que comparte Google, según Android Authority y AndroidSage:
- 86,2% en el benchmark C/C++ de detección de vulnerabilidades (supera a Gemini 3.5 Flash Cyber y a modelos más grandes como Mythos 5 y GPT-5.5-Cyber).
- 71% de tasa de éxito en descubrimiento de vulnerabilidades reales en más de 20 lenguajes (frente al 58,9% de 3.7 Flash y al 46,6% de 3.5 Flash Cyber).
- 2,6 veces más parches correctos para vulnerabilidades de Chrome que los mejores modelos comerciales más grandes probados internamente.
- En el benchmark externo CWE-Bench (gestionado por Collinear), logra un 47,2% pass@1, casi en la frontera Pareto con un modelo líder que marca 47,8%, pero a menor costo.
Para el ecosistema, la señal es clara: Google está moviendo ficha en la carrera de IA aplicada a defensa, donde ya competían Anthropic y OpenAI con sus propios modelos enfocados en seguridad.
El calendario europeo y el elefante en la sala: Gemini Pro sigue congelado
The Next Web apunta un detalle regulatorio que pesa en cada lanzamiento: bajo el Artículo 53 del EU AI Act, cada modelo de propósito general colocado en el mercado europeo requiere documentación técnica, política de copyright y resumen público de datos de entrenamiento. Los modelos con riesgo sistémico (entrenados con más de 10^25 operaciones de punto flotante) deben notificarse a la Comisión en un plazo de dos semanas, más corto que el intervalo entre 3.7 y 3.8 Flash.
Mientras tanto, Ars Technica recuerda que la línea Gemini Pro no se actualiza desde principios de 2026: el modelo «flagship» sigue estancado y cada vez parece más improbable que veamos el prometido Gemini 3.5 Pro. Todo el músculo de Google en este momento va a la familia Flash. Y en el horizonte se asoma Gemini 4, según Mashable.
¿Qué significa esto para tu startup?
1. Reevalúa tu stack de código agéntico esta semana. Si tu producto depende de Claude Opus 5 o GPT-5.6 Sol para tareas de ingeniería largas, vale la pena correr un piloto con Gemini 3.8 Flash midiendo costo por tarea completada, no solo por token. La paridad en DeepSWE v1.1 y el precio introductorio hasta diciembre crean una ventana ideal para comparar sin renegociar contratos.
2. Diseña pensando en el consumo real, no en el precio por token. El aviso de Google y los datos de Artificial Analysis son una llamada de atención: cuando un modelo «trabaja más», el costo sube aunque el precio unitario no cambie. Instrumenta tus agentes con métricas de tokens por tarea y costo por workflow completado antes de migrar producción.
3. Si trabajas en ciberseguridad, postula al Fairwind Program. El acceso a Gemini 3.8 Flash Cyber está restringido, pero la barrera de entrada (650 miembros y crecimiento) puede ser razonable para empresas con necesidades legítimas de defensa. Para startups de seguridad, esta variante puede marcar diferencia en auditorías y respuesta a incidentes.
El movimiento de Google deja una lectura clara para los próximos meses: la batalla por la programación agéntica ya no se decide solo por benchmarks, sino por el costo total de automatizar un workflow de software de extremo a extremo. Y ahí, Flash acaba de poner el listón más alto del mercado.
Fuentes
- Gemini 3.8 Flash presume importantes avances en programación – Geekzilla
- Gemini 3.8 Flash is out with a new focus on cybersecurity – Android Authority
- Google releases Gemini 3.8 Flash and a cybersecurity variant limited to governments – TNW
- Google Gemini 3.8 Flash is Fast, Specialized in Cybersecurity – AndroidSage
- Google says its new Gemini 3.8 Flash model ‘works harder’ but might cost more – The Verge
- Google releases Gemini 3.8 Flash, its third Flash model in six weeks – Ars Technica
- Can Gemini 3.8 Flash Close the Gap? Google Takes Aim at OpenAI and Anthropic – Mashable India
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













