Gemini 4 Argon recupera la corona de Google en la frontera de la IA
Google acaba de presentar Gemini 4 Argon, su nuevo modelo de frontera y el primero de la generación Gemini 4. La compañía asegura que lidera —o empata en el primer puesto— en 13 de los 18 benchmarks que divulgó frente a GPT-6 Astra de OpenAI y Claude Opus 5.5 de Anthropic. Sobre el papel, es la respuesta más sólida de Google en meses a la narrativa de que su cadencia de producto en frontera se había frenado.
La cifra más llamativa para founders y desarrolladores: Argon genera hasta 1 millón de tokens en una sola respuesta, frente a los 64.000 de los Gemini anteriores y a los 128.000 que ofrecen hoy Claude Opus 5.5, Claude Fable 5.1 y GPT-6 Astra. Para una refactorización grande, una auditoría legal o una migración de código, eso significa completar la tarea sin trocearla en varios turnos.
Qué dicen los benchmarks, sin el marketing
Google no dice que barrió a la competencia: la tabla publicada muestra una carrera ajustada. Argon gana en 12 categorías y empata en una; GPT-6 Astra gana en tres y empata en una; Claude Opus 5.5 gana en dos. La diferencia clave es la cobertura: Argon tiene el perfil de «primer puesto» más amplio del grupo.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadLas ventajas más claras para flujos empresariales:
- DeepSWE v1.1 (ingeniería de software de largo horizonte): Argon 77,9% vs. Opus 5.5 74,2% y GPT-6 Astra 74,1%.
- AutomationBench de Zapier (ejecución de negocio de extremo a extremo): Argon 51,3% vs. Opus 5.5 42,5% y GPT-6 Astra 41,4%.
- Harvey Legal Agent Benchmark: Argon 19,6% vs. Astra 5,4% y Opus 5.5 3,8%.
- Vals Index (impacto económico en finanzas, legal, fiscal): Argon 68,9%, por encima de Opus 5.5 (67,0%) y Astra (63,1%).
- LVBench (comprensión de vídeo largo): Argon 91,7% vs. Astra 87,5% y Opus 5.5 83,7%.
- CWE-bench v1 (remediación de vulnerabilidades): Argon y Astra empatan en 68%; Opus 5.5 se queda en 67%.
Donde Argon pierde, la caída no es menor:
- FrontierSWE v2: Astra 65,5% vs. Argon 55,0% (10,5 puntos de desventaja).
- Terminal-Bench Science 0.1: Astra 68,1% vs. Argon 57,6%.
- Terminal-Bench 4.0: Opus 5.5 66,4% vs. Argon 57,4%.
- OSWorld-2.0 (uso de computador): Astra 72,6% vs. Argon 69,2%.
En seguridad frente a prompt injection indirecto (Gray Swan IPI), Argon muestra una tasa de éxito de ataque del 0,7%, frente a 1,0% de Claude Opus 5.5 y Claude Fable 5.1, 8,5% de GPT-6 Astra, 27,0% de GPT-6 Sol, 31,5% de GLM 5.3 y 51,8% de Grok 4.8.
Según MarkTechPost, Artificial Analysis sitúa a Argon a la par de GPT-6 Astra en su Intelligence Index pero al 60% del costo por tarea usando precios descontados.
Argon ya trabaja dentro de Google
La compañía compartió ejemplos internos de uso con miles de empleados:
- Optimización de memoria en centros de datos: agentes de Argon analizaron telemetría de toda la flota e identificaron optimizaciones que liberarán más de 300 TiB, con ahorros estimados de 500 TiB a 1 PiB una vez desplegadas.
- libgav1: agentes reemplazaron 32.000 líneas de código SIMD en el puerto Rust del decodificador de vídeo open source de Google. El resultado corre 2,7 veces más rápido que el puerto Rust original con salida idéntica.
- Migración a Rust: en curso en re2, libgav1 y más de 800.000 líneas en el kernel Zircon de Fuchsia.
- Algoritmo cuántico: Argon superó una línea base publicada en investigación de optimización de recursos de espacio-tiempo en 40% en minutos.
El nuevo playbook de lanzamiento: cyber defenders primero
Google no está abriendo Argon a todo el mundo. El modelo entra primero en el Fairwind Program, un canal anunciado este mes para «defenders cibernéticos de confianza», mientras la compañía participa en el proceso voluntario de pre-lanzamiento del gobierno de EE.UU. Antes del release amplio, Google reforzará cuatro áreas de salvaguarda: uso indebido (incluido CBRN), resistencia a prompt injection indirecto, monitoreo de desalineación y sandboxes aislados para entrenamientos de alto riesgo.
En ciberseguridad, la empresa entrenó a Argon para encontrar, validar y parchear vulnerabilidades críticas de forma autónoma. Wiz ya lo está usando dentro de su iniciativa Scan for Good: el modelo destapó una vulnerabilidad crítica en software hospitalario que afectaba a centros sanitarios en todo el mundo y que, según Google, modelos anteriores de frontera no habían detectado. Para los defenders de confianza y los equipos internos, Argon se entrega sin guardarraíles cibernéticos para que puedan usar toda su capacidad defensiva.
Precio: la otra palanca competitiva
Google anunció precio desde el primer día:
- Introductorio: US$2 por millón de tokens de entrada y US$10 por millón de tokens de salida. Cache de entrada con 95% de descuento → US$0,10 por millón.
- Estándar (tras el periodo introductorio): US$4 entrada / US$20 salida. Cache subiría a US$0,20 por millón.
El precio introductorio coloca a Argon en una quinta parte del precio listado de GPT-6 Astra (US$10 / US$50) y en la mitad de Claude Opus 5.5 (US$4 / US$20). En cache de entrada, es más barato que todos: Opus 5.5 cobra US$0,20, Fable 5.1 US$0,25 y Astra US$1,00. Aun así, una respuesta completa de 1 millón de tokens cuesta US$10 hoy y US$20 mañana: el ahorro por token se compensa con respuestas mucho más largas.
Por qué importa el timing: la presión interna en Google
Este lanzamiento llega tras meses de ruido. The Verge reportó que el nuevo jefe de DeepMind, Koray Kavukcuoglu, dijo que Gemini 4 estaba en fase de refinamiento y podría llegar antes de fin de año, después de que Google no hubiera sacado un flagship desde la serie Gemini 3 en noviembre de 2025, mientras OpenAI y Anthropic avanzaban con GPT-6 y nuevos Claude.
En julio, Reuters señaló que Alphabet enfrentaba presión inversora por el retraso de Gemini 3.5 Pro, el alza del gasto en infraestructura y salidas del equipo de IA. En agosto, Axios y TIME cubrieron la mayor reorganización de liderazgo de IA de Google desde la crisis de OpenAI en 2023: Demis Hassabis dejó la operación diaria de DeepMind para convertirse en Chairman y Chief Scientist de Alphabet; Jeff Dean salió con Sanjay Ghemawat, Oriol Vinyals y Quoc Le a fundar Discovery Loop, una public benefit corporation con Google como inversor fundador y socio cloud; Kavukcuoglu tomó las riendas operativas como SVP reportando a Sundar Pichai.
Según cifras compartidas por Google en esa reorganización, la app Gemini supera 950 millones de usuarios activos mensuales y la familia Gemma alcanza 900 millones de descargas acumuladas en abierto. Kavukcuoglu, ex CTO de DeepMind y Chief AI Architect de Google, era ya desde hacía meses quien lideraba las reuniones sobre Gemini. La lectura que hacen TechRepublic y Reuters es que el cambio busca industrializar el ciclo de releases y acercar la investigación de DeepMind al negocio enterprise.
Qué significa esto para tu startup
Para una startup que ya integra LLMs en producto, hay tres movimientos prácticos a corto plazo:
- Audita tus pipelines por turnos. Si tu agente parte la respuesta en varios turnos por el límite de salida, Argon colapsa el coste por tarea y elimina latencia. Calcula cuánto pagas hoy por millón de tokens de salida y compara con los US$10 introductorios (y US$20 después) de Argon.
- No cambies de modelo por moda; mide por carga de trabajo. Donde Argon lidera (legal, finanzas, automatización de negocio, vídeo largo, migración de código) tiene margen real. Donde pierde (FrontierSWE v2, Terminal-Bench, OSWorld), Astra y Opus siguen siendo mejores. Mantén un router que enrute por tipo de tarea.
- Prepárate para esperar. El acceso amplio está planeado «tan pronto como sea posible» para clientes de API de pago y suscriptores de Google AI Ultra, pero hoy Argon solo llega a defenders de confianza y al proceso voluntario del gobierno de EE.UU. Mientras tanto, prioriza los benchmarks que ya puedes ejecutar localmente (DeepSWE, Vals Index, CWE-bench) sobre tus tres o cuatro cargas más caras.
Fuentes
- Google unveils Gemini 4 Argon, retaking benchmark lead over OpenAI and Anthropic — VentureBeat
- Google announces Gemini 4 Argon AI model, but you can’t use it yet — Ars Technica
- Google announces Gemini 4 and says it’s so capable that only ‘trusted cyber defenders’ can have it right now — The Verge
- Google DeepMind Unveils Gemini 4 Argon with 1M Output Tokens — MarkTechPost
- Google Names Koray Kavukcuoglu Head of Google DeepMind; Demis Hassabis Moves to Strategic Role — CIOL
- Inside Google DeepMind’s Reshuffle After CEO Demis Hassabis Steps Aside — TIME
- Google Overhauls AI Leadership as Hassabis Steps Aside, Dean Leaves — TechRepublic
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













