Google vuelve al frente con Gemini 4 Argon y un millón de tokens de salida
Después de meses en la sombra, Google DeepMind presentó el 30 de septiembre Gemini 4 Argon, su primer modelo de la generación 4, y lo hace con dos cifras que cambian la conversación: un límite de 1 millón de tokens de salida por respuesta (frente a los 64.000 anteriores) y primer puesto en 13 de 19 benchmarks publicados por la propia compañía frente a GPT-6 Astra, Claude Opus 5.5 y Claude Fable 5.1, según Google.
Para un founder hispanohablante que está eligiendo modelo para construir agentes, esto importa por dos razones concretas: el precio de entrada (US$2 por millón de input y US$10 por millón de output con 50% de descuento) es la mitad de Opus 5.5 y una quinta parte de Fable 5.1, y la ventana de salida de 1M elimina la fragmentación de tareas largas en docenas de llamadas. Pero el acceso es limitado: el modelo entra primero al programa Fairwind, un grupo cerrado de defensores cibernéticos y agencias del gobierno de Estados Unidos, antes de abrirse al resto.
Qué cambia el millón de tokens de salida
Hasta ahora, los modelos frontier —Claude Opus 5.5, Claude Fable 5.1 y GPT-6 Astra— comparten un techo de 128.000 tokens de salida por respuesta. Argon rompe ese techo por un factor de 7,8x. La consecuencia práctica, según Google, es que tareas de refactorización de código, generación de informes extensos o migraciones completas pueden ejecutarse en una sola trayectoria en lugar de tener que dividirse en múltiples llamadas encadenadas manualmente.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadEl matiz técnico: Vals reporta un máximo efectivo de 262.000 tokens en uso estándar. Para llegar a 1M hay que activar Long Decode Continuation, una nueva función de la API que pausa la respuesta larga y la retoma en llamadas siguientes. Artificial Analysis confirmó que, con esa técnica, llegó al millón de tokens. Quien construya agentes debe saberlo: la salida de 1M no sale "gratis" en una sola request, sino que requiere gestionar continuidad entre llamadas.
El precio de una respuesta completa de 1M de tokens es US$10 al tarifario introductorio y US$20 cuando termine el período promocional — Google no dijo cuándo.
Benchmarks: dónde Argon gana y dónde se queda corto
Google publicó una tabla de 19 benchmarks en conocimiento, codificación agéntica, ingeniería ML, ciencia, contexto largo, computer use, multimodal y ciberseguridad. Argon queda primero o empate en 14 de ellos según la lectura de Office Chai sobre los datos publicados, y primero absoluto en 13 según el conteo de Latent Space. La imagen completa, sin embargo, no es lineal: hay áreas donde Argon queda claramente por debajo.
Donde lidera:
- DeepSWE v1.1 (ingeniería de software de horizonte largo): 77,9%, nuevo estado del arte. Opus 5.5: 74,2%, Astra: 74,1%.
- Vals Index (impacto económico en finanzas, código, legal e impuestos, ponderado por peso en PIB de EE.UU.): 68,9%, primero.
- AutomationBench (Zapier, ejecución de tareas de negocio end-to-end): 51,3% contra 42,5% de Opus 5.5 y 31,4% de Fable 5.1.
- Harvey Legal Agent: 19,6% contra 5,4% de Astra y 6,7% de Fable 5.1.
- LVBench (comprensión de vídeo largo): 91,7% contra 87,5% de Astra y 83,7% de Opus 5.5.
- Contexto largo (256K-1M tokens): 84,2% frente a 71,8% de Astra, 66,8% de Opus 5.5 y 65,0% de Fable 5.1.
Donde queda atrás:
- FrontierSWE v2: 55,0% contra 65,5% de Astra — la mayor brecha, 10,5 puntos.
- Terminal-Bench 4.0: 57,4% contra 66,4% de Opus 5.5.
- OSWorld-2.0 (computer use): 69,2% contra 72,6% de Astra.
- Terminal-Bench Science 0.1: 57,6% contra 68,1% de Astra.
El patrón es claro: Argon brilla en tareas de razonamiento sostenido, conocimiento estructurado y código de horizonte largo, pero pierde frente a Opus 5.5 y Astra en tareas terminales — agentic coding que requiere ejecutar comandos de shell durante muchos pasos.
Otras evaluaciones independientes:
- Artificial Analysis Intelligence Index: Argon obtiene 53, igualando a GPT-6 Astra (53) y superando a GPT-6.1 Sol (52).
- Costo por tarea (con descuento): US$1,99 frente a US$3,26 de Astra. El ahorro viene del precio, no de eficiencia: Argon usa en promedio 62.000 tokens de output por tarea contra 27.000 de Astra.
- AA-Omniscience (alucinación): 15% de Argon contra 51% de Astra, aunque a costa de menor accuracy: 50% frente a 63%.
- CWE-bench v1 (remediación de vulnerabilidades): 68% — empate con Astra y Grok 4.7.
Acceso, precio y el plan de despliegue
Argon no está disponible al público general todavía. El despliegue ocurre en cuatro fases, según Google:
- Defensores cibernéticos de confianza y agencias del gobierno de EE.UU. a través del programa Fairwind, sin guardarraíles de ciberseguridad para aprovechar todo el potencial defensivo.
- Clientes de pago de la API y suscriptores de Google AI Ultra, en una segunda fase.
- Desarrolladores, empresas y consumidores en una fase posterior, una vez Google refine los guardarraíles con feedback de los primeros testers.
Precios confirmados:
- Input: US$2 por millón de tokens (introductorio), US$4 después.
- Output: US$10 por millón de tokens (introductorio), US$20 después.
- Cache de input: 95% de descuento → US$0,10 por millón de tokens cacheados, el más bajo del segmento.
A modo de comparación con los precios de tarifa (no introductorios) reportados por TechRepublic:
- Claude Opus 5.5: US$4 / US$20
- Claude Fable 5.1: US$10 / US$50
- GPT-6 Astra: US$10 / US$50
El descuento introductorio de Argon lo deja al nivel de GPT-6 Sol (US$2 / US$10), el modelo más barato del segmento antes de este anuncio. Google no anunció fecha de fin del período promocional.
El remezón que precedió a Argon
El lanzamiento llega tras un año complicado para Google DeepMind. En agosto, Sundar Pichai anunció que Demis Hassabis pasaba de CEO de DeepMind a Chairman y Chief Scientist de Alphabet, y que Koray Kavukcuoglu, hasta entonces CTO, asumía como nuevo SVP de DeepMind. Varios investigadores senior —incluido Jeff Dean— dejaron la compañía, según reportó Mashable citando a Bloomberg y Fortune.
La demora de Gemini 3.5 Pro (anunciado en I/O para junio, todavía en testing en septiembre) había dejado a Google hundido en los rankings: Gemini 3.6 Flash puntuaba 34,0 en el Intelligence Index v4.3.2, 24 puntos detrás de Opus 5.5 (57,6), según datos citados por Forkast. La compañía había caído al puesto 14 en Arena y al 25 en Code Arena. Kavukcuoglu confirmó en un summit el 23-24 de septiembre que Gemini 4 entró en post-training, con un objetivo de lanzamiento "mucho antes de fin de año".
Argon es la materialización de esa promesa —aunque en formato preview, no general availability.
Qué significa esto para tu startup
Si estás eligiendo un modelo frontier para construir agentes, codificación o automatización, Argon introduce tres vectores de decisión que no existían hace una semana.
1. Tareas largas de generación: la barrera cambia. Con 1M de tokens de salida (vía Long Decode Continuation), Argon permite por primera vez ejecutar migraciones de código, generación de informes extensos o refactorizaciones grandes en una sola trayectoria. Para founders que estaban troceando trabajos en docenas de llamadas y pagando el overhead cognitivo de mantener coherencia entre ellas, esa fricción se reduce. Acción concreta: audita tus agentes actuales e identifica flujos fragmentados por el límite de 128K — son candidatos naturales para probar Argon cuando abras acceso.
2. Precio: la guerra de tarifas se intensifica. El descuento introductorio de US$2 / US$10 iguala a GPT-6 Sol y rompe la barrera psicológica de los US$10/M de output que mantenían Opus 5.5 y Fable 5.1. Si tu arquitectura permite cambiar de proveedor, ahora tienes un nuevo actor en la conversación de costos por tarea. Acción concreta: modela el costo por tarea de tu agente con Argon (US$1,99 según Artificial Analysis) y compara con el tuyo actual — si el descuento se mantiene, el ahorro potencial es real.
3. Ciberseguridad: oportunidad real, pero todavía en acceso restringido. Argon no está disponible públicamente, pero las señales internas son fuertes: 68% en CWE-bench v1 (empate con Astra y Grok 4.7) y uso ya en producción por Wiz dentro del programa Scan for Good, donde el modelo identificó una vulnerabilidad crítica en software hospitalario. Si tu startup tiene un componente de seguridad defensiva o pentesting automatizado, este es el espacio donde Google está concentrando su primera oleada de acceso. Acción concreta: evalúa si encajas en el perfil Fairwind (defensor de confianza, agencia gubernamental o equipo de seguridad con mandato claro) y solicita acceso anticipado — Google no reveló criterios específicos, pero los casos de uso defensivo tienen prioridad.
Lo que todavía no puedes hacer: no hay fecha para acceso general, no hay benchmarks de producción en startups reales (solo despliegues internos de Google y un caso de Wiz) y Argon queda detrás de Opus 5.5 en Terminal-Bench 4.0 (57,4% contra 66,4%), así que si tu agente depende de shell pesado, el trade-off no es favorable todavía.
Fuentes
- AI News: Gemini 4 Argon — Latent Space
- Google announces Gemini 4 Argon AI model, but you can't use it yet — Ars Technica
- Google DeepMind Unveils Gemini 4 Argon with 1M Output Tokens — MarkTechPost
- Google Unveils Flagship AI Model Gemini 4 Argon — Forklog
- Google Introduces Gemini 4 Argon, Beats GPT 6 Astra And Opus 5.5 On Many Benchmarks — Office Chai
- Google's Gemini 4 Enters Post-Training — Forkast
- Where is Gemini 3.5 Pro? The case of the missing AI model — Mashable
- GPT-6 Sol vs Claude Opus 5.5: Coding, Pricing, and AI Agents — TechRepublic
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













