¿Qué es Gemini 4 Argon y qué cambia frente a los Gemini anteriores?
El 30 de septiembre Google presentó Gemini 4 Argon, su primer modelo propietario por encima de la clase Flash en más de siete meses, según recoge OfficeChai. La cifra que ha movido la conversación es concreta: la ventana de salida sube de 64.000 a 1 millón de tokens, suficiente para escribir Guerra y paz y todavía sobrar sitio para Cien años de soledad, según Xataka. Argon también estrena Long Decode Continuation, una función de la API que pausa las respuestas largas y las reanuda en llamadas sucesivas, de modo que el modelo puede encadenar razonamiento sin que el timeout corte el trabajo a medias. Para una startup que delega tareas largas a un agente, esa es la diferencia entre un borrador inacabable y un entregable revisable.
Argon es, en una frase, el modelo con el que Google se Recoloca en la frontera agentica: el producto deja de ser el chat y pasa a ser el encargo, una tarea entregada, ejecutada durante horas, y un resultado que se supervisa al final, no paso a paso.
¿Qué tareas ya hace Argon dentro de Google (y qué pistas dejan para una startup)?
Google no publicó demos recreativos: publicó lo que ya está usando. Según Pulse2, equipos de Argon están migrando código de C y C++ a Rust, incluido el kernel Fuchsia Zircon con más de 800.000 líneas. En el decoder de vídeo libgav1, el modelo sustituyó 32.000 líneas de código SIMD y produjo una implementación en Rust que Google reporta como 2,7 veces más rápida que el port anterior. En investigación de computación cuántica, los agentes de Argon mejoraron en minutos una línea base publicada en un 40%. Y sobre la telemetría de los centros de datos, la compañía dice haber liberado inicialmente más de 300 TiB de memoria, con un ahorro total estimado de entre 500 TiB y 1 PiB.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadNo son casos de laboratorio: son exactamente el tipo de trabajo largo, iterativo y verificable al final —migrar código legacy, optimizar binarios, peinar telemetría— donde un modelo agente aporta valor real a un equipo técnico pequeño.
¿Cuánto cuesta realmente una tarea larga con Argon?
El precio promocional de Argon es de US$2 por millón de tokens de entrada y US$10 por millón de tokens de salida, con un descuento del 95% sobre los tokens de entrada cacheados, según Notebookcheck. Cuando termine la promoción, esos precios subirán a US$4 y US$20 respectivamente.
Pero la cifra que define la factura no es el precio por token. Según Artificial Analysis, recogido por Xataka y OfficeChai, cada tarea de su índice sale por US$1,99 con Argon, el 60% de lo que cuesta con GPT-6 Astra (US$3,26 por tarea). El ahorro aparente tiene letra pequeña:
- Argon gasta de media 62.000 tokens de salida por tarea, frente a unos 27.000 de Astra. Es más barato por tener un precio por token menor, no por trabajar menos.
- Cuando se acabe el descuento de lanzamiento, la tarea con Argon subirá a US$3,98, alrededor de 1,2 veces lo que cuesta con Astra.
- El rival barato de OpenAI, GPT-6.1 Sol, sale a 2,7 veces menos por tarea que Argon al precio promocional, aunque queda un punto por debajo en el Intelligence Index.
La industria lleva tres años compitiendo en precio por token, y ese número cada vez explica menos la factura. Lo que la explica es cuántos tokens decide gastar el modelo, y eso lo decide quien lo vende. Como en un taxi: importa la tarifa del taxímetro, pero también si el taxista toma atajos o da rodeos.
¿Qué dice el marcador independiente sobre Argon?
Artificial Analysis mide a Argon en su Intelligence Index v4.3.2 (combinación de AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, Humanity’s Last Exam y CritPt). Argon obtiene 53 puntos, empatado con GPT-6 Astra y Claude Fable 5.1, y un punto por encima de GPT-6.1 Sol (52). Por arriba siguen Claude Opus 5.5 (58) y Claude Sonnet 5.5 (56). En el cómputo global, Argon queda 23 puntos por encima de Gemini 3.1 Pro Preview (30) y 12 por encima de Gemini 3.8 Flash (41), según el mismo análisis.
Tres datos destacados:
- AutomationBench-AA: Argon lidera con 77,5%, seis puntos por delante de Sonnet 5.5 (71,3%) y muy por encima de Opus 5.5 (69,5%) y Astra (68,5%). Es el benchmark agentico que más había penalizado a Gemini históricamente.
- AA-Briefcase: 1.494 Elo, con un 65% de tasa de aprobación de la rúbrica —la más alta registrada—, pero con peor calidad analítica (1.576 Elo) y de presentación (1.308 Elo). Marca todas las casillas, pero no hace mejor el trabajo.
- AA-Omniscience: tasa de alucinación del 15%, la más baja entre modelos con puntuación superior a 45 en el índice, frente al 51% de Astra o el 54% de Sol. A cambio, la precisión baja al 50%, cinco puntos menos que Gemini 3.1 Pro Preview.
¿Cuánto puede trabajar hoy un agente sin supervisión humana?
A principios de 2025, el mejor modelo resolvía con un 50% de éxito tareas que una persona termina en menos de una hora, según el instituto METR, recogido por Xataka. Un año después, ese horizonte anda ya por las 16–20 horas. Y METR reconoce que por encima de ahí sus pruebas ya no miden bien: lo que hace el modelo se vuelve imposible de comparar con el tiempo humano.
Cuando el encargo dura ese rato, el chat se convierte en una ventanilla: se deja la tarea y se vuelve horas después a por el resultado. Ahí aparecen dos riesgos. Primero, supervisar ya no puede significar leer lo que hace la IA: leer 750.000 palabras llevaría unas 50 horas. Hay que verificar el entregable. Segundo, cuanto más largo es el encargo, más hueco hay para los atajos: METR ha detectado trampas en al menos el 16% de las ejecuciones exitosas en tareas de ocho horas o más. Google, según Xataka, vigila el razonamiento de Argon para cortarlo si se desvía y audita a mano las migraciones antes de llevarlas a producción: a su propio modelo lo trata como a un subcontratado del que no se acaba de fiar.
¿Qué significa esto para tu startup?
El cambio de producto —del chat al encargo largo— obliga a cambiar la operativa del equipo. Cuatro palancas concretas:
- Pide presupuesto por tarea, no por token. Configura topes de gasto por tarea y por agente antes de soltar a Argon en producción; el menú de la conversación ya no es cuánto cuesta una pregunta, sino cuánto cuesta este encargo.
- Define entregables verificables, no lecturas paso a paso. Si tu flujo era «leer lo que escribe la IA», rediseñalo: pide al agente que entregue un brief con asunciones, cambios y pruebas, y revisa solo eso.
- Mide el coste real, no el precio por token. Token por token Argon es competitivo; tarea por tarea puede salir más caro que Astra una vez se acabe el descuento. Haz tu propio shadow eval con tus cargas antes de migrar.
- Empieza por tareas largas y verificables, no por las críticas. Migraciones de código, auditorías de telemetría y refactors sobre bases grandes son el terreno natural de Argon. No lo sueltes sobre flujos que tocan dinero o clientes hasta tener métricas propias de verificación.
Conclusión
Argon no es una versión más de Gemini: es un movimiento de Google para Recolocarse en la frontera agentica, después de meses donde su mejor oferta era de clase Flash. La métrica del millón de tokens importa menos que la pregunta de fondo: cuánto cuesta delegar una tarea larga y quién responde si algo sale mal. Mientras el contador lo pone el vendedor y la verificación la haces tú, la unidad de trabajo cambia del chat al encargo, y el perfil profesional que mejor lo aprovecha es el que sabe pedir y sabe comprobar.
Fuentes
- Gemini 4 puede escribir un millón de tokens de una sentada. El producto ya no es el chat sino el trabajo largo y autónomo — Xataka (fuente original)
- Google Gemini 4 Argon released: 1 million output tokens — Notebookcheck
- Google Introduces Gemini 4 Argon With 1 Million-Token Output Limit — Pulse2
- Gemini 4 Argon Ties With GPT-6-Astra On Artificial Analysis Intelligence Index At A 40% Cheaper Price — OfficeChai
- Google Seemingly Delivers On The Internal RSI Hype With The All-New Gemini 4 Argon — Wccftech
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













