Gemini 4 Argon: Google retoma la carrera de la IA

Gemini 4 Argon y el regreso de Google a la pelea por los modelos frontera

Google presentó Gemini 4 Argon, su nuevo modelo de inteligencia artificial, con cifras en pruebas comparativas (benchmarks) que lo sitúan a la altura de GPT-6 Astra de OpenAI y de los modelos de Anthropic (incluidos Claude Fable 5.1 y Claude Opus 5.5). El anuncio marca el primer lanzamiento de un modelo frontera de Google desde Gemini 3.5 Pro en junio, según reportó Ars Technica, y llega tras un verano en el que la compañía sólo había liberado variantes más pequeñas, lo que abrió dudas sobre si había perdido el tren de la IA generativa de alta gama.

La métrica más comentada es el 77,77% de acierto en el benchmark DeepSWE v1.1, una prueba que mide si un modelo puede completar proyectos de software reales sin supervisión paso a paso. Según Decrypt, ese porcentaje supera el 74,2% de Opus 5.5, el 74,1% de GPT-6 Astra y el 67,4% de Fable 5.1, y duplica con holgura el 49% que Gemini 3.6 Flash alcanzó en julio en la misma prueba. En la plataforma Vals Index —que evalúa tareas financieras, legales, fiscales y de programación—, Argon también lidera según los datos publicados por Google.

Qué dice Google y qué dicen las cifras

Google acompaña el lanzamiento con un arsenal de resultados que cubren 12 de 18 benchmarks a su favor, 1 empate y 5 derrotas, una tabla que incluye categorías como conocimiento, codificación, razonamiento multimodal y ciberseguridad. Entre los números destacados:

👥 ¿Quieres ir más allá de la noticia?

En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.

👥 Unirme a la comunidad
  • 77,77% en DeepSWE v1.1 (ingeniería de software de horizonte largo)
  • 91,7% en el benchmark de LVideos largos LVBench (multimodal)
  • 68% en CWE-bench v1 (seguridad ofensiva), empatado en el primer puesto
  • 0,7% de tasa de éxito en ataques de prompt injection indirecta en la prueba de Gray Swan —frente a 1,0% de Opus 5.5 y Fable 5.1, 8,5% de GPT-6 Astra y más del 51% de Grok 4.6 y Kimi K3

La diferencia más publicitada de Argon no es una puntuación más alta, sino su ventana de salida de 1 millón de tokens por respuesta, lo que equivale a unas 750.000 palabras frente a las ~48.000 de los modelos Gemini anteriores. Según Ars Technica, ese techo permite ejecutar migraciones de código, razonamiento extendido o tareas complejas sin trocear la operación en varias llamadas, algo clave en flujos agénticos donde cada corte pierde contexto.

Según Artificial Analysis, Gemini 4 obtiene 53 puntos en su Intelligence Index, idéntico a GPT-6 Astra, mientras que su tasa de alucinaciones en AA-Omniscience es del 15% frente al 50% de Astra — pero los datos publicados en Xataka aclaran que parte de esa mejora se debe a que el modelo tiende a responder "no lo sé" en lugar de inventar, una conducta que mejora la métrica pero no necesariamente la utilidad real.

El problema: los benchmarks y lo que pasa fuera del laboratorio

Pero los benchmarks, por muy sofisticados que sean, siguen siendo pruebas acotadas: tareas delimitadas, verificables y reproducibles. Bloomberg habló con empleados de la empresa que confirman que, en tareas de programación reales, el modelo "no va tan fino" como en las pruebas, mientras que Sundar Pichai asegura que el uso interno es extensivo y los resultados son buenos.

Según la nota original de Xataka, Sundar Pichai sostiene que sus equipos lo utilizan de forma extensiva y están obteniendo buenos resultados, y Ars Technica añade que Argon ya contribuyó a ahorrar 300 TiB de memoria en la infraestructura interna y a reescribir más de 800.000 líneas del kernel Zircon de Fuchsia OS de C/C++ a Rust. Son números de adopción corporativa muy concretos, pero no sustituyen la prueba con clientes reales.

Acceso, ciberseguridad y el lanzamiento más vigilado de Google

El lanzamiento llega con un acceso extraordinariamente limitado. Gemini 4 Argon no se libera de forma masiva, sino que primero se entrega a un grupo selecto de "probadores de confianza" y a equipos de ciberseguridad a través del programa Fairwind, según Xataka y TechCrunch. El modelo se entrenó específicamente para trabajo defensivo en seguridad y Google afirma que puede "encontrar, validar y parchear fallos de software críticos de forma autónoma". El equipo de seguridad Wiz ya lo está utilizando a través de su programa Scan for Good.

El acceso escalonado seguirá este orden según Digital Trends: primero clientes de API de pago y suscriptores de Google AI Ultra (USD 200/mes); después, desarrolladores, clientes empresariales y consumidores de pago, probablemente en una variante reducida. Sin fecha confirmada para el lanzamiento masivo.

Esta cautela responde a un patrón reciente: según Decrypt, versiones tempranas de Claude Mythos de Anthropic ayudaron a encontrar 271 vulnerabilidades en Firefox, y OpenAI opera su propio programa Trusted Access for Cyber. Google también está participando en el proceso del gobierno estadounidense de acceso previo voluntario para modelos nuevos.

Precio: la verdadera arma competitiva

Google apuesta por precio. Durante el periodo promocional, Argon cuesta USD 2 por millón de tokens de entrada y USD 10 por millón de tokens de salida, con un descuento del 95% en tokens cacheados. Pasada la promoción, los precios se duplican a USD 4 y USD 20 por millón, respectivamente. Google no ha comunicado cuándo termina la promoción.

Según Artificial Analysis, citado por Xataka, con el coste promocional Gemini 4 logra un coste por tarea un 40% inferior a GPT-6 Astra. El techo de 1 millón de tokens de salida tiene una consecuencia directa: una sola respuesta al máximo de la ventana costaría unos USD 20 al precio estándar, un dato recogido por Ars Technica que cambia el cálculo en flujos agénticos largos.

El contexto que faltaba: 1.000 millones de usuarios en Gemini

El lanzamiento llega cuando la base de usuarios de Gemini se ha disparado. Sundar Pichai anunció en agosto de 2026 que la app de Gemini superó 1.000 millones de usuarios activos mensuales, según TechCrunch. Es el decimocuarto producto de Google en alcanzar esa cifra y, según The Verge, el crecimiento más rápido de cualquier producto en la historia de Alphabet: de 400 millones en mayo de 2025 a más de 1.000 millones en poco más de un año.

Alphabet ha presupuestado alrededor de USD 200.000 millones en infraestructura de IA para 2026, según The Motley Fool, una cifra que justifica la presión por tener un modelo frontera competitivo. Mientras tanto, OpenAI anunció en junio de 2026 que ChatGPT también superó los 1.000 millones de usuarios activos, lo que confirma que la carrera ya no es por alcanzar esa cifra, sino por encontrar qué hacer con esa audiencia y cómo monetizarla.

¿Qué significa esto para tu startup?

El patrón de los últimos meses es que los modelos frontera rotan: lo que hoy lidera en benchmarks, en seis meses puede quedar segundo. Gemini 4 Argon no cambia de inmediato tu stack —no puedes usarlo todavía—, pero sí cambia el coste de oportunidad de algunas decisiones técnicas y comerciales:

  • Reevaluá tu contrato de API trimestral, no anual. Si tu gasto en tokens depende en más del 20% de un único proveedor, diseñá una capa de abstracción que permita enrutar entre OpenAI, Anthropic y Google según precio y latencia. El diferencial del 40% por tarea entre Gemini 4 promocional y GPT-6 Astra no es permanente, pero el patrón de guerra de precios sí lo es.
  • Probá la promoción cuando abras el acceso. Cuando Argon llegue al plan AI Ultra y a la API de pago, corré tus 5 prompts más caros contra GPT-6 Astra y Opus 5.5 antes de que termine la ventana promocional. Mide no sólo precio, sino alucinaciones y "no lo sé" como métrica aparte.
  • Esperá antes de pivotar tu producto hacia una ventana de 1 millón de tokens. La promesa es enorme (no trocear migraciones de código o informes largos), pero el coste al precio estándar (USD 20 por respuesta máxima) puede comerse el margen de un SaaS. Diseñá tu pricing con un plan "Lite" que limite tokens de salida.

Conclusión

Gemini 4 Argon confirma que la carrera por los modelos frontera tiene tres jinetes consolidados —Google, OpenAI y Anthropic— y que las diferencias entre ellos se miden cada vez más en decimales y en precio, no en saltos generacionales. Para un founder, el movimiento relevante no es cuál es el #1 hoy, sino construir un stack que pueda cambiar de modelo sin reescribir el producto. Y, sobre todo, no tomar decisiones de arquitectura basadas en un benchmark que ningún usuario real ha probado todavía.

Fuentes

👥 ¿Quieres ir más allá de la noticia?

En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.

👥 Unirme a la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...