Gemini 4 Argón: la nueva IA más capaz de Google, sin acceso

Fairwind: el programa que decide quién toca Argón primero

Google presentó el 30 de septiembre Gemini 4 Argón, su modelo de inteligencia artificial de frontera más capaz hasta la fecha, y la primera decisión notable no es técnica: es de acceso. Argón no se ha abierto en AI Studio, no está disponible para suscriptores Ultra ni para developers. Por ahora, solo un grupo cerrado de expertos en ciberseguridad puede probarlo, y exclusivamente a través del programa Fairwind.

Fairwind es la vía que Google abrió el 3 de septiembre con el modelo más pequeño Gemini 3.8 Flash Cyber y que, según SiliconANGLE, ya reúne a más de 650 organizaciones, entre ellas CrowdStrike y Palo Alto Networks. Es la primera vez que un laboratorio de primer nivel entrega a un grupo externo un modelo sin las habituales barreras de seguridad cibernética, asumiendo el riesgo de que se use fuera de control. Koray Kavukcuoglu, chief AI architect de Google, justificó el despliegue escalonado como condición necesaria para capacidades a este nivel.

La otra cara de esa potencia es lo que justifica el blindaje. Antes de un lanzamiento más amplio, la compañía asegura estar reforzando cuatro áreas concretas: resistencia a uso indebido en escenarios CBRN (químicos, biológicos, radiológicos, nucleares), defensas frente a inyecciones de prompt indirectas, supervisión de desalineaciones en la cadena de razonamiento y entornos de prueba aislados. En el benchmark IPI de Gray Swan, que mide robustez frente a inyecciones de prompt indirectas, Google asegura que Argón registra la tasa de éxito de ataque más baja de los modelos que ha comparado.

👥 ¿Quieres ir más allá de la noticia?

En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.

👥 Unirme a la comunidad

Qué hace diferente a Gemini 4 Argón de cualquier modelo anterior

La diferencia más técnica y más práctica a la vez es el límite de 1 millón de tokens de salida, frente a los 64.000 de la generación anterior. No es un salto incremental: permite a un modelo generar una base de código completa, redactar un informe legal extenso o producir un análisis financiero exhaustivo sin truncar el razonamiento a mitad. Google construyó el techo de salida a esa altura para acompañar tareas de horizonte largo, las que mide el benchmark DeepSWE v1.1 (ingeniería de software durante sesiones largas).

La multimodalidad también ha dado un salto. En LVBench, que mide comprensión de vídeos largos, Argón alcanza el 91,7% y lidera la tabla. No es un modelo de texto al que después se le añadió visión: fue diseñado como multimodal desde el origen, capaz de analizar gráficos profesionales, identificar detalles en vídeos extensos y razonar sobre series largas de documentos.

Los benchmarks: dónde lidera Argón (y dónde no)

Las cifras que Google publicó colocan a Argón en cabeza en tres categorías distintas. En DeepSWE v1.1 logra 77,9%, por encima del 74,2% de Claude Opus 5.5 y del 74,1% de GPT-6 Astra, según la tabla que reproduce Techmymoney. En AutomationBench de Zapier, la métrica que mide ejecución end-to-end en funciones empresariales, Argón llega al 51,3%, frente al 40,0% que Anthropic publicó para Opus 5.5. En CWE-bench v1, que evalúa remediación autónoma de vulnerabilidades, Argón empata en primer lugar con 68% junto a GPT-6 Astra.

Donde Argón no lidera también es información útil. En FrontierSWE v2 se queda en 55,0%, claramente por detrás del 65,5% de Astra y del 62,3% de Opus 5.5. En Terminal-Bench 4.0 registra 57,4% frente al 66,4% de Opus 5.5. En Terminal-Bench Science 0.1, Astra también gana con 68,1% contra 57,6% de Argón, y en OSWorld 2.0 Astra se impone 72,6% a 69,2%. La conclusión honesta es que Argón es el mejor en tareas largas de ingeniería y automatización empresarial, pero no es el mejor en todo.

La evaluación independiente de Artificial Analysis matiza aún más. En su Intelligence Index, Argón obtiene 53, empatado con GPT-6 Astra. Donde Argón sobresale claramente es en tasa de alucinación: solo 15% frente a 51% de Astra, lo que en la práctica significa que Argón es mucho más propenso a admitir que no sabe una respuesta. Su precisión en esa misma prueba, en cambio, es inferior: 50% frente a 63% de Astra.

Argón ya está trabajando dentro de Google (y de Wiz)

VentureBeat y SiliconANGLE documentan tres aplicaciones internas que ya están en marcha. La más llamativa: agentes de Argón han reescrito más de 800.000 líneas del kernel Zircon del sistema operativo Fuchsia, migrando código C/C++ a Rust con auditorías automáticas y manuales en paralelo. En el decodificador de vídeo de código abierto libgav1, los agentes reemplazaron 32.000 líneas de código SIMD con Rust seguro, generando un decodificador 2,7 veces más rápido que el puerto anterior en Rust, con salida de vídeo idéntica. Y un barrido de telemetría en toda la flota de Google liberó más de 300 tebibytes de memoria en los centros de datos, con un ahorro proyectado por la propia compañía de entre 500 TiB y 1 PiB.

En ciberseguridad aplicada, Wiz — la empresa de seguridad cloud propiedad de Google — integró Argón en su programa Scan for Good, que protege infraestructura pública crítica de forma gratuita. En una prueba inicial, Argón descubrió una vulnerabilidad crítica en software sanitario usado por hospitales de todo el mundo, una vulnerabilidad que los modelos de frontera anteriores no habían detectado. Google no nombró el software, no publicó un aviso independiente y no confirmó si ya está parcheado, por lo que el hallazgo sigue dependiendo por ahora de las palabras de la propia Google.

Cuánto costará Argón cuando llegue a developers

Google no dio fecha para el acceso general, pero sí precio de lanzamiento. La tarifa introductoria es 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida, con un descuento del 95% sobre el precio de entrada para los tokens en caché. Según Techgenyz, la letra pequeña indica que esa tarifa se duplica al final del periodo introductorio, pasando a 4 y 20 dólares por millón de tokens.

Ese precio final coincide exactamente con la lista de Claude Opus 5.5, lanzado por Anthropic el 22 de septiembre, y es una quinta parte de los 10 y 50 dólares por millón de tokens que cobra OpenAI por GPT-6 Astra en su tarifa estándar. Si el rendimiento de Argón se mantiene en uso real más allá de los benchmarks publicados por Google, la ecuación precio-capacidad se vuelve incómoda para los rivales: misma potencia bruta que Astra a un quinto de su coste, según los datos de lanzamiento.

¿Qué significa esto para tu startup?

  1. Diseña tus flujos para tareas de horizonte largo, no para chats cortos. El techo de 1 millón de tokens de salida y los resultados en DeepSWE muestran que la nueva frontera competitiva está en agentes que ejecutan flujos largos sin truncar el razonamiento. Si tu producto depende de un solo modelo barato que responde en pocos segundos, vas un ciclo por detrás de la nueva generación.

  2. No asumas que un solo modelo dominará tu stack los próximos 12 meses. Argón lidera en DeepSWE y AutomationBench, Opus 5.5 gana en Terminal-Bench 4.0, Astra sigue mandando en flujos científicos. La nueva normalidad es orquestar varios modelos por tarea, eligiendo según coste por trabajo completado y no por millón de tokens. Empieza a medir el coste por tarea real, no el precio por token.

  3. Prepárate para que el modelo frontera cambie cada pocas semanas. Google, Anthropic y OpenAI han lanzado modelos significativos en cuestión de días (Argón el 30 de septiembre, Opus 5.5 y GPT-6 Sol el 22 de septiembre). Construye tu producto con abstracciones que te permitan cambiar de modelo en horas, no en sprints. Lo que hoy es la mejor opción en benchmarks puede ser reemplazado en el próximo ciclo.

  4. Si haces ciberseguridad o compliance, evalúa Fairwind como vía de acceso anticipado. El programa ya tiene 650 organizaciones y abre una puerta concreta a Argón sin las guardas estándar. No es una API pública, pero es el camino más corto para probar el modelo antes que el resto del mercado.

Fuentes

👥 ¿Quieres ir más allá de la noticia?

En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.

👥 Unirme a la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...