Grok 4.7: el nuevo modelo de xAI que mejora en código

Qué es Grok 4.7 y por qué importa ahora

xAI presentó Grok 4.7, su modelo más capaz hasta la fecha para coding y knowledge work, entrenado a partir de una base más grande que la de Grok 4.6 y con una corrida de reinforcement learning más larga sobre tareas de varias horas. Lo más disruptivo para founders: se sirve al mismo precio que Grok 4.6 (US$2 por millón de tokens de entrada y US$6 por millón de salida), con una variante rápida al doble de velocidad y al doble de precio.

El anuncio se publica el mismo día en que Elon Musk declaró que Grok 5 será el primer modelo de xAI en alcanzar AGI, y tras semanas de retrasos en el calendario confirmados por Musk en redes —lo que vuelve especialmente relevante el lanzamiento efectivo de 4.7 antes de que Meta y OpenAI saquen sus propias actualizaciones de septiembre.

Qué cambia respecto a Grok 4.6

Grok 4.7 no es un ajuste menor: usa una base completamente nueva, más grande que la de Grok 4.6, y se entrenó con un mix de tareas mucho más exigente, con peso en problemas que tardan muchas horas en completarse. El modelo:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • Verifica mejor su propio trabajo y gestiona contextos largos con más fiabilidad.
  • Fue entrenado para entender de forma nativa el harness de Grok Bot, lo que mejora tareas conversacionales y de conocimiento general.
  • Tiene el stack de safeguards más fuerte que xAI ha testeado, con la mejor tasa de refusals y resistencia a jailbreaks hasta la fecha.
  • Lidera en biosafety con un 62,4% en el benchmark de LatchBio, y en cyber defense deja pasar solo el 3,3% de prompts riesgosos en HackerBench v0.3.

Disponible desde hoy en Cursor, Grok Build, Grok API, terceros de coding harnesses y plataformas cloud.

Cómo queda la tabla comparativa de precios y benchmarks

xAI publicó una tabla comparativa que pone a Grok 4.7 frente a Grok 4.6, GPT-5.6 Solmax y Fable 5.1max. Los números por millón de tokens son los siguientes: Grok 4.7 y 4.6 mantienen US$2 de entrada y US$6 de salida; GPT-5.6 Solmax cobra US$4 y US$20; Fable 5.1max llega a US$10 y US$50. Es decir, Grok 4.7 es la mitad de caro en input y un tercio en output frente a GPT-5.6 Solmax, y entre 5 y 8 veces más barato que Fable 5.1max.

En software engineering, el CursorBench 4.0 (tareas largas de coding) muestra a Grok 4.7 en 46,3% frente al 40,4% de Grok 4.6, al 41,7% de GPT-5.6 Solmax y al 51,8% de Fable 5.1max. En DeepSWE v1.1, Grok 4.7 alcanza 71,0% (high effort), por encima del 65,2% de Grok 4.6 y del 70,0% de Fable 5.1max, aunque por debajo del 72,7% de GPT-5.6 Solmax.

En tareas profesionales largas, el AA Briefcase v1.1 da a Grok 4.7 una puntuación de 1.657, ligeramente por debajo del 1.678 de Fable 5.1max pero por encima del 1.546 de Grok 4.6. En Terminal-Bench 4.0, Grok 4.7 casi duplica a Grok 4.6 (38,0% vs 20,3%) y supera a GPT-5.6 Solmax (37,3%), aunque queda lejos del 57,9% de Fable 5.1max.

Los saltos más interesantes para equipos no técnicos están en trabajo legal y en clinical reasoning. En el Harvey Legal Agent Benchmark, Grok 4.7 marca 19,6%, frente al 15,8% de Grok 4.6, al 6,7% de Fable 5.1max y a un débil 2,5% de GPT-5.6 Solmax. En HealthBench Professional, alcanza 56,7%, mejorando el 48,5% de Grok 4.6, aunque queda detrás del 60,5% de GPT-5.6 Solmax y del 62,1% de Fable 5.1max. En EEBench (ingeniería eléctrica) lidera con 64,0%, muy por encima del 53,0% de Grok 4.6, del 56,4% de Fable 5.1max y del 39,4% de GPT-5.6 Solmax.

El contexto importa: Grok 4.6 ya había llegado al mercado como un modelo Pareto dominante frente a Fable 5 Max, según el análisis de NextBigFuture, con 80% menos en input y 88% menos en output por token. Grok 4.7 hereda esa misma estructura de precios y suma una base más grande.

El trasfondo: calendario, credibilidad y competencia

El lanzamiento llega tras varios retrasos públicos. Musk había estimado Grok 4.7 para «4 semanas» el 24 de julio, luego «unas semanas» el 28 de julio, y «3 a 4 semanas» tras el lanzamiento de Grok 4.6 el 12 de agosto. Cada una de esas ventanas se cerró sin anuncio. El 11 de septiembre, Musk volvió a pedir «unos días más» de RL tuning. En total, cuatro estimaciones públicas fallidas antes de la publicación oficial del modelo, lo que dejó la credibilidad del roadmap de xAI en el centro de la conversación.

El movimiento coincide con la presión competitiva de Meta y OpenAI, que tienen actualizaciones de modelos previstas para septiembre. Y con la propia declaración de Musk del 14 de septiembre, cuando aseguró que Grok 4.7 está a la par de Anthropic Opus 5 y que Grok 5 será el primer modelo de xAI en alcanzar AGI —una afirmación que vino acompañada de caídas del 3,46% en Nvidia y del 6,24% en AMD por el debate sobre seguridad.

Grok 4.7 también refuerza la estrategia de distribución: el 21 de agosto se integró en Google Cloud Vertex AI y previamente en GitHub Copilot, además de mantener presencia en Cursor. Es decir, xAI ya no compite solo por modelo: compite por estar en cada IDE y cada plataforma cloud donde un founder ya escribe código.

¿Qué significa esto para tu startup?

Para un founder hispano, Grok 4.7 cambia poco el coste y mucho el techo de lo que puedes delegarle a un LLM en tareas largas. Si ya trabajabas con Grok 4.6, no hay subida de precio; si estabas en otro proveedor, ahora tienes una alternativa más barata para coding agentic de varias horas.

Acciones concretas que puedes implementar esta semana:

  • Reescribe el coste por feature de tu pipeline de IA. Si tu agente de coding corre tareas de varias horas, modela el coste con la nueva tarifa (US$2/US$6) y compara contra lo que pagas hoy. En un equipo de 5 ingenieros que gastaba US$1.000/mes en otro frontier model, el ahorro puede ser de 50-80%.
  • Mueve trabajo legal y clínico al modelo correcto. El salto en Harvey Legal (19,6%) y HealthBench Professional (56,7%) sugiere que, si tu startup hace revisión de contratos o triage clínico, vale la pena correr un piloto A/B contra tu proveedor actual.
  • Integra el stack de safeguards antes de escalar. Si atendías quejas por jailbreaks o tienes políticas internas de biosafety o cyber defense, el nuevo stack de Grok 4.7 (mejor en refusals y en cyber defense) te da un argumento para un piloto formal.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...