Por qué importa la comparación entre Luna y Astra para tu startup
GPT-5.6 Luna cuesta US$0,20 por millón de tokens de entrada y US$1,20 por millón de tokens de salida. GPT-6 Astra cuesta US$10 y US$50, respectivamente. En el mismo pull request, una revisión con Luna costó US$0,0041 y con Astra US$0,113, una diferencia de 28x según el benchmark que publicó Entelligence este septiembre de 2026.
La pregunta que responde el análisis no es cuál modelo es "mejor", sino qué pierdes cuando decides mandar cada cambio de código por el modelo más barato. Es exactamente la decisión que enfrentan los equipos de engineering cuando la factura de inferencia empieza a escalar: ¿vale la pena pagar 28 veces más para cazar los bugs adicionales, o el modelo barato cubre el 75% del trabajo por el 3,6% del costo?
Los números del benchmark: 143 bugs verificados en 50 PRs
Entelligence, la empresa que publicó la comparación, usó 50 pull requests públicos del repositorio AI-Code-Review-Evals — diez de cada uno entre Cal.com, Sentry, Discourse, Keycloak y Grafana. Cada PR introduce defectos deliberadamente sobre una rama limpia. Luna y Astra recibieron el mismo prompt, buscando bugs de correctness, seguridad, concurrencia, recursos y manejo de errores, excluyendo estilo, nombres, docs y sugerencias de tests.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadLos hallazgos de Luna, Astra, GPT-5.6 Sol y los comentarios del revisor público de Entelligence se mezclaron en una lista anonimizada por PR. GPT-6 Astra y GPT-5.6 Sol juzgaron cada hallazgo por separado contra el diff, agrupando duplicados y decidiendo si el issue era un bug real. Un hallazgo solo contaba como verificado cuando ambos jueces coincidían. Coincidieron en el 91% de los casos: 143 bugs distintos pasaron el filtro.
| Métrica | GPT-5.6 Luna | GPT-6 Astra |
|---|---|---|
| Bugs verificados | 69 | 92 |
| Hallazgos emitidos | 93 | 96 |
| Precisión | 74% | 96% |
| Costo total, 50 PRs | US$0,20 | US$5,66 |
| Costo por bug verificado | US$0,0030 | US$0,061 |
| Tiempo medio por review | 23s | 36s |
| Tokens de salida por review | 2.104 | 688 |
Luna encontró el 75% de los bugs que Astra, por el 3,6% del dinero. Por cada bug verificado, Astra costó 20 veces más. Y aunque Luna escribió 3,1 veces más tokens por review, su precio de salida es 42 veces menor, así que aún así salió más barata. Además, terminó cada review en 23 segundos frente a 36 de Astra.
Dónde Luna falla: autenticación y permisos
El primer dolor que sentiría tu equipo es la diferencia de precisión. Cerca de uno de cada cuatro comentarios de Luna no pasó verificación, contra 4 de 96 de Astra. Los developers ya hojean los comentarios de IA; van a hojear más cuando una cuarta parte es ruido.
La grieta más grande está en el tipo de cambio. En Sentry, Discourse y Grafana, Luna quedó a dos bugs verificados de Astra. En Cal.com la brecha fue de 21 a 30. En Keycloak, la distancia explotó: Luna encontró 6 bugs verificados frente a 14 de Astra, y solo el 50% de sus hallazgos en Keycloak se sostuvieron frente al 93% de Astra.
El propio Keycloak explica el porqué: es un servidor de identity and access management, y la mayoría de los PRs del benchmark cambian lógica de autenticación y permisos. El desglose por clase de bug apunta en la misma dirección. En bugs de data y lógica, el grupo más grande, Luna encontró 39 frente a 47 de Astra. En concurrencia, 10 frente a 13. En seguridad, Luna encontró 9 de los 24 bugs y Astra encontró 19.
Dos ejemplos de Keycloak que Astra cazó y Luna no:
- Los códigos de recuperación federada nunca se marcaban como usados, así que un código podía reutilizarse.
- Un permiso global de vista sobreescribía denials configurados cliente por cliente.
Ninguno se ve mal en una sola línea. Solo se descubre razonando qué permite el modelo de permisos después del cambio.
Lo que Luna caza y Astra se pierde
La comparación no es unidireccional. De los 143 bugs verificados, 44 los encontraron ambos modelos, 48 solo Astra y 25 solo Luna. De los 25 exclusivos de Luna, 16 son bugs de data/lógica y 4 son de concurrencia. En Discourse, repetir una solicitud de unsubscribe bajaba más y más el nivel de notificación del usuario. En Sentry, un bug de concurrencia reemplazaba hilos workers unhealthy sin detener los anteriores.
Correr ambos modelos en cada PR habría detectado 117 de los 143 bugs verificados (82%) por US$5,86 totales, los US$0,20 de Luna sumados a los US$5,66 de Astra, a cambio de 25 bugs adicionales.
Por qué los números pueden moverse entre ejecuciones
Los lectores del post anterior de Entelligence pidieron tres controles que el equipo incorporó:
- ¿Los modelos solo recordaban el fix? Los repos son públicos y los fixes del benchmark podrían estar en su historial. El test propuesto era dividir los PRs por fecha para ver si el ranking se mantiene en cambios posteriores al cutoff de entrenamiento. No se pudo correr acá: las fechas detrás de los PRs van de 2013 a julio de 2025. 20 son de 2025 y ninguno cae después del cutoff de ninguno de los dos modelos. El grupo post-cutoff sería vacío. El riesgo es menor de lo que suena: los defectos se añadieron a estos PRs para el benchmark a propósito, así que el bug exacto de cada diff no es un commit entrenable. El código alrededor sí es viejo y público, y un modelo que conoce cómo se ve la versión correcta tiene ventaja.
- ¿Los modelos encuentran los mismos bugs dos veces? Se re-correaron dos PRs por codebase con configuración idéntica. Astra tuvo 15 bugs verificados en esos diez PRs en la primera corrida; 10 volvieron en ambas repeticiones y 14 en al menos una. Luna tuvo 15; 7 volvieron en ambas y 12 en al menos una. La muestra es pequeña, pero confirma que un modelo que encuentra un bug en una corrida puede no encontrarlo en la siguiente, y a Luna le pasa más que a Astra.
- ¿Qué bugs no flaggeó nadie? Medir falsos negativos necesita una lista completa de bugs por PR, que el benchmark no publica. Sí se puede dar un piso: 26 bugs verificados se los perdieron Luna y Astra y solo los agarraron Sol o el revisor de Entelligence. La cifra real es mayor, porque bugs que ningún revisor marcó nunca entran al pool.
Límites del estudio
- Astra es competidora y a la vez uno de los dos jueces. Requerir que Sol coincida reduce el sesgo sin eliminarlo.
- Cada PR es pre-existente al cutoff de ambos modelos, así que el split por fecha no se puede correr.
- Ambos modelos vieron solo el diff y nada más: sin historial del repo, call graph ni datos de producción.
- Cada modelo revisó cada PR una vez, salvo los diez repetidos; las corridas repetidas muestran que los resultados se mueven.
- Los conteos verificados son un piso de los bugs presentes, y el benchmark no tiene lista completa contra la cual medir.
Qué significa esto para tu startup
La conclusión práctica no es elegir un modelo, sino construir un enrutador que mande cada cambio al modelo correcto. El propio Entelligence ofrece dos rutas: revisiones con contexto de todo el repositorio, o un Model Router para coding agents que manda pasos rutinarios a modelos baratos y los pasos difíciles a los fuertes.
Tres acciones concretas que podés aplicar esta semana:
- Empezá con un piloto en 30-50 PRs tuyos que después necesitaron un fix. Corré Luna y Astra con el mismo prompt y verificá los hallazgos con un juez que no sea ninguno de los dos. Los datos que publique Entelligence son una guía, no tu benchmark.
- Etiquetá qué archivos tocan autenticación y permisos, y mandá esos por Astra. Para el resto, Luna cubre la mayoría de los bugs de correctness a una fracción del costo.
- Monitoreá el ruido en el dashboard de PRs, no solo la cantidad de bugs. Una precisión del 74% significa que un cuarto de los comentarios de Luna serán falsos positivos; si tu equipo los ignora por defecto, también ignorará los verdaderos.
El contexto de mercado: el code review con IA ya no es opcional
Los números de Entelligence se mueven en un mercado donde Disney decidió en julio de 2026 dejar GitHub Copilot y adoptar el coding tool de OpenAI. Según Business Insider, ocho empleados tech de Disney dijeron que "rara vez o nunca" usaban Copilot, y un ingeniero senior reportó que el 80% de su uso de IA era Claude desde la terminal.
El ecosistema de code review se está estratificando. Hackernoon publicó en 2026 un mapa de herramientas para GitLab donde Qodo, CodeRabbit, Greptile y SonarQube aparecen como las alternativas dedicadas, con capacidades distintas de soporte para self-hosted, integración CI y cross-repo context. GitHub Copilot Code Review sigue siendo solo GitHub. La decisión en 2026 ya no es "IA sí o no para revisión", sino qué modelo corre cada categoría de cambio y con qué contexto.
El benchmark de Luna contra Astra confirma una hipótesis que la fragmentación de precios en LLMs hace económica: el modelo barato detecta la mayoría de los bugs; el modelo premium detecta los más caros. La diferencia entre perder y ahorrar está en saber cuál es cuál en cada pull request.
Fuentes
- GPT-5.6 Luna vs GPT-6 Astra: Is a $1.20 Model Good Enough for Code Review? — Entelligence
- Best AI Code Review Tools for GitLab (2026) — Hackernoon
- Disney is ditching Microsoft's GitHub Copilot and adding OpenAI's Codex — Business Insider
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad














