Qué es livenerf y por qué existe
livenerf es un benchmark open source publicado el 29 de septiembre de 2026 en GitHub por ninjahawk. Su objetivo es estrecho y ambicioso a la vez: medir con estadística pre-registrada si un modelo frontera — en esta primera serie, Claude Opus 5.5 — se degrada después de su lanzamiento. La sospecha lleva meses circulando en la comunidad: que Anthropic (y otros laboratorios) «nerfean» sus modelos días o semanas después del release, ya sea por cuantización, por un modelo más pequeño detrás del mismo nombre, por menor effort de inferencia o por cambios de routing.
El reloj de la serie arrancó dos días y medio después del lanzamiento de Opus 5.5 (22 de septiembre de 2026), con el primer día de medición el 24 de septiembre a las 22:10 UTC. El plan: 30 días consecutivos, una batería de 78 preguntas calibradas y un brazo de control paralelo con Claude Opus 5 para distinguir cambios en el modelo de cambios en el harness.
El rumor del «nerf»: qué significa realmente
«¿Soy yo o el modelo está peor hoy?» es la frase más repetida en foros y redes cada vez que Anthropic, OpenAI o Google actualizan un modelo. La queja se multiplica, pero rara vez viene con datos. livenerf nace para responderla con cifras, no con vibras — la expresión literal del README.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadLa metodología está diseñada contra los argumentos fáciles:
- No se puede hacer que los modelos frontera sean deterministas: los parámetros de sampling están cerrados y no se puede apagar el modo «thinking» — según Unite.ai, Anthropic retiró la opción de desactivar thinking en Opus 5.5. Por eso livenerf congela todo lo demás: prompts, versión de la CLI, graders, directorio de trabajo vacío y logs crudos append-only.
- Las pruebas estadísticas no son caseras: siguen Adding Error Bars to Evals, de Evan Miller (Anthropic), con errores estándar clusterizados por ítem.
- El pre-registro es público: el archivo
PREREGISTRATION.mdse commitea antes del primer día de la serie, y el timestamp de git es lo que da fuerza al compromiso. - Los resultados nulos también se publican: si el modelo no se degrada, el proyecto lo dice igual de fuerte que si se degrada.
Cómo se construye un panel de 78 preguntas que vale la pena correr cada día
El primer paso del proyecto fue calibrar. Se tamizaron 2.336 preguntas de GPQA Diamond, MMLU-Pro, competition math y AIME 2025–26 con 4 muestras cada una. Resultado: Opus 5.5 resuelve bien 93% al primer intento, y un 97% de las preguntas siempre las acierta o siempre las falla. Esas no sirven — no pueden mostrar una caída — así que se descartan.
Lo que queda es el panel: 78 preguntas que el modelo responde bien a veces, ni siempre ni nunca. Cada pregunta se evalúa con 90 muestras diarias durante los 30 días de la serie. La tasa de aciertos en fresco del panel es del 62,0% (medida sobre muestras nuevas, no sobre la calibración), y eso alimenta el cálculo de poder estadístico: con una corrida diaria completa, livenerf puede detectar un cambio de alrededor de 7,5 puntos de accuracy por ventana de 10 días — suficiente para ver el tipo de degradación que los usuarios reportan.
Lo que livenerf ya midió en los primeros 6 días
Según el README actualizado al 29 de septiembre de 2026, el proyecto lleva 6 de 30 días de línea base, sin corridas fallidas. Todo el panel se ha ejecutado bajo el mismo hash de harness (461391b6fce64167) y la misma CLI pinneada (2.1.280).
La parte más interesante son los resultados de validación, que el repo publica antes de la línea base porque cualquier nulidad posterior solo es creíble si el instrumento puede ver primero una degradación conocida. La prueba fue comparar el modelo a esfuerzo «medio» contra esfuerzo «alto» — pasarle al modelo instrucciones explícitas de pensar menos:
- Esfuerzo bajo: −62% tokens de salida y −8,3 ± 4,5 puntos de accuracy.
- Esfuerzo medio: −26% tokens y −4,2 ± 3,9 puntos.
La conclusión práctica: si Anthropic reduce silenciosamente el effort del modelo, el primer sitio donde se nota es en el conteo de tokens, mucho antes de que la accuracy se mueva de forma estadísticamente significativa. Por eso el repo etiqueta el delta de tokens como «señal secundaria más importante».
Lo que livenerf NO puede detectar (todavía)
Honesto sobre sus límites: el repo explica que sustituir Opus 5.5 por Opus 5 bajo el mismo harness no fue distinguible al 99% de confianza en una corrida de validación (−3,8 ± 6,3 puntos, −23% tokens). Con 2,5 veces más muestras en una ventana de 10 días, sigue sin estar demostrado que alcance.
Esto importa para los fundadores: un swap dentro de la misma familia quedaría invisible para este instrumento, al menos con los recursos actuales. La promesa de livenerf es detectar drift de comportamiento (cuantización, menor effort, cambios de routing), no necesariamente un modelo completamente distinto.
Qué significa esto para tu startup
Si tu producto depende de Claude Opus 5.5, la pregunta «¿me están nerfeando?» no es académica: afecta directamente tus costos unitarios y tu SLA de calidad. El modelo ya está disponible en AWS, Google Cloud, Microsoft Azure y la plataforma Claude, con precios de US$4 por millón de tokens de input y US$20 por millón de output (Unite.ai), y los suscriptores de planes Pro, Max, Team y Enterprise recibieron un reset de rate limit utilizable hasta el 22 de octubre (MacRumors).
Dos acciones concretas que puedes tomar hoy:
- Monta tu propio mini-panel de calibración: elige 20–30 tareas representativas de tu producto, congela el prompt y la versión del SDK, y mide accuracy/costo una vez al día. Si ves que el conteo de tokens cae antes que la accuracy, probablemente estás del lado receptor de un cambio de effort. Es lo que hace livenerf, en pequeño y con tu dominio.
- Anota la versión exacta del modelo que está sirviendo tu tráfico en producción. Documenta fecha y métrica si notas cambios: el pre-registro estilo livenerf es lo que separa un reporte creíble de un hilo de Reddit.
La industria detrás del benchmark
livenerf no es un leaderboard ni un framework de evaluación: es, en sus propias palabras, «una serie temporal limpia, narrow a propósito, que aguante el escrutinio de alguien hostil». El proyecto se apoya en Inspect, el framework open source del UK AI Security Institute (el organismo británico de seguridad en IA), y sus estadísticas vienen del trabajo interno de Anthropic sobre barras de error en evals.
El System Card de Opus 5.5, publicado por Anthropic el 22 de septiembre, ya advertía que a estos niveles de capacidad los benchmarks son cada vez menos predictivos de las diferencias reales en producción, y que el propio modelo «sospecha» cuando está siendo evaluado. livenerf responde a ese problema desde el otro lado: en vez de agregar más benchmarks generales, construye uno estrecho, persistente y verificable que pueda sostener una afirmación del tipo «el modelo X se degradó N puntos entre el día 1 y el día 20».
La primera ventana decisional se abre alrededor del 24 de octubre de 2026, cuando se hayan acumulado las dos ventanas de 10 días post-línea base. Hasta entonces, el repo promete publicar null results igual que regresiones — un compromiso poco habitual en un espacio donde confirmar narrativas suele ganar a publicar datos incómodos.
Fuentes
- livenerf: tracking post-launch capability drift in frontier models (GitHub)
- Anthropic Launches Claude Opus 5.5 With Fable-Level Performance at a Lower Price (MacRumors)
- Anthropic Releases Claude Opus 5.5 With Lower Pricing and New Safeguards (Unite.ai)
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













