Qwen3.8 27B solo acierta el 23,57% de las sumas si la respuesta debe ir en palabras
Simon Willison, uno de los analistas más respetados del ecosistema de LLMs, replicó el 4 de octubre un experimento clásico de Colin Frasier sobre Qwen3.8 27B, el modelo open-weight de Alibaba descargable en un portátil. La conclusión es incómoda: cuando se desactiva el razonamiento, el modelo apenas resuelve una de cada cuatro sumas (1.195 de 5.070 casos correctos, 23,57% de accuracy numérica), aunque mantiene el formato de respuesta en palabras en el 96,17% de los intentos.
El test es revelador porque elimina la variable "escribir números". El modelo debe sumar dos enteros positivos y expresar el resultado únicamente con palabras en inglés. La operación es trivial para una calculadora, pero exige al LLM hacer la aritmética mentalmente y luego traducir cada dígito a su forma escrita sin saltarse ninguno.
Por qué cae en picado a partir de 4 cifras
El heatmap publicado por Willison muestra un desplome por número de dígitos:
👥 ¿Quieres ir más allá de la noticia?
En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.
👥 Unirme a la comunidad- Operandos de 1 a 3 cifras: 97,04% de acierto.
- Operandos de 4 a 6 cifras: cae a entre 50% y 80% según la celda.
- Operandos de 7 a 9 cifras: la mayoría de celdas quedan por debajo del 20%.
- Operandos de 10 a 13 cifras: solo el 6,44% de acierto. En muchas celdas, 0%.
Dicho de otro modo, a partir de 7 dígitos el modelo se vuelve casi inútil para esta tarea sin razonamiento activado, aunque su formato de salida siga siendo impecable. Willison apunta que un experimento similar de Frasier con GPT-4o mostraba exactamente el mismo patrón, lo que descarta un problema específico de Qwen.
Con razonamiento medio, el resultado cambia por completo
La parte más interesante llega cuando se enciende el modo "medium reasoning" con el mismo prompt. Willison no pudo correr 30 muestras por celda (el coste en tiempo era prohibitivo), así que ejecutó una sola pareja por celda: 169 intentos en total.
- 167 de 169 aciertos (98,8%).
- Solo dos celdas fallaron: a=2 con b=8, y a=12 con b=9.
- Willison aclara que con un solo intento por celda el resultado es ruidoso y una segunda ejecución daría valores distintos.
Los traces de razonamiento muestran al modelo haciendo lo que un humano haría: alinear cifras, sumar de derecha a izquierda, gestionar el carry y reescribir el número en palabras paso a paso. No es magia: es que encadenar inferencias permite externalizar la cuenta, igual que cuando alguien escribe los pasos en un papel.
¿Qué significa esto para tu startup?
Tres implicaciones prácticas si estás construyendo productos sobre LLMs locales o APIs:
- No confíes en un LLM para aritmética fiable sin cadena de razonamiento. Aunque el formato de salida parezca perfecto, el resultado numérico puede ser incorrecto. Si tu flujo de pagos, conciliación o cálculo de inventario pasa por un LLM, fuerza siempre el modo "thinking" o usa herramientas externas (calculadora, código) en lugar de pedirle el número "en la cabeza".
- Los modelos locales pequeños son viables para prototipar, no para cálculo crítico. El 27B en cuantización Q4KM cabe en ~17 GB según VentureBeat, lo que lo hace ideal para iterar rápido en un Mac o un PC gaming. Pero si tu producto necesita precisión numérica repetible, evalúa antes frente a tu caso de uso y no extrapolations desde benchmarks genéricos.
- El "razonamiento" no es un truco decorativo: cambia el comportamiento del modelo. El salto de 23,57% a 98,8% no viene de más datos, sino de más cómputo en inferencia. Diseña tus prompts para que el modelo pueda pensar antes de responder, y verás diferencias que no aparecen en los benchmarks tradicionales.
Contexto: por qué los LLMs fallan en aritmética
El experimento de Willison es una versión moderna de un problema conocido de los transformers. Estos modelos generan texto token a token prediciendo probabilidades, no ejecutan algoritmos paso a paso como haría una calculadora. Un paper de Apple de 2025 ya mostró que los Large Reasoning Models (LRMs) caen en tareas de complejidad media y se "rinden" antes en problemas complejos incluso teniendo presupuesto de cómputo. El experimento de Willison lo confirma con un test mucho más simple: alinear y sumar dígitos.
La conclusión de fondo no es que Qwen3.8 27B sea "un mal modelo". Al contrario: en el Intelligence Index de Artificial Analysis empata con GPT-5.6 Luna, según The Next Web, y supera a rivales mucho más grandes como DeepSeek V4-Pro (1,7T de parámetros) o GLM-5.2 (753B). Es un modelo excelente que, igual que todos los LLMs actuales, no sabe hacer cuentas mentalmente si no se le permite escribirlas paso a paso.
Recomendación accionable para founders
- Audita cualquier flujo de tu producto que dependa de cálculos del LLM. Busca prompts donde el modelo deba producir un número (totales, diferencias, conversiones, conteos) sin razonamiento explícito. Añade
"reasoning_effort": "high"o fuerza al modelo a mostrar su trabajo antes de dar la cifra final. - Para tareas numéricas repetitivas, combina LLM + tool calling. En lugar de pedir "cuánto es 4.299.366.105.622 + 6.088.794.067.970", deja que el modelo redacte la pregunta y que una función en Python o una API de cálculo resuelva la operación. Es la arquitectura que usan los agentes más serios y la que minimiza alucinaciones numéricas.
- Si corres modelos locales en hardware modesto, asume el trade-off de velocidad. Willison documentó que una simple petición de imagen tardó 21 minutos y más de 22.000 tokens de razonamiento con Qwen3.8 27B en su configuración por defecto. Para uso cotidiano, baja el
reasoning_efforto usa la función Multi-Token Prediction, que según InfoWorld puede triplicar la velocidad de inferencia con caídas de accuracy menores al 3%.
Fuentes
- Qwen3.8 27B addition in words (fuente original)
- Alibaba's new small model runs on a laptop and scores like a cloud one - The Next Web
- Alibaba Releases Qwen3.8-27B Under Apache 2.0 - eWeek
- Apple's LLM study draws an important distinction about reasoning models - 9to5Mac
👥 ¿Quieres ir más allá de la noticia?
En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.
👥 Unirme a la comunidad













