Qwen 1.7B: construye un modelo de decisión calibrado

Un modelo de 1.7B que decide en un solo paso

Un modelo de decisión no redacta: elige. En lugar de generar una respuesta token a token, evalúa un conjunto fijo de opciones y devuelve cuál es la más probable, junto con la probabilidad asignada a cada una. La premisa es simple: si las alternativas ya están definidas, el modelo no necesita escribir nada.

El experimento publicado por Nish Tahir lo demuestra con un modelo pequeño: Qwen/Qwen3-1.7B, cinco opciones (A a E) y una sola pasada de inferencia. Frente a la pregunta «¿de qué color es el cielo?», el modelo devolvió B (Blue) con 0,9988 de probabilidad y descartó el resto casi por completo.

La diferencia técnica con un LLM tradicional es de arquitectura de inferencia. Con Structured Output, para generar un JSON válido el modelo necesita una pasada por cada token de la respuesta — en el ejemplo del autor, 11 pasadas. Un modelo de decisión, como los que propone Jev, enmascara el vocabulario para que solo pueda emitir los tokens de las opciones permitidas y resuelve todo en una sola pasada. Menos cómputo, menos latencia, menos costo.

Leíste lo que hace la IA. ¿Y en tu negocio?

En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.

👥 Probar 7 días

Structured Output y modelos de decisión: ¿son lo mismo?

No. Y confundirlos es el primer error que cometen los equipos que llevan LLM a producción.

Structured Output (o constrained decoding) garantiza que la salida cumpla un esquema. Amazon lo describe en su blog de Amazon Bedrock (7 de noviembre de 2025) como un método que «dirige las salidas del LLM a conformarse con un esquema predefinido, como JSON válido», rechazando en tiempo real cualquier token que rompa la estructura. El beneficio es previsibilidad: campos obligatorios siempre presentes, tipos correctos, sin post-procesamiento frágil.

Un modelo de decisión va un paso más allá: no solo restringe el formato, restringe el universo de respuestas posibles. Solo puede elegir entre A, B, C, D o E. Eso elimina la alucinación de formato, pero no la de contenido — el modelo puede elegir la opción equivocada con total seguridad.

El problema real: la confianza no es la precisión

Aquí está el hallazgo que debería preocupar a cualquier founder que use LLM para tomar decisiones.

El autor corrió el modelo contra una muestra aleatoria de CommonsenseQA y obtuvo una precisión de 59,4% (725 de 1.221 casos) con un macro F1 de 0,5844. Un fine-tuning rápido subió la precisión a 62,4% (762 de 1.221) y el macro F1 a 0,6234. Razonable para un modelo de 1.7B.

El problema aparece al mirar las probabilidades. Cuando el modelo respondía con una confianza de entre 0,9 y 1,0 — es decir, casi seguro — solo acertaba el 70% de las veces. En el rango de 0,8 a 0,9, la precisión caía a cerca del 47%. El modelo no está calibrado: su confianza declarada no refleja su precisión real.

El caso más ilustrativo es la pregunta ambigua «¿dónde encontrarías más probablemente un murciélago?» (cueva, partido de béisbol, ático, zoológico, tienda de deportes). El modelo respondió «cueva» con 0,9978 de confianza, cuando la pregunta admite al menos dos lecturas válidas.

Esto no es un defecto exclusivo de Qwen. Psychology Today reportó (25 de febrero de 2026) un estudio que pidió a cinco LLM responder 10.000 preguntas cuya respuesta correcta conocían y luego declarar su confianza: los modelos sobreestimaron su propia corrección entre un 20% (GPT o1) y un 60% (GPT 3.5). El mismo artículo señala que el RLHF amplifica el problema, porque los usuarios tienden a votar a favor de las respuestas seguras y a cuestionar menos las que suenan autoritarias.

Cómo calibrar tu modelo con temperature scaling

La solución que propone el artículo es temperature scaling: ajustar la temperatura de la distribución de probabilidad para aplanarla hasta que las confianzas coincidan con la precisión observada.

Ajustando por curva el parámetro de temperatura, el autor encontró un valor de 3,797280788421631. El resultado, medido sobre los mismos rangos de confianza:

  • El bin de 0,9–1,0 pasó de 0,9855 de confianza con 70% de precisión a 0,9333 de confianza con 95,4% de precisión.
  • El bin de 0,8–0,9 pasó de 0,8555 de confianza con 47,1% de precisión a 0,8507 con 79,9%.
  • El bin de 0,4–0,5 pasó de 0,4538 con 26,8% a 0,4472 con 51,3%.

La distribución ya no miente. El modelo sigue siendo igual de bueno, pero ahora sus números sirven para decidir cuándo confiar en él y cuándo escalar a un humano.

¿Qué significa esto para tu startup?

Si estás usando un LLM para clasificar tickets, enrutar leads, aprobar gastos o cualquier flujo donde el output dispara una acción, la probabilidad que devuelve el modelo no es una probabilidad de acierto. Es la probabilidad del siguiente token. Tratarla como confianza es la forma más silenciosa de meter errores en producción.

Dos acciones concretas:

  • Mide la calibración antes de confiar en los umbrales. Arma un set de evaluación con respuestas correctas conocidas, agrupa las predicciones por rango de confianza y compara confianza media contra precisión real en cada bin. Si en el bin de 0,9–1,0 tu precisión es del 70%, tu umbral de auto-aprobación no puede ser 0,9.
  • Aplica temperature scaling antes de definir reglas de negocio. Es un ajuste de un solo parámetro, no requiere reentrenar, y convierte las probabilidades en algo que puedes usar para decidir qué se automatiza y qué se revisa. El autor publicó un repositorio en GitHub con los scripts para construir el dataset, evaluar, hacer fine-tuning y calibrar.

Y una advertencia de costos que conviene tener presente: Cuttlesoft documentó (12 de noviembre de 2025) que la primera petición con un esquema nuevo de Structured Outputs paga latencia extra mientras se compila la gramática, y que los esquemas complejos consumen más tokens porque el modelo debe generar toda la sintaxis JSON. Si tu caso de uso es elegir entre opciones fijas, un modelo de decisión evita ese costo por completo.

Un patrón que vale la pena copiar

La lección de fondo no es sobre Qwen ni sobre calibración. Es sobre qué le pides al modelo.

Para tareas de clasificación y decisión, obligar al LLM a redactar una respuesta completa es un desperdicio: pagas tokens de sintaxis que después tienes que parsear y validar. Restringir el vocabulario a las opciones válidas y leer directamente la distribución de probabilidad es más rápido, más barato y más fácil de auditar.

El paso que casi nadie da es el último: verificar que esas probabilidades signifiquen algo. Un modelo sobreconfiado con buenas métricas agregadas es una bomba de tiempo en cualquier flujo automatizado.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

Leíste lo que hace la IA. ¿Y en tu negocio?

En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.

👥 Probar 7 días

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...