Strands Decider 2B: AWS libera modelo de decisión open source

Una nueva clase de modelo para tu agente

Un decision model (también llamado System One model) no escribe párrafos ni genera código: recibe un estado y una pregunta con opciones cerradas, y devuelve una elección, un puntaje o una probabilidad de sí/no junto con un nivel de confianza. El término lo acuñó TypeSafe AI al lanzar Jev el 15 de septiembre de 2026, inspirado en la distinción de Daniel Kahneman entre pensamiento rápido (Sistema 1) y razonamiento deliberado (Sistema 2).

El 1 de octubre de 2026, AWS Strands Labs respondió con Strands Decider 2B: un modelo de decisión open source bajo licencia Apache-2.0, basado en Qwen3.5-2B con un pointer head de apenas un millón de parámetros que reemplaza la cabeza de generación de texto. Está disponible en GitHub y en Hugging Face, y según reporta MarkTechPost, ya trae CLI (pip install strands-decider) y un servidor HTTP local que enlaza a 127.0.0.1 sin autenticación.

Qué cambia respecto a un LLM convencional

Un LLM como los que usas hoy produce texto token a token, lo que consume presupuesto y suma latencia. Un decision model hace todo en una sola pasada: lee el estado, evalúa las opciones y devuelve una respuesta estructurada. A cambio, pierde flexibilidad: no sirve para chatbots, resúmenes ni generación de código, y rinde peor que los modelos de razonamiento en problemas complejos.

¿Y esto cómo se aplica en tu negocio?

En CAR, dueños de empresa de Latinoamérica y España usan la tecnología para ser más rentables. Empiezas con una ruta de 7 días y terminas con un sistema funcionando en tu negocio.

👥 Probar 7 días

La ganancia está en dos métricas que importan en producción:

  • Latencia: Strands Decider 2B corre a una mediana de 115 ms en una Nvidia RTX 3090 y 153 ms en un MacBook Pro M3 para tareas pequeñas, según cifras publicadas por el equipo de Strands.
  • Confianza calibrada: cada respuesta trae un puntaje de fiabilidad que los LLMs frontera no exponen en sus APIs. En tareas de clasificación cortas, las respuestas con confianza ≥ 0.9 aciertan cerca del 95 % del tiempo, reportó el blog oficial de Strands.

Cómo está construido y por qué el pointer head importa

La arquitectura toma el tronco preentrenado Qwen3.5-2B y le quita la cabeza de modelado de lenguaje, lo que elimina la capacidad de generar texto. En su lugar, un pointer head de aproximadamente un millón de parámetros compara el estado oculto en la posición <answer> contra el estado oculto al final de cada opción, y emite un puntaje.

El tronco se ajusta con un adaptador LoRA de rango 16, y el head corre en precisión fp32. El checkpoint liberado es la versión 19; según SiliconANGLE, la release actual llega como v20 tras iteraciones internas. Como cada conjunto de etiquetas lo entrega la propia solicitud, no hay un tope rígido en el número de opciones que se pueden ofrecer al modelo.

Rendimiento: dónde gana y dónde pierde

Strands evaluó su modelo en el conjunto público de JevBench v1.4.2, el benchmark de referencia para esta categoría. Los números publicados por el equipo:

  • Accuracy global: 0.723 (167 de 231 tareas).
  • Brier score (calibración): 0.342; error de calibración esperado: 0.052.
  • Por dificultad: easy 1.000, standard 0.875, hard 0.505.

En el ranking 2B de JevBench v1.4.2, Strands Decider 2B quedó tercero de 33 modelos; al excluir tres modelos "justo por encima de 2B", asciende al primer puesto de 30 entre los que publican receta y datos de entrenamiento completos. MarkTechPost aclara que Strands Decider no aparecía en el tablero v1.5.4 al cierre de su artículo, y que el decider-2b v11 de Mapika lo supera por 8 tareas en el harness de Strands.

El ecosistema System One se llena de competidores

La categoría tiene más jugadores cada semana. Según el índice de BenchLM:

  • Jev 1.13.0 de TypeSafe AI, hosted, con latencia de 70 a 500 ms, USD 0.042 por millón de tokens de entrada y salida gratis. La compañía levantó USD 40M en seed liderados por DCVC y está fundada por el ex-OpenAI Diogo Almeida junto a Erik Gafni y Sasha Sheng.
  • Perplexity Decider v1 27B, lanzado el 1 de octubre de 2026, modelo de 27B parámetros con la Decisions API cobrando USD 0.04 por millón de tokens de entrada.
  • JEV-27B de AutoTrust AI (Singapur), liberado el 29 de septiembre de 2026 bajo Apache-2.0, entrenado sobre Qwen3.8-27B.
  • GLiDE de Fastino, anunciado el 30 de septiembre de 2026, con razonamiento adaptativo para decisiones inciertas.
  • Más de una decena de réplicas abiertas de la comunidad en JevBench, incluyendo modelos de Mapika, FlyMy.AI, Zefan Cai, Jared Palmer y Blockbrain, con puntajes que varían ampliamente.

CryptoBriefing destacó que AWS se posiciona como alternativa open source a Jev y recordó una advertencia clave: testing independiente citado por CryptoBriefing mostró que Jev es vulnerable a inputs adversariales que pueden forzar decisiones incorrectas. Es una señal de que la categoría es inmadura y los proveedores recomiendan escalar a humanos cuando la confianza cae bajo cierto umbral.

Cómo encaja Strands Decider en una arquitectura de agente

El repositorio incluye un ejemplo con el Strands Harness SDK: un agente del clima que, antes de llamar a la herramienta, le pide al decider dos preguntas de sí/no. ¿Los argumentos están grounded en lo que dijo el usuario? ¿Es demasiado pronto para ejecutar la tool? Si la confianza cae, el InterventionHandler devuelve una acción tipada — Proceed, Deny, Confirm o Guide — y el agente pregunta de vuelta en vez de reportar el clima de una ciudad que nadie mencionó.

Los casos de uso donde Strands Labs ve tracción: routing de modelos, selección de herramientas, evaluaciones, guardrails, gestión de contexto y clasificación de políticas. La idea de fondo es la del agente híbrido: el LLM frontera resuelve las decisiones difíciles y el decider se queda con las decisiones repetitivas y de bajo costo.

Qué significa esto para tu startup

Si estás construyendo agentes en producción y hoy gastas tokens de un LLM caro en cada decisión trivial — clasificar un ticket, decidir si llamar a una API, validar argumentos — un decision model de 2B parámetros que corre local en una GPU de hace cinco años puede mover esa aguja sin sacrificar precisión en las tareas fáciles.

Acciones concretas que puedes tomar esta semana:

  • Mide dónde se te va el presupuesto. Instrumenta tu agente y separa las llamadas que son clasificación/routing/validación de las que realmente requieren razonamiento. Si más del 30 % son rutinarias, tienes un caso de uso directo para un decider.
  • Prueba Strands Decider 2B en local. Es open source, corre en CPU, y el pip install strands-decider te da CLI y servidor HTTP en minutos. Empieza por un endpoint de routing de tickets o un guardrail de tool calls.
  • Define un umbral de escalado. Tanto el equipo de Strands como TypeSafe recomiendan confirmar o pasar a un humano cuando la confianza cae bajo 0.9. Diseña ese fallback antes de poner el decider en producción.
  • Compara con la competencia. Si necesitas salida hosted y probabilidades calibradas sin operar GPU, Jev es el referente. Si quieres soberanía total sobre los pesos, Strands Decider, OpenJev o Laya son las opciones abiertas. Elige según tu restricciones de datos, latencia y presupuesto.

La categoría es nueva y se mueve rápido: hace dos meses nadie hablaba de System One models, y hoy hay más de 30 configuraciones rankeadas en JevBench. Lo que Strands Decider 2B pone sobre la mesa es un punto de partida abierto, reproducible y barato para experimentar sin atarte a un vendor.

Fuentes

¿Y esto cómo se aplica en tu negocio?

En CAR, dueños de empresa de Latinoamérica y España usan la tecnología para ser más rentables. Empiezas con una ruta de 7 días y terminas con un sistema funcionando en tu negocio.

👥 Probar 7 días

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...