Ollaya: modelos estilo Jev corren en tu GPU a 8 ms

Ollaya lleva los modelos de decisión estilo Jev a tu propia GPU

Ollaya ejecuta modelos de decisión al estilo Jev directamente en tu máquina, con una latencia mediana de 8 a 10 milisegundos sobre una RTX 4090, frente a los 236-276 ms del endpoint alojado de TypeSafe. Para un founder que hoy enruta tickets, clasifica correos o detecta fraude con un LLM caro, el lanzamiento significa lo mismo en una fracción del tiempo, sin factura por tokens y sin que los datos salgan del servidor propio.

¿Qué es Ollaya exactamente?

Ollaya es un servidor local de modelos de decisión tipados. La idea: en lugar de generar texto token a token, el modelo responde a una pregunta estructurada —una elección entre opciones, una puntuación ordinal o un sí/no— en una sola pasada (forward pass) y devuelve probabilidades calibradas que puedes umbralizar.

El proyecto se posiciona como «el Ollama de los modelos de decisión», en referencia al popular runtime local de LLMs: bajas un binario, jalas un modelo y consultas un endpoint HTTP en 127.0.0.1:11435. El servidor expone las mismas rutas que la API de TypeSafe (/v1/systemone y /v1/models), con idénticos formatos de petición y respuesta. El SDK oficial de TypeSafe para Python 0.7.1 funciona contra Ollaya sin un solo cambio: solo hay que redefinir tres variables de entorno.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
export TYPESAFE_BASE_URL=http://localhost:11435
export TYPESAFE_API_KEY=local
export TYPESAFE_DEFAULT_MODEL=laya

Esa compatibilidad drop-in es la pieza clave. Si ya tienes un flujo montado sobre Jev, puedes probarlo en local sin reescribir nada.

Jev abrió la categoría hace diez días: por qué este lanzamiento importa ahora

TypeSafe AI lanzó Jev el 15 de septiembre de 2026, un modelo entrenado exclusivamente con datos sintéticos bajo un método que la compañía llama Reinforcement Learning for Calibrated Decisions (RLCD). Su fundador, Diogo Almeida, es coautor del paper original de RLHF en OpenAI y participó en InstructGPT, ChatGPT y GPT-4. La ronda semilla fue de US$40M liderada por DCVC, según reportó CryptoBriefing.

Jev saltó a producción rápido: el 13% de los usuarios de pago del AI Gateway de Vercel lo adoptaron en 24 horas, el doble que cualquier otro modelo en su debut, según datos de la propia Vercel. El precio, US$0,042 por millón de tokens de entrada y salida gratis, lo dejó como una alternativa 5 a 18 veces más rápida y entre 10 y 20 veces más barata que los LLM generalistas para clasificación estructurada.

Pero Jev es cerrado y depende de un API remoto. Ollaya aparece como respuesta directa: los mismos casos de uso, sin tokens facturados, sin datos saliendo de tu infraestructura. Diez días después del lanzamiento de Jev, Nokia también publicó AnyJev, una librería Apache-2.0 que convierte cualquier LLM abierto en un modelo de decisión tipo Jev sin entrenamiento adicional. La categoría se está consolidando más rápido de lo previsto.

Qué modelos incluye Ollaya y para qué sirve cada uno

El runtime descarga los pesos directamente del repositorio Hugging Face del autor original, fijado a un commit y verificado por sha256; nunca los rehospeda. Los cuatro modelos disponibles son:

  • Laya (Convai Innovations, 322M y 421M parámetros): la opción por defecto. Responde preguntas de elección, puntuación y sí/no en inglés y más de 100 idiomas, con probabilidades calibradas.
  • Decider (Mapika, 0,75B y 1,9B sobre Qwen3.5): la respuesta se lee directamente de los logits de las letras de opción. En las pruebas publicadas por Ollaya, es el modelo abierto más preciso para decisiones tipadas.
  • NLI (Moritz Laurer, 396M y 435M): clasificador zero-shot donde cada opción se trata como hipótesis y se puntúa por implicación (entailment). El más preciso entre los modelos encoder.
  • Gliclass (Knowledgator, 439M): clasificador zero-shot que sigue instrucciones y puntúa todas las opciones en una sola pasada; el costo apenas crece con el número de opciones.

La página de búsqueda de Ollaya lista más modelos en camino, incluyendo variantes GGUF sobre llama.cpp, por lo que el catálogo va a engordar en las próximas semanas.

Velocidad y calibración: los números que separan a Ollaya de Jev

La promesa central es la latencia. Las cifras del propio Ollaya, medidas sobre una RTX 4090 con laya en fp16 y los demás en fp32, son la mediana de una petición con cinco preguntas a través del HTTP API:

Modelo Latencia mediana
laya:multilingual 8,1 ms
laya:en 9,6 ms
gliclass 14,7 ms
nli 20,4 ms
decider:0.8b 155 ms
decider:2b 190 ms
TypeSafe Jev (API alojada) 236-276 ms

Laya no solo es más rápida: también está mejor calibrada. El error de calibración (ECE) de Laya es 0,081 tras ajuste de temperatura, frente a 0,246 en Jev, según los datos publicados por el proyecto. Cuando Laya dice «confianza 0,87», puedes poner un umbral con la expectativa real de que cerca de un 87% de esas predicciones sean correctas. Con Jev, la cifra cruda engaña más a menudo.

Privacidad y costo: el ángulo que cierra la decisión para muchos founders

El marketing lo dice y la arquitectura lo respalda: los datos no salen de tu máquina. El servidor escucha en 127.0.0.1 por defecto, los pesos vienen verificados criptográficamente y el runtime es Apache-2.0. Para sectores donde tickets de soporte, historiales clínicos o mensajes de clientes son datos sensibles —salud, legal, fintech—, esto cambia la ecuación de cumplimiento.

En el lado del costo, no hay facturación por tokens. La factura es la de tu hardware: una RTX 4090 corre Laya con holgura; el sitio también documenta ejecución por CPU y soporte para GPU NVIDIA en Linux, WSL 2 y Docker (con driver R580 o superior). Las plataformas soportadas incluyen macOS, Windows, Linux y una imagen Docker para servidores.

¿Qué significa esto para tu startup?

Tres palancas concretas para founders que hoy gastan en clasificación o routing con LLM:

  • Audita cuánto pagas por clasificación que podrías correr en local. Si tienes un flujo de tickets, correos, leads o transacciones que pasa por un LLM solo para decidir «a qué equipo va esto» o «qué tan urgente es», la diferencia entre US$0,042 por millón de tokens y el costo eléctrico de una GPU suele ser de uno a dos órdenes de magnitud. Haz el cálculo con un mes real de logs antes de tomar la decisión.
  • Prototipa con la misma API que ya usas. Como Ollaya habla el dialecto de TypeSafe, puedes mantener tu código de producción intacto y apuntarlo a localhost:11435 con TYPESAFE_BASE_URL. Eso te permite comparar latencia, calibración y costo en paralelo sin reescribir nada.
  • Separa «decidir» de «generar» en tu arquitectura. El patrón que ya apuntan Vercel y analistas de TechTarget: deja que un modelo tipo Jev resuelva el routing y la clasificación, y reserva el LLM grande solo para la parte donde realmente necesitas generación de texto. Para un chatbot de soporte, Jev decide intención y urgencia; el LLM solo redacta la respuesta final.

La categoría de modelos de decisión llegó para quedarse. Ollaya la trae a local, AnyJev de Nokia la trae sobre cualquier LLM abierto, y Jev la trae como servicio administrado. Los founders que identifiquen temprano cuál de las tres modalidades encaja con su caso de uso van a tener una ventaja de costo y privacidad difícil de igualar.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...