Un modelo de 4B que iguala a GPT-5.6 Sol con 100x menos costo
Castform y Neon acaban de demostrar que un modelo open-source de apenas 4 mil millones de parámetros puede igualar la precisión de GPT-5.6 Sol en tareas de retrieval, pero con un costo 100 veces menor. Para un founder que ejecuta agentes autónomos a escala, esto no es una optimización marginal: es la diferencia entre un proof-of-concept que quema capital y un producto que escala con márgenes sostenibles.
La combinación es simple pero poderosa: Neon (con su extensión Lakebase Search sobre Postgres) resuelve el problema del contexto y la infraestructura de búsqueda, mientras que Castform se encarga del post-entrenamiento por refuerzo (RL) que enseña al modelo abierto a usar ese contexto de forma eficiente.
¿Por qué el retrieval agéntico sigue siendo caro en 2026?
Hacia 2025, la industria migró de la búsqueda por embeddings (RAG clásico) a flujos de trabajo multi-hop donde los agentes descomponen problemas complejos en búsquedas iterativas. El problema: cada iteración del loop implica otra llamada al modelo frontier.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadSegún el equipo de Neon, una solicitud de búsqueda multi-turn típica con gpt-5.6-sol toma más de 10 segundos y cuesta aproximadamente $0.03 end-to-end. Para un producto con miles de usuarios diarios, esa latencia y costo se vuelven prohibitivos.
Los modelos open-source pequeños son 100 veces más baratos, pero sin post-entrenamiento especializado, sus capacidades de retrieval agéntico quedan muy por detrás de los modelos cerrados. Ahí es donde el RL post-training cambia la ecuación.
¿Cómo funciona Castform con Neon?
Castform convierte tu corpus documental existente en datos de entrenamiento para RL sin requerir ingeniería de ML manual. El pipeline se integra directamente con Neon Lakebase Search en cuatro etapas:
- Almacenamiento del corpus: Los documentos brutos viven en Postgres sobre Neon
- Generación de datos sintéticos: El pipeline de entrenamiento de Castform usa
lakebase_textylakebase_vectorpara escribir tareas de entrenamiento - Entrenamiento RL: Cada rollout del agente usa Lakebase Search en Neon como herramienta de búsqueda
- Inferencia en producción: El modelo final usa la misma llamada de herramienta durante la inferencia
Ying Hang Seah, cofundador de Castform, lo resume así: "La mejor data de entrenamiento de la mayoría de los equipos está sentada en sus bases de datos. El problema es convertir data cruda en algo usable, y dejar que los agentes lean, busquen y muten data de forma barata a escala requiere infra avanzada. Apuntar Castform a Neon salta ambos problemas".
De corpus a dataset de entrenamiento: el proceso automatizado
El post-entrenamiento RL requiere tres piezas: una tarea (responder una pregunta del usuario), un entorno (una herramienta de búsqueda sobre tu corpus) y una función de recompensa (¿la respuesta es correcta?).
Castform automatiza la generación de ejemplos desde tu documentación existente. Por ejemplo:
- Documento (de tus datos): "Los viajes en tren reservados mediante Navan serán pagados con la tarjeta de viaje de GitLab. Los viajes en tren deben ser en clase estándar con 14 días de anticipación"
- Ground truth (inferido): "Los viajes en tren deben ser en clase estándar con 14 días de anticipación"
- Pregunta (generada sintéticamente): "Al reservar un viaje en tren en Navan, ¿cuáles son las reglas sobre cuán temprano debo reservarlo y qué nivel de asiento debo elegir?"
Con este dataset generado, Castform permite especificar las herramientas a las que el agente tiene acceso y definir la función de recompensa que guía el aprendizaje.
Observabilidad completa del entrenamiento
Una ventaja crítica de Castform es la observabilidad total del proceso de RL. Puedes monitorear cómo sube la recompensa promedio con cada paso de entrenamiento, pero también inspeccionar tareas individuales para entender qualitativamente cómo el modelo está aprendiendo.
Esto permite debuggear problemas como herramientas rotas o "reward hacking" (cuando el modelo encuentra atajos para maximizar la recompensa sin realmente resolver la tarea). La plataforma muestra métricas como:
- Recompensa promedio por paso de entrenamiento
- Longitud de respuesta (tokens promedio)
- Tasa de resolución (porcentaje de prompts con recompensa no-cero)
- Desglose de recompensa por componente (corrección, concisión, citación, eficiencia de llamadas)
¿Por qué Neon "simplemente funciona" para este caso de uso?
Durante el entrenamiento, el agente llama repetidamente a Lakebase Search hasta tener suficiente contexto para responder. Con miles de rollouts en paralelo, cada uno haciendo decenas de llamadas, se crea una carga de trabajo altamente explosiva.
Neon absorbe estos picos sin requerir que Castform provisione capacidad máxima 24/7 gracias a su escalado dinámico de cómputo. Los training runs obtienen búsqueda de baja latencia cuando la demanda se dispara, mientras que el cómputo se reduce durante períodos de inactividad.
Para entrenar agentes con estado (que modifican datos), Neon branching proporciona un entorno de base de datos aislado para cada rollout, evitando que las acciones de un rollout afecten a otro o toquen producción. Las consultas time-travel permiten reconstruir e inspeccionar el estado que encontró un agente, combinado con autoscaling y scale-to-zero para entrenar miles de rollouts sin mantener miles de entornos corriendo continuamente.
Precios y modelo de negocio de Castform
Castform opera con un modelo pay-as-you-go: solo pagas el cómputo que usas durante los training runs. No hay seats, no hay mínimos mensuales, no hay lock-in. Los nuevos usuarios reciben créditos gratuitos para probar su primer training run.
Para poner los números en contexto, según OpenAI, los precios de GPT-5.6 por 1M de tokens son:
- GPT-5.6 Sol: $5 input / $30 output
- GPT-5.6 Terra: $2.50 input / $15 output
- GPT-5.6 Luna: $1 input / $6 output
Un modelo open-source de 4B post-entrenado con Castform puede lograr precisión comparable a Sol en tareas de retrieval específicas, pero con un costo operativo que se acerca al de Luna o incluso menor cuando se despliega en infra propia.
¿Qué significa esto para tu startup?
Si estás construyendo agentes autónomos que necesitan acceder a documentación interna, bases de conocimiento o datos operacionales, esta combinación te permite:
1. Reducir costos de inferencia en 100x para flujos de retrieval intensivos sin sacrificar precisión. Un agente que antes costaba $0.03 por consulta ahora puede operar por $0.0003, lo que cambia radicalmente la unit economics de tu producto.
2. Entrenar sobre tu data propietaria sin ingeniería de ML. No necesitas contratar un equipo de ML researchers ni gestionar clusters de GPUs. Castform convierte tu documentación existente en datos de entrenamiento y maneja el loop de RL automáticamente.
3. Mantener control total sobre el modelo. Los modelos entrenados son open-source y puedes exportar los weights en cualquier momento para desplegarlos donde quieras. Tu data de entrenamiento es tuya y puede eliminarse en cualquier momento.
Acciones concretas para implementar esta semana
Audita tu corpus documental: Identifica qué documentación interna (handbooks, artículos de soporte, interacciones con clientes, wikis operacionales) podría convertirse en dataset de entrenamiento. Si ya usas Neon, tu data probablemente ya está en el formato correcto.
Prueba Castform con un caso de uso acotado: Comienza con un dominio específico (ej. políticas de viaje, procedimientos de soporte, documentación de API) en lugar de intentar entrenar un agente generalista. Define una función de recompensa clara que mida recuperación correcta, citación apropiada y respuesta precisa.
Calcula el ROI de post-entrenamiento: Si tu agente actual hace 10,000 consultas diarias a $0.03 cada una, estás gastando $300/día (~$9,000/mes). Un modelo post-entrenado que reduzca ese costo 100x te ahorra ~$8,900/mes, lo que probablemente paga el entrenamiento en semanas.
Conclusión
La combinación de Castform y Neon demuestra que en 2026 ya no necesitas depender de modelos frontier caros para construir agentes de retrieval precisos. El post-entrenamiento RL sobre modelos open-source pequeños, alimentado por tu data propietaria y ejecutado sobre infraestructura elástica como Neon, ofrece una ruta hacia agentes que son más baratos, más rápidos y tan precisos como las alternativas cerradas.
Para founders que operan con capital limitado y necesitan escalar unit economics desde el día uno, esta es la arquitectura que separa los productos sostenibles de los proof-of-concepts que nunca llegan a producción.
Fuentes
- How Castform + Neon Beats Frontier Models on Price and Efficiency
- Castform - The Training Platform for the AI Engineer
- GPT-5.6: Frontier intelligence that scales with your ambition
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













