Reflection Beam: 501B open-weight frente a DeepSeek y GLM

Reflection AI sale del stealth con Beam: 501B parámetros y la apuesta occidental frente a los modelos chinos

Reflection AI presentó el 5 de octubre de 2026 a Beam, su primer modelo de lenguaje open-weight: un Mixture-of-Experts (MoE) de 501 mil millones de parámetros totales con solo 23 mil millones activos por token, entrenado desde cero en Brooklyn por los ex-Google DeepMind Misha Laskin y su equipo. La compañía, que según TechCrunch ha levantado cerca de US$4.700 millones con una valoración pre-money de US$25.000 millones en su última ronda, promete lanzar los pesos completos bajo Apache 2.0 antes de que termine octubre.

El lanzamiento, adelantado por Axios y confirmado por Reflection en un blog técnico, marca el ingreso formal de Reflection como «neolab» funcional y reordena la conversación sobre quién puede construir un modelo frontera fuera de China. Porque los números que Reflection pone sobre la mesa están diseñados para una sola pregunta: ¿puede un modelo entrenado en Estados Unidos competir con DeepSeek, Qwen y Z.ai en coste de inferencia?

Qué es Beam y por qué importa la arquitectura

Beam es un modelo solo texto con ventana de contexto efectiva de 1 millón de tokens, optimizado para tareas de coding, agentic workflows y razonamiento científico. Como MoE sparse, la mayor parte de los 501B de parámetros permanecen inactivos en cada inferencia: solo 23B se activan por token, lo que reduce drásticamente el coste por respuesta. La arquitectura combina atención local y global intercalada con expertos enrutados de grano fino, balanceo de carga sin pérdida auxiliar (inspirado en DeepSeek-V3) y 52 capas con normalización acotada.

¿Y esto cómo se aplica en tu negocio?

En CAR, dueños de empresa de Latinoamérica y España usan la tecnología para ser más rentables. Empiezas con una ruta de 7 días y terminas con un sistema funcionando en tu negocio.

👥 Probar 7 días

Según el anuncio de Reflection recogido por Unite.ai, el modelo fue preentrenado con 23,8 billones de tokens en apenas cuatro semanas sobre 6.144 GPUs Nvidia GB300 NVL72, con un goodput final del 92,3% y nueve rewinds semi-automáticos por picos de gradiente o corrupción silenciosa de datos. Un pipeline de OCR paralelo procesó cientos de millones de PDFs usando un modelo visión-lenguaje propio con clasificadores de calidad corriendo en miles de GPUs adicionales.

El verdadero músculo: reinforcement learning a escala

Donde Beam se separa del manual chino es en su campaña de RL. Reflection ejecutó más de 100 millones de rollouts en 10.500 GPUs GB300 durante cuatro semanas, con un contexto máximo de 256K tokens y aproximadamente 1.300 millones de sandboxes consumidos para entrenamiento y grading. La compañía describe el esfuerzo como uno de los mayores runs de RL hechos por un laboratorio abierto hasta la fecha.

La infraestructuraRL es notable: promedió 110.000 rollouts concurrentes con picos de hasta 170.000 sandboxes simultáneos, mantuvo batches al 99,99% de capacidad, y desplegó nuevos pesos a la flota de inferencia en una mediana de 12 segundos. El sistema permaneció estable incluso aprendiendo de muestras producidas por versiones de política con hasta un día de desfase (107 versiones de peso detrás). Reflection también reporta que las capacidades generalizaron fuera de la mezcla de entrenamiento: durante el RL sobre razonamiento e ingeniería de software, el rendimiento en browsing mejoró aunque no había tareas de browsing en el set, y con acceso a la web el modelo aprendió por sí solo a consultar otros LLMs y usar APIs de OCR para leer documentos.

Benchmarks: dónde Beam gana y dónde cede

Las cifras que Reflection publica (todavía pendientes de verificación independiente) son las siguientes, según el resumen de Latent Space y la tabla comparativa de Marktechpost:

  • SWE-bench Verified: 80,9 (frente a 70,7 de Nemotron 3 Ultra)
  • Terminal Bench v2.1: 80,1 (cerca de GLM-5.2 en 81,0)
  • SWE Bench Pro v2-Hard: 77,2
  • AIME 2026: 97,8
  • Humanity’s Last Exam sin herramientas: 36,2
  • GPQA Diamond: 90,5

El argumento central no es liderar en capacidad bruta: Reflection reconoce que Kimi K3 (Moonshot) y DeepSeek V4.1 Flash siguen por delante en tareas frontera. La apuesta es eficiencia en inferencia: la compañía asegura que Beam iguala a GLM-5.2 en benchmarks de razonamiento usando 3 a 4 veces menos cómputo de inferencia, y que la ventaja crece frente a modelos con más de dos billones de parámetros como Qwen 3.8-Max. En una demo, Beam clasificó 16.200 puntos de un grid global tierra/agua con 95,5% de acierto, un resultado que la compañía sitúa entre Opus 5 (92,5%) y Fable 5 (97,8%).

El contexto que Beam intenta revertir: la hegemonía china en open-weight

El movimiento de Reflection se entiende mejor con la foto del mercado. Según datos de Dimension Capital compartidos en octubre de 2026 y reportados por Crypto Briefing, los modelos open-weight de equipos chinos (DeepSeek, Qwen, Doubao) ya manejan más del 60% de los tokens en OpenRouter, y 8 de los 10 modelos más usados en la plataforma son chinos. En la semana del 14 de septiembre, DeepSeek acaparó el 25,4% de las solicitudes de texto, según la misma fuente.

Y el precio lo explica. Outlook Business documenta que DeepSeek V4.1 Flash corre a US$0,15 por millón de tokens de entrada fuera de horas pico, mientras OpenAI GPT-5.6 Sol lista US$4 de entrada y US$20 de salida. Artificial Analysis estima el coste por tarea en aproximadamente US$0,27 para DeepSeek V4.1 Flash contra US$1,99 para GPT-5.6 Sol a máximo esfuerzo de razonamiento. La presión es real: Tech Republic reporta que DoorDash, Airbnb y Coinbase ya mueven parte de sus cargas de producción a modelos chinos más baratos.

Ahí entra Beam: la promesa de un modelo entrenado en USA, open-weight, con licencia Apache 2.0 y costes de inferencia tres a cuatro veces menores que un rival chino comparable. Reflection ya trabaja con el Pentágono y el Departamento de Energía de EE. UU., y construye una nube soberana de 250 MW en Corea del Sur con Shinsegae, respaldada por ambos gobiernos. Para compradores con restricciones regulatorias o de soberanía, de dónde viene el modelo importa tanto como cuánto cuesta.

¿Qué significa esto para tu startup?

  • Espera al release de pesos a fin de mes antes de planificar migración. Apache 2.0 con pesos completos cambia radicalmente la economía de self-hosting frente a las APIs cerradas. Si tu stack actual depende de OpenAI o Anthropic para tareas de coding, un modelo competitivo en SWE-bench con coste de inferencia muy inferior abre la puerta a reducir factura sin perder calidad.
  • Diseña tu arquitectura multi-modelo desde ya, no después. La tendencia que documenta Outlook Business es que las empresas líderes ya no eligen un solo modelo: enrutan tareas según coste, latencia y sensibilidad. Modelos chinos (DeepSeek, Qwen) para cargas masivas, y Beam como opción soberana para datos sensibles, son combinaciones viables una vez los pesos estén disponibles.
  • Evalúa el coste por tarea completa, no el precio por token. Artificial Analysis mide que el gap real entre un modelo frontier caro y uno open-weight barato depende de la longitud de la salida, el esfuerzo de razonamiento y el caching. Antes de cambiar de proveedor, mide con tu workload real.
  • Sigue la narrativa de «sovereign AI» si trabajas con enterprise o sector público. El ángulo de Reflection (Pentágono, Department of Energy, Shinsegae) señala un nicho comercial claro: gobiernos, defensa y empresas reguladas que necesitan modelos potentes sin enviar datos a jurisdicciones extranjeras. Un wedge de mercado real para founders que construyen sobre esta capa.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

¿Y esto cómo se aplica en tu negocio?

En CAR, dueños de empresa de Latinoamérica y España usan la tecnología para ser más rentables. Empiezas con una ruta de 7 días y terminas con un sistema funcionando en tu negocio.

👥 Probar 7 días

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...