Qwen 3.8 27B llega a Cerebras a 1.500 tokens/segundo

Qwen 3.8 27B llega a los endpoints públicos de Cerebras

Qwen 3.8 27B ya está disponible en la plataforma de inferencia de Cerebras a aproximadamente 1.500 tokens por segundo, según la documentación oficial publicada esta semana. El modelo, con 27.000 millones de parámetros, se ofrece con una ventana de contexto de 64k tokens en el tier gratuito y 128k en el plan de pago, en la misma línea pública donde ya corre GPT OSS 120B a ~3.000 tokens/segundo.

Para un founder que hoy lanza productos sobre LLMs, la cifra importa por una razón concreta: la velocidad de generación define la experiencia del usuario final. Un chatbot que responde en 800 milisegundos se siente "en vivo"; uno que tarda 4 segundos se siente roto. Por eso Cerebras lleva meses comunicando tokens/segundo como métrica principal, en lugar de benchmarks académicos.

Qué ofrece Qwen 3.8 27B en la plataforma

La documentación pública de Cerebras lista al modelo con tres datos que un equipo técnico evalúa de inmediato:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • Velocidad de salida: ~1.500 tokens/segundo, una cifra que iguala o supera a muchos modelos más pequeños corriendo sobre GPUs.
  • Contexto: 64k tokens gratis, 128k pagando, útil para Retrieval-Augmented Generation (RAG) sobre documentos largos.
  • Acceso: disponible en el tier free trial y en pay-as-you-go, con límites de tasa y precios definidos; para SLAs de producción y mayor throughput existe la opción de Dedicated Endpoints.

Un punto importante para founders: Cerebras confirma que sirve los modelos originales sin podar y solo aplica cuantización selectiva de pesos en almacenamiento (parcial 16/8/4-bit), manteniendo activaciones, atención y KV cache en precisión completa. Para casos sensibles a calidad — generación médica, código en producción, agentes financieros — esto reduce el riesgo de degradación por cuantización agresiva.

Sobre el modelo en sí, fuentes técnicas como Geeky Gadgets describen a Qwen 3.8 27B como una versión reducida del Qwen 3.8 Max de 2,4 billones de parámetros, con resultados competitivos frente a alternativas como el Muse Glimmer de Meta en pruebas independientes de razonamiento e IA agentica. Es una opción interesante cuando necesitas potencia sin pagar el costo computacional de un modelo de frontera.

Cerebras: el rival de Nvidia que ya cotiza en Nasdaq

Cerebras Systems salió a bolsa en mayo de 2026 en Nasdaq bajo el ticker CBRS, levantando US$5.550 millones en la mayor IPO tecnológica estadounidense desde 2019 y abriendo a una valoración de US$95.000 millones, según la cobertura de Reuters y CNBC recogida en la ficha de la compañía. Tres meses después, en su evento Supernova 2026 de agosto, presentó el sistema CS-4, que duplica la velocidad de inferencia y promete hasta 30x más throughput que GPUs en workloads de agentes, con roadmap de 20x más para 2027.

El modelo de negocio se sostiene con cuatro clientes principales según los registros S-1 ante la SEC:

  • MBZUAI (la universidad de IA de Abu Dhabi): 62% de los ingresos 2025.
  • G42: 24% de los ingresos 2025.
  • OpenAI: acuerdo firmado en enero de 2026 por 750 MW de capacidad hasta 2028, valorado en más de US$10.000 millones.
  • AWS: partnership anunciada en marzo de 2026 para integrar los CS-3 en Amazon Bedrock.

Para founders, lo relevante es que Cerebras no vende solo chips: vende inferencia como servicio. Eso significa que un equipo de tres personas puede levantar una API multimodal competitiva sin comprar infraestructura, y pagar por uso.

Velocidad como ventaja competitiva

La estrategia de Cerebras se entiende mirando los números que ha ido publicando:

  • DeepSeek R1 70B a 1.600 tokens/segundo (enero de 2025).
  • Perplexity Sonar a 1.200 tokens/segundo (febrero de 2025).
  • Llama API de Meta a 2.600 tokens/segundo (abril de 2025), 18x más rápido que OpenAI según VentureBeat.
  • Llama 4 Maverick (400B parámetros) a 2.500 tokens/segundo frente a 1.000 del Nvidia Blackwell (mayo de 2025).
  • Qwen3-235B a 131k de contexto completo (julio de 2025).

La incorporación de Qwen 3.8 27B a 1.500 tokens/segundo mantiene esa línea: cada nuevo modelo abierto llega a la plataforma con velocidades de inferencia que, sobre GPUs convencionales, serían prohibitivas en costo.

Para competir con Nvidia en precio-rendimiento, Cerebras apuesta por un hardware distinto: su chip WSE-3 mide 215 mm por lado, ocupa obleas enteras y consume 25 kW por nodo, con un costo de hasta US$3 millones por nodo según el perfil de la compañía. El truco es que un solo wafer reemplaza un cluster de GPUs, eliminando cuellos de botella de interconexión.

Qué significa esto para tu startup

La disponibilidad de Qwen 3.8 27B a 1.500 tokens/segundo con un tier gratuito abre tres puertas concretas para founders:

1. Prototipa agentes sin pelearte con infraestructura. Si tu producto es un agente que ejecuta tareas largas, la latencia de salida define si el usuario se queda. Una respuesta a 1.500 tok/s equivale a leer un párrafo completo en menos de un segundo. Puedes empezar en el Quickstart de Cerebras y escalar a Dedicated Endpoints cuando tengas usuarios de pago.

2. Compara con tu proveedor actual antes de migrar. Vale la pena correr tu prompt real contra el endpoint gratuito y medir tokens/segundo, costo por millón de tokens y calidad de salida. La guía de selección de modelo ayuda a mapear casos de uso (RAG, agente, chat) al modelo correcto.

3. Diseña asumiendo latencia humana, no latencia de GPU. Aunque el proveedor prometa 3.000 tokens/segundo, el cuello de botella suele estar en tu retrieval, tu base de datos o tu frontend. Antes de cambiar de proveedor, instrumenta cuánto tarda cada parte de tu pipeline. La velocidad de Cerebras es una herramienta para mejorar UX, no un atajo para saltarte el trabajo de arquitectura.

Riesgo a vigilar: el negocio de Cerebras depende heavily de G42 y MBZUAI (86% de los ingresos combinados en 2025). Para un founder que apuesta por ellos como proveedor crítico, conviene diversificar al menos entre dos proveedores de inferencia hasta que la base de clientes se equilibre.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...