Strata ejecuta el modelo Qwen 125B en una RTX 5070 a 94 t/s

De servidor a PC gamer: el modelo Qwen 125B ya corre en casa

Una PC gamer con una NVIDIA RTX 5070 de 12 GB puede correr hoy un modelo de 125 mil millones de parámetros —el tamaño de un frontier que hace dos años solo vivía en clusters con cientos de GB de VRAM— a 94 tokens por segundo en escritura y más de 2.600 tokens por segundo al leer prompts largos. Lo hace posible Strata, un wrapper open source publicado por Niko1221 en GitHub, que ejecuta el modelo Qwen3.8 Flash Next del equipo Qwen sobre llama.cpp/ggml. La promesa de fondo: nada sale de tu máquina.

Para founders que hoy envían código propietario, datos de clientes o documentos legales a APIs de OpenAI, Anthropic o Google, la movida es relevante: por primera vez un modelo MoE de frontera corre en hardware de consumo con velocidades interactivas.

Qué hay detrás de Qwen3.8 Flash Next

Qwen3.8 Flash Next fue liberado el 26 de agosto de 2026 por el equipo Qwen (Alibaba) como primer peso abierto bajo la arquitectura que veremos en Qwen4, según el repositorio oficial en GitHub y la ficha del modelo en Hugging Face. La ficha técnica describe un modelo con:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • 125B de parámetros principales + 51B de N-gram Embeddings (una tabla de lookup que se puede offloadear a memoria del host).
  • 6B de parámetros activados por token sobre 512 expertos totales (10 enrutados + 1 compartido).
  • Hybrid Attention GDN + QSA: Gated DeltaNet para comprimir historia + Qwen Sparse Attention (QSA) que selecciona contexto importante a nivel de micro-bloques.
  • Gated Residual: el residual stream se abre en 4 ramas con lectura/escritura dinámicas.
  • Optimizador Muon sobre ciertos pesos y AdamW sobre otros, con leyes de escalado reajustadas.
  • Contexto nativo de 262.144 tokens, extensible hasta 1 millón con YaRN.

En los benchmarks reportados por el propio equipo Qwen en Hugging Face, Qwen3.8 Flash Next supera a Qwen3.8-27B y a DeepSeek-V4-Flash-0731 en tareas agenticas (SWE-bench Pro 62,5, DeepSWE 58,7, Toolathlon 73,5) y queda por encima de Claude-Opus-4.6 (Max) en SWE-bench Multilingual (81,0 vs. 77,5).

Qué hace Strata para que esto sea posible

Un modelo MoE con cientos de miles de millones de parámetros normalmente vive en servidores con memoria de video para varios dígitos. Strata lo hace caber en una PC de consumo distribuyendo el trabajo entre VRAM, RAM del sistema y SSD, según la documentación del repositorio:

  • 24.576 expertos en el modelo, pero solo 10 activos por token. La GPU guarda los expertos más usados; la RAM del sistema aloja todos; la CPU trabaja sobre el resto en paralelo; el SSD mantiene una tabla de N-gram embeddings.
  • Speculative decoding simplificado: un modelo pequeño propone los siguientes tokens y el grande los verifica todos a la vez, lo que entrega respuestas entre 1,6 y 1,8 veces más rápido sin pérdida de calidad.
  • Lectura de prompts largos en bloques de hasta 8.192 tokens a más de 1.000 tokens/segundo.
  • Compatible con cualquier GPU NVIDIA GeForce RTX 20/30/40/50 o AMD Radeon RX 6800/6900/7800/7900/9060/9070/Radeon AI PRO R9700 con 12 GB o más de VRAM, según docs/INSTALL.md.
  • Multi-GPU: dos o tres tarjetas pueden compartir el modelo.

Strata es gratis y open source bajo licencia MIT. El modelo Qwen3.8 Flash Next fue comprimido por ISTA-DASLab, UkisAI (Swift 1.5) y Unsloth; los pesos cuantizados viven en Hugging Face.

Números reales en hardware de consumo

Las cifras vienen de la tabla oficial de Strata medida por la comunidad, en el README del repositorio:

NVIDIA RTX 5070 (12 GB) + Ryzen 5 7600 + 64 GB RAM:

Tamaño Escritura Lectura del prompt
Q2_0 94 t/s 2.650 t/s
IQ2_XS 79 t/s 2.090 t/s
IQ3_XXS 62 t/s 1.750 t/s
IQ3_S 53 t/s 1.620 t/s
Coder 55 t/s 2.180 t/s

AMD RX 9070 XT (16 GB) + Ryzen 9 3900X + 47 GB RAM:

Tamaño Escritura Lectura del prompt
Q2_0 60 t/s 1.160 t/s
IQ2_XS 52 t/s 1.110 t/s
Coder 44 t/s 1.420 t/s

Una RTX 3090 de 24 GB —la antigua bestia de los miners reconvertida en estación de trabajo— debería escribir entre 100 y 140 tokens por segundo según las estimaciones del propio repositorio. Una RTX 4090 de 24 GB se ubica en ese mismo rango de hardware. Para poner los números en contexto, según la guía de daily.dev sobre Ollama y llama.cpp publicada en junio de 2026, una RTX 4090 corre modelos de 30B+ parámetros a unos 95 t/s con cuantización Q4KM, así que Strata está estirando esa misma tarjeta hasta mover 125B con resultados interactivos. La comparación clave: la misma clase de hardware que mueve un Qwen3-30B ahora puede correr un Qwen3.8 Flash Next 125B a costa de agresiva cuantización.

Cómo encaja esto con el resto del ecosistema local

Strata no compite con Ollama ni con LM Studio, los complementa: usa llama.cpp por debajo y expone un servidor OpenAI-compatible en http://127.0.0.1:8080/v1, además de un endpoint /v1/messages estilo Anthropic en /v1/messages y soporte para Responses API. Eso significa que puedes redirigir Claude Code, Cursor, Codex CLI o GitHub Copilot al servidor local con sólo cambiar la base URL y la ANTHROPIC_BASE_URL, según se describe en el README.

La variante Coder (mitad de expertos removidos, 32 GB de RAM mínimos) alcanza el 91 % del score SWE-bench Verified del modelo completo, medido por sus autores. Para tareas no-code, especialmente CJK, el repositorio recomienda Q20, IQ2XS o IQ3_S que conservan todos los expertos.

Otras variantes disponibles: Swift 1.5 (fine-tune que piensa más corto y responde antes), Unsloth UD-IQ4XS (~4-bit, entre IQ3S y UD-Q4KXL en calidad, descarga de 94 GB) y Unsloth UD-Q4KXL experimental (más cercano al modelo completo pero penalizado por offloading a SSD: solo 7-8,5 t/s en una PC con 64 GB).

Qué significa esto para tu startup

Strata no es para todo el mundo —requiere 32 GB de RAM mínimo, 80 GB de disco y una GPU decente— pero para founders que ya trabajan sobre una workstation con 64 GB de RAM y una RTX 3090/4090/5070, cambia tres cuentas:

  • Privacidad y compliance: código fuente, contratos legales, transcripciones de soporte y datos de clientes se quedan en tu máquina. Para founders en fintech, salud o legal que hoy firman DPAs con OpenAI o Anthropic, Strata elimina esa dependencia por defecto. «Nada sale de tu PC», como repite el README.
  • Costo marginal cero a partir del hardware: según daily.dev, una GPU de 2.000 USD operando 24/7 cuesta unos 50 USD/mes al mes en consumo. Por encima de unas 10.000 consultas diarias con contexto sustancioso, local se paga solo en 3-6 meses frente a APIs de pago.
  • Coding agents sin filtrar código: si hoy usas Cursor, Claude Code o Codex y te preocupa que tu código pase por servidores de terceros, apuntarlos a http://127.0.0.1:8080/v1 con Qwen3.8 Flash Next Coder (SWE-bench Pro 62,5 según Qwen) da un sustituto razonablemente competente sin salir de tu red.

Acciones concretas que podés implementar esta semana:

  1. Audita tu hardware antes de prometer a clientes que corres IA local. Con 32 GB de RAM y 12 GB de VRAM ya podés levantar la variante Coder; con 64 GB de RAM y 16 GB de VRAM ya podés correr IQ3_S, que es la versión con todos los expertos y la más equilibrada calidad/rendimiento del repositorio.
  2. Integra Strata en tu coding agent hoy: exportar ANTHROPIC_BASE_URL=http://127.0.0.1:8080 para Claude Code, o apuntar Cursor/Codex a http://127.0.0.1:8080/v1. Cualquier API key sirve, cualquier nombre de modelo sirve. Es 5 minutos de configuración para tener un coding agent que no envía tu código a terceros.
  3. Mide tokens por segundo con tu carga real, no con benchmarks sintéticos. El primer arranque carga entre 35 y 55 GB en RAM y deja la PC lenta durante 1-3 minutos; el segundo arranque ya es instantáneo. Mide en tu workload, no en el de marketing.

Si tuvieras que llevarme un contraargumento honesto: el motor todavía está en 0.1.x (versiones experimentales, probadas por la comunidad), la lectura de imágenes en AMD requiere Linux, y para preguntas realmente duras todavía gana Claude-Opus-4.6 (Max) en el benchmark HLE (40,0 vs. 35,9). Pero para el 80 % del trabajo diario de un founder —resúmenes, RAG sobre tu propia documentación, agentes sobre tu código, clasificación de soporte— un modelo de 125B corriendo a 94 t/s en una GPU de 1.200 USD es, sencillamente, otro mundo.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...