La promesa de «tokens gratis» que abrió el evento de Microsoft y Nvidia
Microsoft presentó este miércoles en San Francisco, junto a Nvidia, su nueva estrategia de «inteligencia híbrida», una idea con la que la compañía quiere que los usuarios ejecuten modelos de IA directamente en su PC, sin pasar por la nube. El atractivo central del discurso fue una promesa repetida por varias directivas: los «tokens gratis» que se generan al usar modelos locales, frente al coste de pagar suscripciones como ChatGPT Plus o Claude Pro (US$20/mes cada una).
La ejecutiva Kayla Cinnamon lo resumió durante la demo: con GitHub Copilot y el nuevo enrutador inteligente de modelos se puede ver cómo ciertas tareas consumen tokens de pago, pero otras se resuelven con tokens «gratis» generados en local. La idea de fondo es potente: tener tarifa plana de IA, en tu propio equipo, sin filtros y con privacidad por defecto.
El problema es que esos tokens no salen del aire: salen del hardware que los genera, y ahí es donde la promesa empieza a crujir.
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 días¿Cuánto cuesta realmente entrar en la «IA local» de Microsoft?
El escaparate elegido es el nuevo Surface Laptop Ultra, un portátil de 15 pulgadas con el chip Nvidia RTX Spark N1X, que combina una CPU Nvidia Grace con una GPU Blackwell RTX y hasta 128 GB de memoria unificada LPDDR5x. Según TechRepublic y CNET, los precios quedan así:
- Desde US$2.599: configuración base con CPU de 18 núcleos, GPU Blackwell de 5.120 núcleos, 24 GB de RAM y SSD de 512 GB.
- US$3.300: con 32 GB de RAM y 1 TB de SSD.
- Desde US$3.600: con el chip superior (CPU de 20 núcleos, GPU de 6.144 núcleos) y 32 GB de RAM.
- Hasta US$5.900: configuración tope con 128 GB de RAM y 1 TB de SSD (ya agotada en preventa, según CNET).
A ese catálogo hay que sumar la Surface RTX Spark Dev Box, una workstation de escritorio que arranca en US$5.999 y que Microsoft, según TechCrunch, envía ya preconfigurada con Visual Studio Code, GitHub Copilot CLI, WSL y PowerShell 7, pensada para desarrolladores que necesiten ejecutar modelos de más de 120.000 millones de parámetros en local.
El envío del portátil arranca el 16 de octubre; el de la Dev Box está previsto para noviembre en Estados Unidos.
Por qué los 24 GB del modelo base no alcanzan
La propia cobertura de Xataka señala un punto incómodo: los 24 GB de la versión básica se quedan cortos para correr con soltida modelos locales populares como Qwen 3-8B/27B, que en este momento ofrece una de las mejores relaciones tamaño/prestaciones del segmento. Saltar a 32 GB implica pagar US$3.300, y aun así el ancho de banda de la memoria no aparece detallado en la ficha técnica de Microsoft.
Por ese mismo precio se puede comprar un MacBook Pro con chip M5 Pro y 48 GB de memoria unificada (con 307 GB/s de ancho de banda), un dato que Xataka pone sobre la mesa para comparar. La diferencia clave es que la propuesta de Microsoft presume de soporte nativo de CUDA, el ecosistema de Nvidia, que sigue siendo el estándar de facto para entrenar y desplegar modelos.
Microsoft lo sabe, y por eso lanzó una promoción dirigida directamente a los usuarios de Mac: hasta US$1.000 de descuento por entregar un MacBook Pro viejo, según TechCrunch. Es una señal clara de dónde está la batalla por el desarrollador.
¿Qué es realmente la «inteligencia híbrida»?
El término lo acuñó en el evento Pavan Davuluri, presidente de Windows y Dispositivos: «Un futuro en el que la inteligencia híbrida siempre está disponible. Ejecutándose en local cuando tiene sentido, accediendo a la nube si lo necesita». En la práctica, se trata de que el sistema decida por ti qué tareas resolver con un modelo local y cuáles enviar a la nube, en función del coste, la complejidad y la privacidad.
Microsoft no va sola en esta idea. Apple lleva meses vendiendo el mismo concepto con sus Mac con chip M-series, y en el móvil ya lo vemos funcionar: Siri AI y Gemini ejecutan modelos pequeños en el dispositivo para tareas rutinarias y reservan la nube para las peticiones pesadas. La novedad es que Microsoft quiere convertirlo en el modelo por defecto del PC con Windows.
Para hacerlo creíble, la compañía está llevando a Windows un arsenal de modelos optimizados para correr en local, según Tech Wire Asia:
- MAI Code 1.1 Flash (modelo propio de Microsoft): 137.000 millones de parámetros totales, 6.800 millones activos, cuantizado a 3 bits y con ventana de contexto de 256.000 tokens.
- Nvidia Nemotron de próxima generación: 70.000 millones de parámetros en cuantización de 2 bits, ocupando poco más de 20 GB.
- DeepSeek V4 Flash y un futuro Meta Muse como aplicación nativa para Windows.
A eso se suma soporte para llama.cpp dentro de Windows ML, lo que permite ejecutar modelos open source en CPU, GPU o NPU indistintamente, y la disponibilidad general de Microsoft Execution Containers (MXC), una capa de seguridad que aísla a los agentes de IA en contenedores (sandbox) para que no toquen lo que no deben.
La competencia ya está en la misma carrera
Microsoft no es la única que apuesta por RTX Spark en el PC. En el mismo evento, Dell anunció su XPS 16 Creator Edition con el mismo chip, en preventa en Best Buy por US$3.800 con entrega prevista para finales de octubre. ASUS, HP, Lenovo y MSI también preparan modelos con RTX Spark para el 16 de octubre, según TechCrunch. Es decir, la promesa de «IA local» no depende de comprar un Surface: el ecosistema entero se está moviendo en esa dirección.
Y para quienes necesiten más músculo, Microsoft y Nvidia adelantaron la DGX Station for Windows: hasta 748 GB de memoria coherente, 20 petaflops de rendimiento FP4 y capacidad para correr modelos de 1 billón de parámetros con 32 o más agentes simultáneos. Es infraestructura de centro de datos en formato desktop, no un portátil.
Qué significa esto para tu startup
La pregunta real no es si el Surface Laptop Ultra es caro (lo es, sobre todo en sus versiones de 32 GB o más), sino cuándo tiene sentido pagar esa entrada para una startup. Estos son los criterios prácticos:
- Si tu producto maneja datos sensibles (salud, legal, finanzas, código propietario de clientes) y hoy estás pagando API para procesarlos, una workstation con RTX Spark puede devolver la inversión en meses. La promesa de privacidad ya no es marketing: los datos no salen del equipo.
- Si tu modelo de negocio depende de reventar el coste por token, la IA local elimina la variable de la factura cloud y permite tarifas planas previsibles. Es exactamente el desplazamiento que Microsoft describe con la metáfora del «módem a la banda ancha».
Dos acciones concretas que puedes tomar esta semana:
- Calcula tu coste mensual real en APIs. Suma lo que pagas a OpenAI, Anthropic, Gemini o cualquier proveedor cloud y compáralo con la amortización de un equipo de 32-48 GB. Con los modelos cuantizados a 2-3 bits que ya están llegando, muchos workloads de PLN y coding se pueden mover a local sin pérdida perceptible de calidad.
- Define una política de «qué se queda en local». No todo tiene que ir a la nube. Empieza por las tareas de bajo riesgo y alto volumen (resúmenes, clasificación, refactors de código) y reserva la nube para lo que realmente necesita los modelos frontera. El enrutador de GitHub Copilot que mostró Microsoft ya permite hacer esto de forma nativa.
Conclusión
Microsoft tiene razón en lo grande y se equivoca en el detalle. La «inteligencia híbrida» no es un eslogan marketiniano vacío: es el futuro más probable de cómo vamos a usar IA desde el PC y el móvil. Pero llamar «gratis» a los tokens locales cuando el hardware mínimo cuesta US$2.599 es, como mínimo, un ejercicio de imprecisión. La verdadera pregunta para un founder no es si la IA local es buena (lo es), sino si tu negocio está listo para que parte de tu coste de IA se convierta en una inversión de capital en lugar de un gasto operativo.
Fuentes
- La gran promesa de la IA local de Microsoft son los «tokens gratis». En realidad no son gratis, pero eso no importa (fuente original)
- Surface Laptop Ultra Preorders: Everything Announced at Microsoft’s Windows and Surface Event
- Microsoft releases new Nvidia-chip AI PCs with revamped Windows 11
- Microsoft’s $2,599 Surface Laptop Ultra Puts Nvidia RTX Spark Inside a Windows Laptop
- Microsoft event debuts new AI-friendly hardware and Windows changes
- Microsoft and Nvidia bring AI models and agents to Windows PCs
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 días













