Perplexity lanza Portable Computer: agente IA local sin coste de tokens

Qué es Portable Computer y por qué importa a un founder

Perplexity lanzó este 25 de agosto de 2026 su producto Portable Computer, una versión local de su plataforma agéntica Computer que corre por defecto sobre el propio hardware del usuario, empezando por la workstation Nvidia DGX Spark y cualquier máquina Linux con tarjeta Nvidia RTX. Cuando la tarea se resuelve en el equipo, el contador de créditos se queda en cero: la inferencia no se factura. Solo cuando el agente decide (con tu permiso explícito) escalar a un modelo frontera en la nube se consumen créditos.

Lo que cambia para un fundador es simple: hasta ahora, los agentes que «siempre están encendidos» — revisando carpetas, verificando su propio trabajo, iterando sobre datos — multiplican el gasto en tokens hasta hacerlo impredecible. Un estudio de mayo de Microsoft Research citado por TechRepublic confirmó que los modelos frontera no pueden predecir su propio consumo de tokens antes de ejecutar una tarea, y que tareas idénticas pueden variar hasta 30× en coste. El propio Steve Lucas, CEO de Boomi, dijo a ZDNet que su gasto en Claude se multiplicó por 10 en un año. Esa dinámica es la que Portable Computer viene a romper.

Cómo funciona el stack local de Portable Computer

El producto empaqueta en una sola app todo lo que normalmente hay que montar a mano: modelo, el llamado “harness” del agente (la capa que orquesta prompts, herramientas y memoria), motor de inferencia, conectores (Google Drive, Gmail, GitHub, Slack) y un sandbox a nivel de sistema operativo. Internamente usa vLLM para servir el modelo y deja un modo avanzado para enchufar tu propio endpoint de inferencia.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

En la demo, el sistema ejecutó un modelo Qwen 3.8 27B a plena utilización de la GPU sobre un DGX Spark revisando una carpeta de 1099 y documentos financieros — el tipo de archivo que un founder no subiría a un servicio cloud. Nate, VP de ingeniería de Perplexity, lo resumió así: el contador de créditos “está parado en cero porque todo esto está pasando en el dispositivo” (VentureBeat).

Los modelos disponibles al lanzamiento son Qwen 3.8 27B o la versión post-entrenada por Perplexity (PPLX 27B), con Nemotron 3.5 Lightning de Nvidia próximamente. En Linux, hace falta DGX Spark o un equipo con Ubuntu / DGX OS sobre ARM o x64 más una RTX. En Windows — llegará en septiembre — el suelo es una RTX con al menos 24 GB de VRAM (ZDNet).

La trampa de los agentes “always on”: por qué la economía local es diferente

El razonamiento estratégico detrás del lanzamiento lo explica Nader, director de developer technology en Nvidia, en la misma presentación: “con agentes, quieres que estén siempre encendidos si puedes. Quieres que consuman tantos tokens como puedan”. Un agente funcionando durante horas revisando documentos, auto-verificándose e iterando deja facturas API enormes cuando corre en la nube. Sobre el hardware que ya tienes, el coste marginal de esos tokens se acerca a cero (VentureBeat).

El paper publicado por Perplexity lo lleva al terreno enterprise: cuando los agentes escalan a workflows individuales y a organizaciones completas, el gasto en tokens y el movimiento de datos se vuelven cada vez más difíciles de gobernar. La ejecución local-first ataca los dos frentes a la vez — coste, porque la inferencia es gratis, y privacidad, porque los tokens sensibles nunca salen del dispositivo.

Qué mide el benchmark interno de Perplexity

La métrica más llamativa está en Terminal Bench 2.1, un benchmark exigente de coding. El modelo Qwen local resolvió el 59,6% de las tareas a coste marginal esencialmente cero; dejarlo escalar a un Claude Opus 5 como “asesor” subió al 73,0% con un coste estimado de US$0,415 por tarea; correr solo el modelo frontera dio 82,4% a US$0,65 por tarea. Es decir: la escalada recupera aproximadamente tres quintos de la brecha pagando dos tercios (VentureBeat). Antes de cada consulta al asesor remoto, el sistema corre un clasificador de PII sobre el contexto saliente y muestra exactamente qué abandonaría el equipo.

En el Local Knowledge Work Bench propio de Perplexity — 53 tareas de investigación profunda, análisis financiero y creación documental que planean abrir como open source — Computer con Qwen 3.8 27B en un DGX Spark alcanzó 82,6% frente al 77,6% del harness open-source Pi y el 74,0% de Hermes. La versión post-entrenada PPLX 27B subió al 85,4%. En BrowseComp, la diferencia se amplía: 66,7% vs. 50,2% de Pi y 43,9% de Hermes, usando 51% menos tiempo y 70% menos tokens que Pi. En comprensión multimodal de documentos, Computer llegó a 65,1% frente a 34,6% (Hermes) y 13,9% (Pi).

Qué significa el “modelo + harness diseñados juntos”

Perplexity descubrió empíricamente que aunque Qwen 3.8 27B anuncia 260.000 tokens de contexto, empieza a fallar más allá de los 100.000. Por eso construyó un harness deliberadamente mínimo: prompt de sistema conciso, pocas herramientas núcleo y capacidades que se cargan y descargan como “skills” bajo demanda en lugar de vivir permanentemente en el contexto. Convirtió conectores populares como Gmail y GitHub — originalmente servidores MCP pesados en tokens — en herramientas de línea de comandos compactas, añadió ganchos de auto-verificación y forzó sandboxing a nivel de SO. Si el sandbox no está disponible, el harness se desactiva antes que correr herramientas sin protección (VentureBeat).

La alianza Nvidia–Perplexity: qué se lleva cada parte

El lanzamiento prolonga una colaboración que viene de más de un año. En junio de 2025 Nvidia y Perplexity ya habían anunciado una alianza para llevar modelos soberanos a publishers y telecos europeos (Nvidia Newsroom reportado por VentureBeat). La filosofía — los datos “pertenecen a tu pueblo, tu país, tu cultura”, en palabras de Jensen Huang — es la misma que Portable Computer defiende a escala de un escritorio: inteligencia que controlas, corriendo en hardware que posees.

Para Nvidia, el movimiento da una killer app al DGX Spark, un equipo que según los propios asistentes a la presentación «ha sido más fácil de comprar que de usar». Alguien preguntado sobre si el Spark podría salir con Portable Computer preinstalado, Nader respondió: “Eso sería genial… el objetivo es asegurar que sea una experiencia súper fluida para cada usuario”. Conectar dos Sparks sobre memoria compartida corre modelos open de frontera como el último DeepSeek; cuatro pueden correr GLM 5.2 o Nemotron Ultra.

Para Perplexity, la jugada abre un vector de diferenciación en sectores sensibles (legal, salud, finanzas) con una economía que no depende de cobrar por cada token — útil justo cuando enfrenta presión legal de publishers, incluyendo la demanda de The New York Times de diciembre de 2025 y un litigio previo con Forbes (VentureBeat).

Dónde encaja frente a Ollama y otros stacks DIY

Preguntado por Jason Hiner de The Deep View sobre cómo se relaciona con Ollama, Nate dejó la línea clara: “la mayoría del esfuerzo ha estado en la capa del harness”, usando vLLM como inferencia por debajo. Quien solo quiera arrancar inferencia rápida puede seguir con Ollama; quien pase a tareas agénticas complejas “entonces necesitas más rendimiento. Empiezas a mirar otros modelos, otros harnesses, y es como el océano: cuanto más profundo vas, más profundo se pone” (VentureBeat).

El contexto de fondo: el “token maxing” ya está mordiendo a las empresas

El lanzamiento aparece en un momento donde el gasto en tokens de IA empieza a preocupar de verdad a los CFO. Forbes informó en agosto de 2026 que el consumo de tokens se está convirtiendo silenciosamente en una de las partidas de más rápido crecimiento en los presupuestos de tecnología enterprise, sin que la mayoría de las organizaciones estén equipadas para gestionarlo. La práctica ha sido bautizada como “token maxing” (Forbes).

TechRepublic recogió varios casos documentados por Forrester en julio: Uber quemó su presupuesto anual de IA en cuatro meses, Microsoft terminó licencias de Claude Code tras agotar su asignación anual, Tesla capó el gasto en IA en US$200/semana y Priceline enfrentó picos inesperados en costes de renovación de desarrollo. Un creador de un proyecto de investigación llegó a quemar US$1,3 millones en tokens de la API de OpenAI en 30 días con unos 100 agentes autónomos, según Lumenova (TechRepublic). Estos datos ayudan a entender por qué la propuesta “coste marginal cero para tareas locales” tiene tanto atractivo comercial.

Qué significa esto para tu startup

Si tu producto expone alguna forma de agente a clientes enterprise, lo que Perplexity y Nvidia acaban de poner sobre la mesa cambia tu mapa de costes. Tres palancas concretas a evaluar:

  1. Audita tu coste por tarea ahora mismo. Mide tokens de input vs. output por workflow, número de llamadas a herramientas por tarea y varianza entre tareas equivalentes. El estudio de Microsoft Research citado por TechRepublic muestra que la autoclasificación del modelo sobre su propio gasto correlaciona solo 0,39 con la realidad — no puedes presupuestar agentes con la precisión que presupuestabas SaaS (TechRepublic).

  2. Decide qué tareas se quedan en el dispositivo y cuáles escalan al cloud. El patrón de Portable Computer es claro: ejecutar el 60–80% del trabajo en modelo local barato y reservar el asesor frontera solo para los pasos donde realmente mueve la aguja en precisión. Aplica ese patrón aunque tu modelo local sea una API de un proveedor pequeño o de tu propio modelo afinado.

  3. Construye un clasificador de PII y un panel de consentimiento desde el día uno. Uno de los argumentos comerciales más fuertes de Portable Computer es que muestra exactamente qué dato saldría del dispositivo antes de cada consulta cloud. Replicar esa transparencia — aunque tu agente corra 100% en la nube — te diferencia en sectores regulados (VentureBeat).

Lo que todavía está por ver

Los números más impresionantes de Perplexity vienen de su propio benchmark, y la propia compañía reconoce que los modelos compactos siguen por detrás del frontera en razonamiento difícil — la escalada al asesor “acerca pero no cierra del todo la brecha”. El lanzamiento es solo Linux por ahora, el suelo de 24 GB de VRAM deja fuera a la mayoría de PCs de consumo y Apple Silicon queda conspicuamente fuera del roadmap: “ahora mismo estamos muy centrados en hardware Nvidia”, dijo Nate. La pregunta de si un DGX Spark podría salir con Portable Computer y Nemotron preinstalados quedó abierta.

Pero la dirección del viaje es inequívoca. Portable Computer propone una nueva métrica para medir la potencia de los agentes — y esa métrica nunca corre.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...