Perplexity lleva agentes de IA al PC y borra el costo por tokens

Por qué Perplexity y Nvidia quieren mover los agentes de IA a tu escritorio

Perplexity acaba de lanzar Portable Computer, una versión local de su plataforma de agentes Computer que ejecuta modelos, herramientas, inferencia y el entorno de trabajo directamente sobre el hardware del usuario. El lanzamiento, desarrollado junto con Nvidia, arranca con el supercomputador de escritorio DGX Spark y con máquinas Linux equipadas con GPUs Nvidia RTX de, al menos, 24 GB de VRAM.

El movimiento importa porque cambia dos variables que hasta ahora han frenado la adopción empresarial de agentes: el costo por token y qué pasa con los datos sensibles. El procesamiento local no consume créditos de nube y el modelo, los archivos y el flujo de trabajo permanecen en la máquina. Solo cuando el agente necesita un modelo de frontera más potente, pide autorización antes de saltar a la nube.

Qué trae Portable Computer que no existía ya en tu PC

Hasta hoy, ejecutar IA localmente significaba descargar un modelo, montar un servidor de inferencia, conectar herramientas a mano y pelearse con problemas de rendimiento. Perplexity empaqueta en un único instalable los modelos locales, el motor de inferencia, el agente, las herramientas, los conectores con Google Drive, Gmail, GitHub y Slack, y un sandbox de seguridad. El usuario final no debería tocar una terminal para ponerlo a funcionar.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

En la práctica, el producto inicial corre con el modelo abierto Qwen 3.8 27B (27.000 millones de parámetros) y con la variante PPLX 27B optimizada por Perplexity para el DGX Spark. Este último incorpora un mecanismo de multi-token prediction para acelerar el procesamiento de prompts. En pruebas recogidas por HotHardware, Qwen 3.8 27B rinde cerca de 12 tokens por segundo en un DGX Spark, una cifra que puede multiplicarse por cinco con arquitecturas tipo mixture-of-experts (MoE), como el próximo Nemotron 3.5 Lightning de Nvidia (30.000 millones de parámetros totales, 3.000 activos por token), que podría alcanzar los 60 tokens por segundo sobre el mismo equipo.

SiliconANGLE añade un detalle relevante: Qwen 3.8 27B ofrece una ventana de contexto teórica de 256.000 tokens, pero Perplexity detectó que por encima de 100.000 tokens la calidad cae. Para resolverlo, Portable Computer incluye context compaction, un mecanismo que resume los prompts largos y los mantiene por debajo de ese umbral.

Una demo que resume el caso de uso real

En la presentación a medios, Portable Computer recibió una carpeta con documentos financieros y formularios 1099 y actuó como un asistente de inversionista minorista. Usó Qwen 27B para revisar los archivos y detectar situaciones hipotéticas en las que el usuario pagaba comisiones innecesarias. Todo el procesamiento ocurrió en un DGX Spark y el contador de créditos en la nube se quedó en cero.

El ejemplo no es casual: ilustra el tipo de tarea donde la IA local brilla, documentos demasiado sensibles para enviarlos automáticamente a un proveedor externo. Para equipos legales, financieros, de salud, investigadores y desarrolladores que manejan código propietario, esa privacidad puede pesar más que unos puntos extra en un benchmark.

El modelo híbrido: local primero, nube solo con permiso

Portable Computer adopta un esquema local-first. Cada tarea arranca en el dispositivo. Si el modelo local no puede con un paso, el agente puede escalar a un modelo de frontera en la nube. La diferencia clave es que esa transferencia requiere autorización explícita del usuario. Antes de enviar contexto a un modelo remoto, el sistema puede analizar la información y avisar qué datos están a punto de salir del equipo.

El diseño invierte la relación por defecto del modelo tradicional: en lugar de enviar datos hacia el modelo, el trabajo permanece local y solo una parte determinada de la tarea sale del equipo cuando existe una razón concreta.

Requisitos de hardware: la barrera sigue siendo alta

La apuesta tiene un límite claro: el requisito mínimo es una GPU Nvidia RTX con 24 GB de VRAM, equivalente a una RTX 3090 o superior. La lista incluye las RTX 3090 y 4090 (24 GB) y la RTX 5090 (32 GB), además del propio DGX Spark y del Dell Pro Max con GB10. Windows llegará en septiembre; por ahora solo Linux y DGX OS. El producto está disponible para suscriptores Pro, Max, Enterprise Pro y Enterprise Max de Perplexity.

Un equipo con 24 GB de VRAM está muy lejos del PC promedio de oficina. Por eso el mercado inicial queda acotado a desarrolladores, profesionales y empresas con presupuesto para hardware especializado. El DGX Spark arranca en US$4.699 por unidad según datos publicados por Geeky Gadgets al analizar despliegues locales con dos unidades en clúster para modelos de mayor tamaño.

Qué significa esto para tu startup

Para founders que evalúan dónde correr agentes:

  • Replantear el unit economics. Un agente en la nube puede gastar créditos durante una hora revisando documentos, navegando, llamando herramientas y verificando resultados. Si tu producto depende de agentes de larga duración, correr parte del flujo en local puede acercar el costo marginal por tarea a cero y mejorar márgenes sin tocar el precio al cliente.
  • Considerar la promesa de privacidad como feature, no como eslogan. Sectores regulados (legal, salud, finanzas, defensa) suelen ser los que más pagan y los que más fricción tienen para subir datos a una API externa. Una arquitectura local-first con escalado opcional a la nube bajo permiso abre conversaciones comerciales que antes estaban cerradas.

Para founders que construyen sobre Perplexity o Nvidia:

  • Preparar integración con agentes locales. Si tu SaaS expone conectores para Google Drive, GitHub, Slack o Gmail, conviene validar cómo se ven cuando un agente los opera desde un equipo del cliente y no desde tu servidor. El sandbox de Portable Computer bloquea el acceso a archivos del sistema no relevantes para la tarea, lo que cambia qué información llega a tu servicio.
  • Evaluar la curva de adopción del DGX Spark. El precio de entrada (US$4.699) lo deja lejos del desarrollador individual medio, pero si tu cliente es una empresa con equipos de datos o I+D, puede convertirse en el nuevo estándar de escritorio para IA. Diseña tu oferta asumiendo que tus usuarios corporativos podrían llegar a tu producto con uno encima.

El segundo movimiento estratégico de Nvidia

Para Nvidia, el lanzamiento abre un segundo vector de crecimiento más allá de los centros de datos. Progress Software anunció en junio compatibilidad de Progress Chef Enterprise Management con DGX Spark, lo que confirma que el fabricante ve al dispositivo como una flota empresarial a gestionar, no como un experimento de nicho. Si los agentes empiezan a hacer tareas reales en escritorios de oficinas, estudios y laboratorios, la demanda de GPUs ya no dependerá solo de los hyperscalers.

La pregunta abierta es si el consumidor finalizará aceptando comprar hardware dedicado para correr agentes. Hoy, la respuesta es no para el usuario general, sí para profesionales y empresas que justifican la inversión con privacidad, costo recurrente y control de datos.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...