ChatGPT Work: OpenAI lleva sus agentes de IA más allá del código

El movimiento que redefine la batalla de los agentes de IA

El 24 de agosto, TechCrunch publicó un perfil extenso sobre ChatGPT Work, el nuevo agente agéntico que OpenAI lanzó el 9 de julio de 2026 y que busca sacar la automatización agéntica del terreno exclusivo de los desarrolladores. El producto corre sobre GPT-5.6 (en sus variantes Sol, Luna y Terra), combina la arquitectura de Codex con un nuevo plugin unificado, y se ofrece a partir del plan Plus de US$20 al mes — un precio que lo pone a la altura de un SaaS de oficina, no de una herramienta premium para ingeniería. En palabras de OpenAI recogidas por Forbes, Sam Altman lo presenta como un modelo "54% más eficiente en tokens en coding agéntico" en un momento en el que cada empresa "piensa en cuánto gasta y qué valor obtiene a cambio de IA".

La jugada importa porque Codex ya pasó la frontera del código sin pedir permiso. Más de cinco millones de personas usan Codex cada semana y, de ese total, más de un millón lo emplea para tareas fuera del desarrollo de software, según datos publicados por The Next Web. Si la versión de escritorio fusiona ChatGPT, Codex y Work en una sola aplicación, el "stack agéntico" deja de ser una categoría técnica para convertirse en una categoría de oficina.

Las cifras que OpenAI no puede ignorar

El paper de investigación de la propia OpenAI, "The Shift to Agentic AI: Evidence from Codex" — elaborado con investigadores de Columbia, Wharton y Duke y publicado en junio de 2026 — muestra un contraste incómodo:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • 98% de los empleados de OpenAI usaban Codex en junio de 2026.
  • Apenas 17% de los suscriptores organizacionales (enterprise) lo adoptaban.
  • Menos del 1% de los suscriptores individuales lo usaban.

Esa brecha entre la adopción casi total dentro de casa y la adopción externa se convirtió en el problema de producto más urgente de la compañía. Pero la misma investigación muestra que la curva se está comprimiendo: los usuarios no-desarrolladores en cuentas empresariales crecieron 189 veces entre agosto de 2025 y junio de 2026, y los suscriptores individuales no-técnicos, 137 veces en el mismo periodo. Es, posiblemente, el desplazamiento de herramienta profesional más rápido que se haya medido.

El cambio no es solo de cantidad, también de intensidad. En mayo de 2026, el 70,2% de los usuarios individuales enviaba al menos una tarea estimada en una hora o más de trabajo humano — frente al 35,4% en diciembre de 2025. Más del 10% de los usuarios ya gestiona tres o más agentes Codex en paralelo cada semana, y el 1% más activo de los empleados de OpenAI genera más de 60 horas diarias de runtime agéntico distribuidas entre múltiples flujos simultáneos. En departamentos no técnicos como Legal, Finanzas o Recruiting, la generación de tokens por Codex supera ya el 85% del output total de IA.

Codex como motor y el debate abierto del harness

ChatGPT Work es, técnicamente, una versión modificada de Codex con plugins, integración con Slack, Drive, SharePoint, CRMs y calendarios, y un navegador embebido en la app de escritorio. El modelo de fondo sigue siendo el mismo, pero el harness —el software que decide qué ve el modelo, qué herramientas puede invocar y cómo devuelve las respuestas— cambia por completo. Y ahí está el debate central que cualquier founder que construya con LLMs debería seguir.

Dos bandos. Por un lado, Joe Gershenson, líder de harness en OpenAI, sostiene la "bitter lesson": invertir demasiado en ifs, thens y tools alrededor del modelo es perder el tiempo, porque el próximo modelo vuelve obsoleto al actual en pocos meses. Por el otro, Mario Zechner, creador del harness open source Pi, mostró que su harness minimalista superó a Codex en benchmarks de código usando exactamente el mismo modelo GPT-5.5, según pruebas reproducidas por Composio y Databricks. La conclusión de Zechner es estructural: los grandes laboratorios tienen "datos de entrenamiento solo de tareas de agente de código", lo que los sesga hacia su propio harness y los empuja al lock-in.

Para un founder, esto se traduce en una decisión práctica: si tu producto depende del agente de un solo proveedor, estás asumiendo dos riesgos — que ese proveedor suba precios (como temen algunos ejecutivos, según Business Insider) y que su harness deje de ser competitivo frente a alternativas abiertas.

La guerra con Claude y el coste real de la autonomía

La arquitectura del producto lleva la huella de la competencia con Anthropic. OpenAI tuvo la idea primero —lanzó Codex como web app— pero apostó por agentes muy autónomos. Claude Code, construido poco después, giró en torno a conversación iterativa: presenta tres o cuatro opciones, espera la decisión del usuario, avanza y vuelve a chequear. Esa cautela ganó tracción: según los datos del paper de OpenAI, Claude Code lideró descargas hasta abril de 2026, y Codex tomó la delantera después, en parte por restricciones de cómputo y políticas de seguridad de Anthropic. Ethan Mollick, profesor de Wharton, sigue viendo a Claude como más amigable: "ChatGPT tiende a querer hacer magia y hacerlo todo, mientras Claude compara y muestra, pidiendo input repetidamente".

El precio de la autonomía total es la fricción. El reportero de TechCrunch documentó errores repetidos al conceder permisos de solo lectura a un drive en la nube, configuraciones que solo existen en la versión web, y agentes que crean eventos pero no calendarios nuevos en Google Calendar. La advertencia que repiten los primeros usuarios: sin el nivel de esfuerzo ("effort") alto, "tienes al peor stagiaire con el que has trabajado".

En lo comercial, el modelo de costes ya muestra tensión. Una sola tarea de Work que lee doce archivos, cruza un CRM y arma una presentación no es un mensaje: es un run agéntico largo, y el medidor del plan lo cobra como tal. Quienes usan Work de forma intensiva terminan saltando de Plus (US$20) a Pro (US$100) o Pro Max (US$200), según el desglose publicado por Carly. Es la misma dinámica que empuja a los usuarios de Claude Cowork al tier Max, y la razón por la que Gemini Spark exige el plan AI Ultra de US$100.

Qué significa esto para tu startup

El movimiento de OpenAI confirma que la conversación sobre agentes ya no es técnica, es de producto. Tres acciones concretas que un founder puede aplicar esta semana:

  • Reescribe tu roadmap asumiendo que tus clientes no técnicos van a delegar tareas, no a pedir respuestas. Si tu SaaS B2B compite con un workflow manual en ventas, operaciones o finanzas, intégrate con plugins como los que ofrece ChatGPT Work antes de que un competidor lo haga.
  • Diseña tu stack con modelo agnóstico si dependes de un agente. El caso Code Puppy en Walmart —un agente multi-modelo construido para evitar el lock-in— muestra que empresas grandes ya están apostando por mantenerse portables entre OpenAI, Anthropic y Google. Para una startup, eso significa evitar atarse al SDK de un solo proveedor cuando hay alternativas abiertas como Pi o Pydantic AI.
  • Calcula el coste real por tarea, no por mensaje. Si automatizas un flujo recurrente con un agente agéntico, haz el ejercicio de cuántas tareas reales ejecutarás al mes y a qué tier te lleva eso. Para trabajo repetitivo de poco valor, los workflows tipo Zapier no metered suelen salir más baratos que un agente premium.

Conclusión

OpenAI tiene un problema clásico de "producto interno que no sale": el 98% de sus empleados usa Codex y menos del 1% de sus suscriptores individuales lo hace. ChatGPT Work es la respuesta — un mismo agente, una misma arquitectura, un precio de oficina (US$20) y un modelo (GPT-5.6) que ya pasó la barrera del millón de usuarios no-desarrolladores. La pregunta abierta es si la autonomía total que ofrece OpenAI convence al profesional de a pie, o si la cadencia más humana de Anthropic termina siendo el estándar. Lo que sí está claro: los roadmaps de cualquier startup que venda a equipos de oficina van a tener que asumir, antes de fin de año, que delegar trabajo a un agente ya no es una novedad, es la nueva línea base.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...