GPT-6 Astra diseña rutas de running con datos OSM en 27 min

Simon Willison diseña rutas de 5K y 10K con GPT-6 Astra y datos abiertos

El desarrollador y autor Simon Willison publicó el 12 de septiembre de 2026 un experimento breve pero revelador: pidió a ChatGPT Work corriendo sobre GPT-6 Astra (modo Max) que calculara rutas de running de 5K y 10K en bucle desde su casa usando datos de OpenStreetMap. El agente trabajó 27 minutos y entregó el resultado en dos formatos: una visualización HTML embebida en la propia interfaz de ChatGPT y archivos descargables GPX y GeoJSON.

Para un founder hispanohablante la prueba importa por dos cosas a la vez. Primero, demuestra el techo actual de los agentes autónomos: una sola instrucción en lenguaje natural resuelve una tarea geoespacial no trivial sin escribir código. Segundo, expone una fricción crítica que vuelve a aparecer en todos los despliegues largos: el código real que ejecutó el modelo desapareció cuando el hilo se compactó, y Willison ya no pudo recuperarlo.

Cómo lo hizo el agente (y por qué no pudimos verlo)

Cuando Willison le preguntó al modelo qué había hecho, la respuesta fue clara y honesta: usó Nominatim para geocodificar la dirección y la API Overpass para descargar la red local de calles y senderos de OpenStreetMap, y calculó los bucles en local. Para la visualización recurrió al skill visualize, que genera un archivo /workspace/el-granada-5k-share.html con la ruta dibujada en D3.js (v7.9.0) cargado desde un CDN permitido por la CSP del sistema (cdn.jsdelivr.net).

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

El problema llegó después. Willison quiso pedirle al agente el código Python exacto que había corrido para generar la ruta, y ChatGPT no pudo mostrarlo. La causa: el hilo se había compactado y la traza previa se había perdido. Willison lo califica como un anti-feature y propone una regla de diseño que cualquier equipo montando agentes debería copiar: «cualquier sistema LLM que use compactación debe preservar el texto pre-compactado y exponerlo vía tool calls».

El archivo HTML resultante sigue siendo inspeccionable —coordena un LineString con la geometría completa— y deja entrever la tubería: Nominatim → Overpass → cálculo local → render con D3. Pero la lógica de ruteo en sí, el detalle algorítmico, ya no es recuperable desde el chat.

Qué es GPT-6 Astra y qué aporta frente a GPT-5.6 Sol

GPT-6 Astra es el modelo de siguiente generación de OpenAI, presentado oficialmente días antes de la prueba de Willison. Según la cobertura de Wired y Geeky Gadgets, OpenAI lo describe como el «mejor modelo del mundo para uso de computador»: navega navegadores, opera software, escribe código y resuelve problemas matemáticos con una fluidez inédita.

Dos cifras concretas del lanzamiento:

  • 47% menos tiempo de finalización de tareas frente a GPT-5.6 Sol.
  • Precios: US$10 por millón de tokens de entrada y US$50 por millón de tokens de salida, con un modo fast opcional a 2,5× de velocidad al doble de coste.

El acceso inicial fue por el programa Daybreak de OpenAI y organizaciones seleccionadas; después se abrió a suscriptores de ChatGPT Plus, Pro, Business y Enterprise, además de la API de OpenAI y Amazon Bedrock. En la presentación, el presidente Greg Brockman fue más allá y declaró que «es razonable sentir que estamos en la era de la AGI». El chief scientist Jakub Pachocki añadió un matiz clave: monitorizan el chain-of-thought del modelo para alinearlo, pero advirtió que mantener esa monitorización será un cuello de botella para escalar más.

Qué es ChatGPT Work y por qué importa para tu startup

ChatGPT Work es la versión no-code del agente Codex de OpenAI, pensada para profesionales no técnicos. Está disponible en la app de escritorio de ChatGPT y parte desde el plan de US$20/mes; según TechCrunch, ya es el hogar de unos 20 millones de usuarios (la app conjunta de ChatGPT cuenta más de 1.000 millones de usuarios online).

Su producto estrella, el Data Agent, se presentó el 10 de septiembre de 2026: un plugin que se conecta a fuentes aprobadas (Redshift, BigQuery, Snowflake, Databricks, MongoDB, ClickHouse, Datadog), trae archivos de Google Drive y SharePoint, y construye dashboards interactivos respondiendo a preguntas en lenguaje natural. Empresas como NTT Data, Thermo Fisher, ServiceTitan, Zipline, CookUnity, Empower, micro1 y otras del programa Alpha ya lo están usando.

Tres limitaciones que Willison deja en evidencia y que vas a encontrar cuando lo pruebes:

  • Visibilidad opaca. No ves el código que ejecutó el agente salvo que pidas captura inmediata; si el hilo se compacta, lo pierdes.
  • Errores de configuración. En su prueba con TechCrunch, dar permiso de solo-lectura a Google Drive dio mensajes circulares; la app a veces exige acceso completo.
  • Coste real. En cuatro días de uso casual Willison quemó 80 millones de tokens valorados por el propio modelo en US$65 — un subsidio de 3× sobre la suscripción de US$20/mes. Thibault Sottiaux, líder de producto Work en OpenAI, reconoció que están empujando la frontera de eficiencia cada día.

Qué significa esto para tu startup

La prueba de Willison no es un truco: es un termómetro del estado real de los agentes en septiembre de 2026. Si tu producto SaaS depende de IA generativa, la vara que pone este experimento es exigente y útil.

Dos acciones concretas que puedes implementar esta semana:

  • Audita la trazabilidad de tus agentes. Si usas ChatGPT Work, Claude Cowork, Codex o un agente propio, exige que el código, las llamadas a API y los prompts completos se persistan fuera del hilo (logs estructurados, S3, o un tool call que vuelque el artefacto antes de cualquier compactación). La regla de Willison —preservar el estado pre-compactado y exponerlo vía tools— debería ser estándar de tu arquitectura.
  • Mide coste por tarea, no por token. El caso de Willison (US$65 en cuatro días casuales) muestra que el modelo por millón de tokens engaña. Calcula el coste medio de una tarea acabada para tu usuario —idealmente <US$0,50 si quieres un producto con margen— y rediseña el flujo cuando lo superes.

El debate sobre transparencia que Willison abre es estructural: cuando un agente ejecuta 27 minutos de trabajo y luego pierde la memoria, la auditoría y el aprendizaje continuo sobre esos flujos se rompen. Los equipos que resuelvan eso primero (con logs inmutables, replay de sesiones y code dumps automáticos) tendrán una ventaja seria a la hora de vender agentes a empresas reguladas.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...