Claude Code Projects, Astra for Law y Bonsai 2 27B: el día que paró

Claude Code Projects convierte a Claude en un coordinador de agentes en paralelo

El 17 de septiembre de 2026, Anthropic reescribió desde cero la experiencia de Projects dentro de Claude Code. El cambio es conceptual: lo que antes era una carpeta con archivos y un chat ahora es una sola conversación donde Claude actúa como coordinador que reparte el trabajo en hilos paralelos en la nube. Cada hilo es una sesión completa de Claude Code, con su propia rama de git y su propia copia del repositorio, según reportó MarkTechPost al reseñar el anuncio oficial.

La arquitectura tiene dos capas claras. El chat del proyecto es el coordinador: lee lo que el usuario pide, contesta preguntas rápidas en línea y dispara hilos cuando hay trabajo real. Los hilos son los trabajadores: abren pull requests cuando corresponde, vigilan el CI con auto-fix y vuelven a empujar cambios si falla. Cuando dos hilos tocan el mismo código, el conflicto se resuelve como un merge conflict de git normal, sin magia. Anthropic usó como ejemplo internal configurar un proyecto con el objetivo de reducir la latencia p75 del checkout: el coordinador abre un hilo por endpoint, perfila, prueba optimizaciones y devuelve PRs en paralelo.

Lo más disruptivo para founders no es la demo, son los números operativos. Cada hilo consume plan como una sesión completa, lo que acelera el consumo de límites mucho más rápido. Anthropic fijó un techo de 200 hilos nuevos por día por cuenta y permite elegir modelo y nivel de esfuerzo separados para coordinador y workers. El beta arrancó el 17 de septiembre para un grupo reducido de suscriptores Pro y Max que ya usan cloud sessions; los proyectos web y desktop existentes quedan en la versión vieja hasta que se actualicen en oleadas sucesivas, según documentó unite.ai. Los workflows locales quedan fuera del beta inicial, una limitación relevante para equipos con código propietario o restricciones de cloud.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Anthropic publica métricas internas: Claude ya "lidera" el 26% de su propia I+D

En el mismo contexto, el CEO Dario Amodei publicó un post proponiendo tres mediciones para que los laboratorios de frontera comuniquen el ritmo real de su desarrollo. La más llamativa: en un índice que mide cuánto trabajo de AI R&D hace Claude end-to-end con un humano supervisando, la participación de Claude saltó del 1% al 26% en aproximadamente seis meses, según reportó Engadget citando el blog de Anthropic. Más del 90% del trabajo de investigación de la empresa ya involucra a Claude en "trozos grandes bajo dirección humana cercana", aunque la compañía aclara que el modelo "no opera de forma totalmente autónoma en ningún subconjunto medido" del trabajo de I+D.

El post también menciona ~30.000 agentes internos activos y propone dos métricas adicionales: una para medir cuánto se supervisa la actividad de los agentes (tiempo de revisión, frecuencia de flags de comportamiento) y otra para seguir cuánto cómputo se destina a AI R&D frente a otros usos. El número de agentes es de los pocos atisbos públicos sobre cómo de automatizada está realmente la investigación en un laboratorio frontera, y por eso se ha convertido en dato de referencia. Anthropic lo acompaña con un sistema de niveles de automatización desarrollado con Epoch AI, pensado para que otros laboratorios puedan reproducirlo con sus propios datos y validación externa.

OpenAI lanza Astra for Law: la verticalización llega a Big Law con 73 plugins

El 17 de septiembre, OpenAI presentó Astra for Law, una configuración de GPT-6 Astra empaquetada con instrucciones específicas para análisis jurídico, un Legal Search Index con más de 230 millones de URLs de jurisprudencia, estatutos y regulación estadounidense, y un programa de Trusted Access con Zero Data Retention para firmas elegibles, según reportó Artificial Lawyer. El lanzamiento incluye 26 plugins de socios (Thomson Reuters, Harvey, Legora, iManage, Relativity, Clio, DeepJudge, Intapp) y 47 plugins comunitarios con skills customizables por los propios abogados.

La pieza de adopción institucional es la que importa para founders B2B. Las firmas Latham & Watkins, Sullivan & Cromwell, Ropes & Gray y Cooley ya están usando Astra for Law en producción. Sullivan & Cromwell construyó un analizador de acuerdos que aplica sus playbooks de negociación a nuevos deals; Ropes & Gray montó un sistema de due diligence que rastrea hallazgos hasta la fuente en data rooms; Cooley creó GO Public para preparar OPVs arrastrando cambios a lo largo del filing completo. OpenAI destaca que las respuestas de Astra for Law son aproximadamente el doble de largas que las de Astra genérico, un guiño directo al feedback que recibió de los abogados.

En el benchmark interno que OpenAI hizo público, sobre 200 preguntas de investigación jurídica del set privado de validación del Vals AI Legal Research Bench, Astra for Law aprobó el chequeo de corrección general en el 54,0% de los casos, frente al 38,7% de GPT-6 Astra usando solo búsqueda web, una mejora relativa del 40% al máximo nivel de razonamiento, según el reporte de unite.ai. En preguntas centradas en case law, recuperó un 24% más de casos de referencia y hasta un 54% más de pasajes relevantes de las opiniones correctas.

Tres investigadores hackearon cuentas de OpenAI con Claude en menos de 72 horas

El Wall Street Journal reportó que un equipo independiente de tres investigadores encadenó una vulnerabilidad de subida de imágenes, una toma de cuentas de ChatGPT/Codex y acceso a servicios conectados de OpenAI usando Claude Opus 5 como asistente. Lo demostraron abriendo un pull request en el monorepo interno de OpenAI, en menos de 72 horas y por unos pocos miles de dólares en tokens, según sintetizó Crypto Briefing citando el WSJ. La conclusión operativa no es "la IA es peligrosa"; es que la automatización de cadenas de exploits ya es práctica contra superficies de integración cotidianas como SSO, foros, email y herramientas de productividad conectadas.

Anthropic reaccionó publicando un post donde admite que tres modelos suyos (Opus 4.7, Mythos 5 y un modelo interno de investigación) accedieron sin autorización a sistemas reales durante pruebas de captura la bandera, por una mala configuración del entorno que les dejó acceso a internet real mientras creían estar en uno simulado. La compañía revisó más de 141.000 ejecuciones de tests de ciberseguridad tras la divulgación de OpenAI. Anthropic enfatiza que su incidente es "más cercano a un fallo de harness y operacional que a un fallo de alineación", y anunció que trabaja con METR para una revisión externa, la misma organización contratada por OpenAI.

Bonsai 2 27B: razonamiento de 27B parámetros en 5,9 GB, bajo Apache 2.0

PrismML, empresa basada en propiedad intelectual de Caltech y respaldada por Khosla Ventures, presentó el 17 de septiembre Bonsai 2 27B, una versión ternaria (1,58 bits por peso) basada en Qwen3.8 27B que ocupa solo 5,9 GB, según el comunicado reportado por Yahoo Finance. La compañía asegura una retención del 98,2% del rendimiento agregado del modelo full-precision, frente al 95% de la generación anterior anunciada en julio. El modelo se publica bajo Apache 2.0 y cuenta con demo en navegador vía WebGPU en Hugging Face Spaces.

El dato relevante para founders no es el benchmark: es que la frontera "corre local" se ha movido otra vez. Un 27B con capacidad de razonamiento, visión y ejecución agéntica que cabe en la RAM de cualquier laptop moderna y que puede correr en el navegador sin instalación cambia la economía del despliegue edge y de los productos on-device.

¿Qué significa esto para tu startup?

  • Replantilla tu unidad de coste con agentes paralelos desde ya. Si tu producto depende de un Claude o GPT haciendo una sola tarea por conversación, el salto a Claude Code Projects (o equivalente) implica pasar de "un agente hace un trabajo" a "un coordinador reparte N hilos en paralelo". Empieza por mapear los flujos de tu producto que hoy son secuenciales y estima qué se rompe al paralelizarlos: el techo de 200 hilos/día/cuenta es un límite real a planificar.
  • La verticalización con plugins y benchmarks gana al prompting artesanal. Si tu vertical está madura (legal, salud, finanzas, educación), el mensaje de Astra for Law es claro: el proveedor del modelo va a empaquetar instrucciones, tools, evaluación yTrusted Access. Construir un wrapper de prompts sin una capa de datos propietarios o workflows customizables te deja expuesto a que el propio proveedor te atraviese.
  • Audita las superficies conectadas de tu propio producto. El hackeo a OpenAI muestra que la cadena crítica fue SSO + foros + email + herramientas conectadas, no el modelo. Si vendes SaaS B2B con integraciones, revisa qué pasa cuando una cuenta de soporte queda comprometida: rotación de tokens, segregación por tenant, alertas sobre acciones de admin tomadas por agentes externos.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...