IA: las 8 capas del ML ya son simuladas, no humanas

El modelo mental: por qué la simulación le está ganando a la IA humana

Desde 2022, una nueva pieza del pipeline que produce inteligencia artificial deja de ser humana cada año. El reemplazo no es gradual ni parejo: cada salto tiene un paciente cero, un paper o producto donde la versión sintética se vuelve crítica en un laboratorio frontera. El último newsletter de Latent Space (publicado el 22 de agosto de 2026) lo resume con una fórmula que ya es cita obligada: 10% peor, 100x más barata y 10.000x más rápida. Tres dimensiones que, además, mejoran al mismo tiempo.

La consecuencia operativa es enorme. Lo que llamábamos "datos sintéticos", "rúbricas sintéticas", "investigador IA" o "entornos RL end-to-end" es, visto en conjunto, simulación humana cada vez más ambiciosa. Para un founder hispanohablante esto importa menos como idea filosófica y más como hoja de ruta: cada capa que se vuelve simulable abarata un producto, acelera un ciclo o elimina una dependencia de talento.

Etapas 1 a 4: las entradas del entrenamiento dejaron de ser humanas (2022-2024)

El recorrido lo traza Latent Space en ocho etapas. Las primeras cuatro cubren lo que entra al modelo.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • 2022 — La señal de reward: InstructGPT (OpenAI) instaló el truco canónico: recolectar preferencias humanas una vez, entrenar un reward model y dejar que la política optimice contra el modelo, no contra las personas. Constitutional AI llevó esto a RLAIF (AI critiquing AI), y Lee et al. mostraron luego que el feedback de IA iguala al humano a una fracción del costo. Cuando LLM-as-judge se volvió el default (MT-Bench, AlpacaEval), el aparato entero de aprobación corre sobre modelos juzgando modelos.
  • 2023 — Los datos de entrenamiento: el paper Phi se titula literalmente Textbooks Are All You Need. Un modelo chico entrenado con datos estilo textbook generados por LLM rindió muy por encima de su cuenta de parámetros; phi-1.5 confirmó que no fue casualidad. Apple WRAP generalizó la idea: reformular la web entera con un LLM vuelve el preentrenamiento cerca de 3x más eficiente. NVIDIA Nemotron-4 340B ya salió con un pipeline de datos sintéticos open source como feature principal; hacia 2025, los razonamiento-trace corpora (cadenas de pensamiento generadas por razonadores fuertes) eran insumo estándar de pre y mid-training.
  • 2023 — El teacher: semanas después de que abriera la API de ChatGPT, Alpaca (Stanford) mostró que un fine-tune de US$600 sobre instrucciones generadas por GPT clonaba gran parte del comportamiento frontier. Vicuna lo hizo con conversaciones compartidas; Orca, con explicaciones ricas del teacher en lugar de respuestas crudas. El pico cultural llegó con DeepSeek-R1 y su familia destilada: "el teacher es un modelo" se volvió el default de cada lanzamiento chico.
  • 2024 — El currículo: cuando el modelo empieza a decidir qué aprender, el loop se cierra. Self-Rewarding Language Models (Meta) y SPIN mostraron que un modelo puede generar sus propias tareas, juzgar sus propios outputs y superar el techo de sus datos de preferencia humanos. El diseño del currículo —históricamente la parte más artesanal del ML— pasó a ser algo que los modelos hacen sobre sí mismos.

Etapa 5: el investigador ya es un agente (2026)

La era de asistencia (Copilot, luego SWE-agents) mantenía a un humano eligiendo los experimentos. La era de descubrimiento ya no. DeepMind AlphaEvolve evolucionó algoritmos genuinamente nuevos en 2025, y Sakana AI Scientist —publicado en Nature según Latent Space— dibujó el pipeline completo de escribir papers. El momento bisagra llegó en marzo de 2026, cuando Andrej Karpathy liberó autoresearch.

Según reporta TechTimes, el repositorio es deliberadamente mínimo: un prepare.py fijo que el agente no puede editar, un train.py de unas 630 líneas como único archivo modificable, y un program.md que describe la agenda. Cada corrida dura 5 minutos en una sola GPU Nvidia, se mide por validation bits-per-byte (más bajo = mejor) y produce cerca de 12 experimentos por hora, unos 100 por noche. El propio Karpathy acumuló unas 20 mejoras stacked en una corrida de dos noches sobre código que él mismo ya había tuneado a mano —incluido un bug en su implementación de atención— para un 11% de speedup de entrenamiento.

La idea se propagó rápido: 80.000 estrellas en GitHub a inicios de abril de 2026, según el mismo artículo. El Vector Institute corrió 910 experimentos en 16 GPUs en ocho horas, encontrando la misma validation loss que una corrida secuencial单-GPU habría requerido 72 horas —una ventaja de 9x en wall-clock. Shopify, en cambio, muestra el lado bueno y el lado feo al mismo tiempo: el PR #2056 abrió por Tobi Lütke bajó el tiempo de parse+render en ThemeRunner de 7.469 a 3.534 microsegundos (-53%) y las asignaciones de objeto de 62.620 a 24.530, pero el PR sigue sin mergear y su propio autor lo tildó de "probablemente overfit". Además, TechTimes aclara que la herramienta usada fue Pi (un toolkit TypeScript open source), no Claude Code.

La moraleja práctica: autoresearch entrega exactamente lo que promete —un cambio óptimo contra una métrica— y es tan útil o peligroso como la cercanía entre la métrica y la realidad de producción.

Etapa 7: el sujeto humano es ahora simulable — Simile levanta US$200M

Si los modelos pueden ser juez, teacher y entorno, el rol humano que queda en el loop es el de sujeto: la fuente de preferencias, comportamiento y demanda. Esa es la capa que Simile está reemplazando. La startup de Palo Alto, fundada por Joon Sung Park (32 años, ex Stanford) y con Percy Liang —el investigador que ayudó a acuñar el término "foundation model"— como cofundador, levantó US$200M a una valoración de US$2.000M según reportó The New York Times y recogió The Next Web. Es un crecimiento agresivo: seis meses antes había cerrado US$100M. Lideró la ronda Greenoaks, con Index Ventures y otros inversores previos retornando.

El método: entrevistas de dos horas con 1.000 participantes representativos, más una alianza con Gallup que añade input de algunos millones más. Simile afirma que sus "gemelos agentic" reproducen las respuestas de las personas fuente entre un 85% y 99% dependiendo del grupo, y que ya tiene entre sus clientes a CVS Health, Deloitte y Wealthfront. CVS usó 400.000 gemelos agentic en otoño pasado para diseñar cómo lograr que los pacientes tomaran su medicación.

El precio escala con el panel: cuanto más grande la muestra sintética, más caro. La ambición declarada, según Pulse 2.0, es modelar a los 8.000 millones de personas del planeta. La competencia ya está moviéndose: Helm, Artificial Societies y Aaru persiguen la misma tesis, parte de la caza más amplia por valor medible de la IA.

Etapa 8: el mundo físico sigue siendo el cuello de botella

La última fila del grid nunca se vuelve roja del todo, y ese es el punto. Poolside lo dibujó con precisión en su carta reverse-execuhire: los problemas del mundo se dividen entre intelligence-bound (resoluble escalando cognición, pronto commodity vía open weights) y experiment-bound, donde "100.000 mentes brillantes no van a curar el cáncer sin un laboratorio húmedo". Su tesis: el valor durable de IA va a quien controle el loop experimental —IA como "el motor de descubrimiento científico más valioso del mundo".

Del lado biotech, CZ Biohub está digitalizando el Human Cell Atlas en una célula virtual —el in silico es cerca de 1.000x más barato y rápido que el in vivo, según Latent Space— y extendiendo hacia un sistema inmune virtual, con Chai, Xaira y Lila rellenando el stack de AI-for-science con laboratorios del tamaño de data centers.

El patrón debajo del patrón: la verificación es la que mueve la frontera

Releyendo el grid aparece una segunda capa: cada flip fue precedido por la misma objeción —model collapse, alucinaciones apiladas, garbage in garbage out— y cada flip ocurrió igual, en el exacto instante en que un mecanismo de verificación hizo confiable la versión sintética. Filtrado agresivo para los textbooks de Phi, estudios de acuerdo juez-vs-juez para las evals LLM-as-judge, RLVR con unit tests y proof checkers, RL sandboxes con oracle/no-op checks para los verificadores de z.ai, RCTs registrados para los gemelos de Simile, el wet-lab loop para la célula virtual. La frontera sintética no avanza cuando mejora la generación; avanza cuando mejora la verificación.

El triángulo gris que queda abajo a la izquierda —experimento físico, ground truth encarnado— es exactamente la región donde la verificación es más lenta y cara. Los modelos aprendieron a escribir, después a juzgar, después a practicar, después a experimentar. La pregunta abierta de la década es cuánta realidad necesitan tocar — y cuánta pueden simularse sin tocarla.

¿Qué significa esto para tu startup?

Trespalancas concretas que un founder puede mover este trimestre, cada una respaldada por las mismas dinámicas que describe Latent Space:

  • Audita qué parte de tu producto todavía depende de humanos que pueden ser simulados. Si haces user research, A/B testing o paneles de validación, vale la pena mapear esos flujos contra lo que ya ofrecen Simile y competidoras como Helm, Artificial Societies y Aaru. The Next Web reportó que Simile cobra escalando con el tamaño del panel: para调研 rápidos de UX puede salir más caro que un estudio tradicional; para测试 masivos de messaging o producto, el cálculo cambia.
  • Adopta un loop de autoresearch interno con métrica honesta. El patrón de Karpathy funciona donde haya una métrica escalar congelable y no-gameable. Empieza por algo con ground truth físico (latencia con tests pasando, por ejemplo) y no por un benchmark que el propio agente pueda inflar. Si lo intentas en un repo grande, asume que un porcentaje de los cambios will look like the Shopify Liquid PR: mejoras locales grandes, con el autor marcándolas como overfit antes de mergear.
  • Construye sobre verificación, no solo sobre generación. La tesis central del newsletter es que la frontera sintética avanza cuando la verificación se vuelve confiable. Si tu producto es AI-first, invierte同等 esfuerzo en RLVR-style checks, RL sandboxes, oracle/no-op tests y RCTs registrados para tu propia lógica. Cada check que puedas correr automáticamente es un punto de apalancamiento cuando el siguiente componente del pipeline se vuelva sintético.

Conclusión

La historia que cuenta Latent Space el 22 de agosto de 2026 no es futurista: es descriptiva. Ocho capas del pipeline de ML ya son sintéticas; la novena —el experimento físico— sigue resistiendo, y su resistencia es justamente donde se acumula el valor. Para founders hispanohablantes, el mensaje operativo es claro: cada año, una nueva dependencia humana en tu stack de IA se vuelve commodity. Quien identifique esa dependencia antes y construya el verificador que la haga confiable va a capturar la mayor parte del margen. Quien la descubra tarde, va a competir contra un costo que cae 100x y una velocidad que sube 10.000x.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...