¿Cómo funciona el physical prompting en robots?
Un modelo robótico llamado GEN-1.5, desarrollado por la startup Generalist AI, puede aprender una nueva tarea física tras observar apenas entre 3 y 12 segundos de demostración, sin necesidad de reentrenamiento ni ajuste fino (fine-tuning). En pruebas con diez tareas simples, alcanzó una tasa de éxito promedio del 59% solo con esa única demostración. Con cinco minutos adicionales de datos —equivalente a unas 50 repeticiones— y diez actualizaciones mínimas del modelo, la tasa subió al 83%.
La idea detrás de este enfoque es directa: en lugar de programar o entrenar un robot para cada tarea nueva, se le muestra lo que hay que hacer y el modelo infiere cómo replicarlo. El sistema procesa video junto con datos sensoriales, lenguaje y propriocepción, manteniendo una ventana de contexto de 30 segundos. Desde ahí, genera trayectorias de acción a 100 Hz.
Esto se llama physical prompting, y es análogo a lo que hacen los LLMs cuando reciben ejemplos dentro del prompt. La diferencia es que aquí el ejemplo no son palabras, sino un vídeo de movimientos físicos reales. El modelo observa el estado inicial, cómo se manipula un objeto y usa eso como contexto para deducir qué debe hacer.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad¿Por qué es relevante esta tecnología ahora?
El mercado de IA generativa aplicada a robótica está creciendo exponencialmente. Según ResearchAndMarkets, el sector alcanzó los USD 3.200 millones en 2026, con un crecimiento anual compuesto del 39,2%, y se proyecta que llegue a USD 11.900 millones para 2030. Esta expansión refleja la integración creciente de IA en control robótico, simulación y automatización industrial.
La demanda de robots también se está diversificando. Los datos de la Asociación para la Automatización Avanzada (A3) muestran que en el segundo trimestre de 2026, los clientes no automotrices representaron el 56% de las unidades pedidas en Norteamérica, incluyendo semiconductores (+35% en unidades), farmacéutica (+32%), alimentos y bienes de consumo (+17%).
Generalist AI afirma haber preentrenado sus modelos con más de medio millón de horas de interacción física acumulada durante ocho meses continuos de entrenamiento. Su hipótesis es que, una vez que el preentrenamiento supera cierto umbral, el costo de adaptar el modelo a una nueva tarea se vuelve tan bajo que mostrarle la tarea una vez sustituye al paso de programación tradicional.
Limitaciones actuales del modelo
Los resultados prometedores tienen matices importantes. Las funciones adquiridas únicamente mediante contexto siguen siendo más frágiles que las obtenidas mediante entrenamiento supervisado. La tasa de error del 41% en aprendizaje one-shot indica que el modelo aún tiene dificultades con tareas complejas o entornos variables.
Además, las pruebas se realizaron con diez tareas deliberadamente simples y cortas: abrir un bote de cristal, retirar dinero de una cartera, apilar vasos, barrer basura, abrir un libro, desabrochar un estuche y retirar una ventosa. No se evaluó rendimiento en escenarios industriales reales con condiciones impredecibles.
El equipo de Generalist AI reconoce estas limitaciones abiertamente. Las habilidades aprendidas por contexto permiten cierta recuperación ante errores durante la ejecución y pueden generalizar a variaciones inesperadas, pero requieren ajustes adicionales para aplicaciones críticas.
Qué significa esto para tu startup
Si tu empresa opera en logística, manufactura ligera, atención médica o cualquier sector donde la automatización robótica sea relevante, el physical prompting representa un cambio de paradigma en cómo se despliegan soluciones de IA física.
Acción 1: Evalúa si tu operación tiene tareas repetitivas que podrían beneficiarse de demostración rápida. Si tienes procesos donde los robots actuales necesitan semanas de programación para adaptarse a nuevos productos o líneas de producción, el physical prompting podría reducir ese tiempo a minutos. Prioriza tareas cortas y bien definidas para empezar.
Acción 2: Construye un pipeline de datos de demostraciones físicas. Aunque el modelo pueda aprender de una sola demostración, la precisión mejora significativamente con pocas actualizaciones. Documenta sistemáticamente cómo tus operarios realizan tareas clave en video —eso será tu ventaja competitiva cuando implementes estos sistemas.
Acción 3: Monitorea el ecosistema de foundation models para robótica. Empresas como Google (RT-2), DeepMind y Generalist están compitiendo por crear modelos generales de manipulación física. Cada avance reduce la barrera de entrada para implementar automatización inteligente. Mantén contacto con proveedores que adopten estas tecnologías.
El futuro de la automatización no pasa por escribir código para cada movimiento, sino por enseñar al robot lo que necesita hacer y dejar que él resuelva los detalles físicos. Para founders en industrias con alta rotación de tareas o personal limitado, esa capacidad podría ser la diferencia entre automatizar o seguir dependiendo de mano de obra especializada.
Fuentes
- Hasta ahora había que entrenar a un robot para cada tarea nueva. La nueva idea es mucho más simple: que te mire unos segundos
- Generalist AI's GEN-1.5 robot model learns tasks from one demo
- Generative AI in Robotics Market Report 2026
- Q2 2026 robotics demand increased across industries, reports A3
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad














