El cuello de botella que Pegasus 1.6 quiere resolver
Cuando un operario toma un componente, lo posiciona y lo atornilla, deja en la grabación pistas que un modelo necesita para replicar la tarea: qué mano sostiene la pieza, cuándo cambia de agarre, cómo se recupera cuando algo se desliza. TwelveLabs publicó el 6 de octubre de 2026 la versión 1.6 de Pegasus, su modelo de vídeo-a-texto, con un enfoque explícito en ese tipo de material: vídeo en primera persona, también llamado egocéntrico, capturado desde la cámara que lleva la persona —o el propio robot— que ejecuta la acción.
El problema que la startup surcoreana-estadounidense busca atacar es, en palabras del cofundador y CEO Jae Lee, la razón por la que la robótica generalista sigue atascada: «estos modelos ahora mismo están hambrientos de datos». Pegasus 1.6 convierte grabaciones de trabajo físico en descripciones estructuradas, con marcas de tiempo y campos configurables por el cliente, para alimentar pipelines de entrenamiento. Lo que la compañía no hace —y deja claro en su comunicación— es enseñar al robot a moverse: presión, control fino y ejecución motora siguen siendo problemas separados.
Qué cambia respecto a Pegasus 1.5
La línea Pegasus, según VentureBeat, está diseñada para razonamiento temporal nativo: causa y efecto a lo largo del vídeo, no respuestas sobre frames aislados. Pegasus 1.5 ya segmentaba vídeo en intervalos y devolvía descripciones estructuradas; la versión 1.6 añade, según el comunicado oficial distribuido por Globe Newswire:
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 días- Entrenamiento específico para vídeo egocéntrico (las versiones previas, dice la compañía, lo manejaban mal).
- Reconocimiento de entidades mejorado: manos, objetos y herramientas se siguen de forma más consistente entre clips.
- Análisis nativo de imagen dentro de la misma API, pensado para mezclar fotos y vídeo en un mismo flujo.
- Procesamiento «más rápido y eficiente en coste» para cargas de alto volumen, aunque la compañía no publicó métricas reproducibles.
TwelveLabs plantea cinco flujos de trabajo sobre el mismo modelo: dividir grabaciones en acciones etiquetadas, generar descripciones detalladas, hacer control de calidad del footage (vistas obstruidas, cámaras inestables, acciones poco claras), detectar eventos inusuales o duplicados, y filtrar material sensible antes de enviarlo aguas abajo. En la práctica, el cliente define los campos que necesita y el modelo organiza el vídeo alrededor de ese esquema.
Lee describió un throughput anecdótico: un lote de aproximadamente 17 años de metraje en primera persona procesado en unas 18 horas sin un vídeo fallido. No hay benchmark reproducible ni comparación pública con competidores.
Cuánto cuesta (y por qué subió)
La nueva tarifa de Pegasus 1.6 publicada por TwelveLabs el 6 de octubre de 2026:
- Vídeo de entrada: US$1,75 por hora (sin cambios).
- Imagen de entrada: US$3 por millón de tokens (nuevo).
- Salida de texto: US$15 por millón de tokens, el doble que en Pegasus 1.5 (US$7,50).
- Enterprise: precio a medida; existen acuerdos de licencia plurianual con clientes grandes, según Lee.
A input de lista, procesar 1.000 horas costaría US$1.750 antes de salida. Como cada definición de segmento se factura por separado en una solicitud Segment, el coste total escala con el número de categorías de anotación. La subida del output no duplica la factura completa —los tokens de salida son una fracción del trabajo—, pero sí cambia la economía para proyectos con anotaciones densas.
El ecosistema que compite por los datos de entrenamiento de robots
Pegasus 1.6 no llega sola. La categoría de «preparación de datos de vídeo para robótica» tiene al menos cuatro contendientes con modelos de negocio distintos, según el comparativo que publicó VentureBeat:
- Nvidia Cosmos Curator: software open source para construir pipelines de filtrado, anotación y deduplicación. No tiene licencia de Curator, pero asume coste de GPU, almacenamiento e ingeniería.
- Encord con Nvidia Cosmos Reason 2 y Embed: plataforma alojada que combina modelos con revisión humana, sin tarifas públicas —hay que pedir cotización.
- Google Gemini Robotics ER 2: API de razonamiento y planificación sobre vídeo, con ejecución motora delegada a modelos de acción downstream. Tarifa estándar de US$1 por millón de tokens de entrada y US$5 por millón de salida hasta el 31 de diciembre de 2026, pasando a US$2 / US$10 desde el 1 de enero de 2027.
- BFL y mimic con FLUX-mimic: sistema orientado a generar acciones para manipulación robótica, con despliegues reportados en Audi. Sin precio público.
Y en el lado de los foundation models que consumen ese tipo de datos, Dyna Robotics anunció el 10 de agosto de 2026 su modelo DYNA-2, entrenado íntegramente con más de 1 millón de horas de vídeo humano en primera persona —equivalente a 170 años de experiencia continua—. Dyna, fundada por Lindon Gao y York Yang (los mismos que vendieron Caper AI por US$350 millones) y por el ex-científico de DeepMind Jason Ma, cuenta con el respaldo de CRV y First Round. En pruebas reales, DYNA-2 mejoró la tasa de éxito de tareas del 20% al 80–90% simplemente escalando el preentrenamiento, sin modificar los datos de post-entrenamiento.
Otra señal del lado de la demanda: según reportó TechCrunch el 17 de junio de 2026, XDOF salió del modo stealth con US$70 millones de Thrive Capital, Spark Capital, a16z, Lux y WndrCo para construir, precisamente, la infraestructura de datos de entrenamiento robótico que hoy escasea —incluyendo teleoperación, anotación y sensores egocéntricos propios—. XDOF trabaja con unos 20 clientes, varios de ellos «frontier AI labs» que la compañía no puede nombrar. En ese mismo artículo TechCrunch recordó que OpenAI relanzó, dos semanas antes, el programa de robótica que había cerrado en 2021.
Qué significa esto para tu startup
Si estás construyendo sobre vídeo o tienes un proyecto de robotics/automation entre manos, Pegasus 1.6 abre tres decisiones concretas:
- Evalúa el coste total por ejemplo útil, no por hora procesada. Un founder que esté explorando un workflow de ensamblaje, empaque o inspección debería correr un piloto acotado —un solo proceso bien delimitado— y medir el coste por ejemplo aceptado tras corrección humana, no el coste bruto del API. La subida del output a US$15/M tokens castiga justo los proyectos con anotaciones densas.
- Diseña la captura de datos desde el inicio. Si vas a generar tu propio material egocéntrico, la calidad de la cámara y del montaje afecta la calidad del hand-tracking posterior —un punto que el CEO de XDOF, Philipp Wu, destacó en TechCrunch—. Mejor invertir en el hardware de captura hoy que pagar rondas de re-anotación mañana.
- Combina Pegasus con modelos de acción, no los sustituyas. TwelveLabs entrega descripciones y segmentación, no control motor. Para tareas físicas reales necesitas el componente de acción: ya sea DYNA-2 de Dyna Robotics como foundation model, o un sistema de ejecución como FLUX-mimic o un VLA propio. La pila completa, hoy, se construye por piezas.
La pregunta comercial de fondo —y la que los inversores de TwelveLabs (Amazon, Index Ventures, Naver, NEA y Radical Ventures) querrán ver respondida— es si la preparación de vídeo como servicio se vuelve infraestructura estándar para robotics, del mismo modo que la limpieza de datos lo es para LLMs. La entrada de XDOF, Dyna y el relanzamiento del programa de robótica de OpenAI sugieren que la demanda está, como mínimo, formándose.
Fuentes
- TwelveLabs debuts Pegasus 1.6 to improve robotics training data from first-person video (VentureBeat)
- TwelveLabs Brings Video Understanding to Physical AI With Latest Launch (Business Insider / Globe Newswire)
- Collecting robot training data is dirty, unglamorous work. Some AI labs are already paying XDOF to do it (TechCrunch)
- Dyna Robotics unveils DYNA-2 World-Action Model, demonstrating first true scaling law in robotics powered entirely by human data (AOL / PR Newswire)
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 días













