OpenWALDO: 167.300M tokens abiertos para entrenar IA en 2026

OpenWALDO: 167.300 millones de tokens abiertos para entrenar IA

Gregory Kurtzer, fundador de CentOS y Rocky Linux, ha lanzado OpenWALDO, un proyecto de código abierto que busca revolucionar cómo se entrenan los modelos de IA. Con 167.300 millones de tokens de datos de entrenamiento transparentes, esta iniciativa financiada por CIQ pretende crear la primera base de datos colaborativa donde cualquier persona puede contribuir, similar a un proyecto de software open source.

El problema que aborda OpenWALDO es fundamental: incluso los modelos de «pesos abiertos» (open-weight) mantienen en secreto sus datos de entrenamiento, que suelen provenir de contenido con derechos de autor, respuestas destiladas de otros modelos o contenido generado por usuarios sin consentimiento explícito. CIQ, la empresa de infraestructura de IA detrás del proyecto, argumenta que «a menudo no hay forma de saber qué datos entrenaron un modelo determinado, bajo qué licencia o con qué consentimiento».

¿Por qué OpenWALDO importa para el ecosistema de IA?

El proyecto representa un cambio de paradigma en un momento crítico para la industria. Según The Register, con precios elevados y ROI aún mayormente ausente en proyectos de IA, los modelos abiertos han ganado prominencia en el zeitgeist de IA. Modelos de China, hogar de la IA de pesos abiertos, están cerrando la brecha de capacidades con modelos de laboratorio fronterizo como ChatGPT y Claude.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Kurtzer compara la situación actual con los primeros días del software open source: «Linux no ganó por ser certificado seguro. Ganó por ser inspeccionable, bifurcable y validado por la comunidad. La IA carece de esa misma propiedad, y OpenWALDO es cómo la construimos».

Los números detrás del proyecto

Según el índice público de OpenWALDO del 11 de agosto de 2026, el dataset contiene:

  • 167.300 millones de tokens de referencia
  • 93,9 millones de documentos
  • 46 corpus diferentes
  • 799 fragmentos (shards)
  • 51 identificadores de licencia

Los datos provienen de registros gubernamentales, artículos académicos de código abierto, listas de correo y literatura de dominio público. Sin embargo, es apenas una gota en el océano comparado con los billones de tokens utilizados para entrenar modelos de IA fronterizos y sus contrapartes de pesos abiertos.

El concepto de «Factura de Materiales de IA» (AI BOM)

OpenWALDO introduce un concepto innovador: la Factura de Materiales de IA (AI Bill of Materials). Este registro vincula datos de entrenamiento, licencias y artefactos, proporcionando un marco para revisar el linaje de los datos de entrenamiento. Según Let’s Data Science, el enfoque coloca la gobernanza de datos de entrenamiento junto a prácticas de código fuente como revisión, control de versiones y contribuciones atribuibles.

«Un laboratorio o empresa puede tomar el corpus y su factura de materiales como línea base verificada, agregar sus propios datos patentados, construir y enviar, con una línea clara y auditable de regreso a sus fuentes», explica CIQ.

¿Qué significa esto para tu startup de IA?

1. Reducción de costos y duplicación de trabajo

Cuando todos entrenan sus modelos de IA en secreto, ocurre mucho trabajo duplicado que desperdicia tiempo y recursos computacionales. Un conjunto único y compartido de datos de entrenamiento público no solo haría que el entrenamiento fuera más eficiente en toda la industria, sino que también significaría que cada mejora al dataset podría beneficiar a futuros modelos entrenados en él.

2. Mayor transparencia y control de riesgos legales

Para startups que desarrollan productos con IA, la transparencia en los datos de entrenamiento es crucial para:

  • Evitar infracciones de derechos de autor: Saber exactamente qué datos se utilizaron y bajo qué licencia
  • Cumplimiento regulatorio: Documentación clara para auditorías y regulaciones emergentes de IA
  • Gestión de riesgos: Identificar contenido problemático antes de que contamine modelos completos

3. Acceso a datos verificados sin inversión masiva

OpenWALDO ofrece a startups y laboratorios más pequeños acceso a datos de entrenamiento verificados que de otro modo requerirían inversiones multimillonarias para recopilar y limpiar. Según Open Source For You, el proyecto está abierto a individuos, aficionados, investigadores, organizaciones y corporaciones para contribuir a construir una base común para el desarrollo de IA.

Acciones concretas que puedes tomar hoy

1. Evaluar tu dependencia de datos opacos

Revisa tus pipelines actuales de entrenamiento de IA:

  • ¿Qué porcentaje de tus datos de entrenamiento tiene procedencia verificable?
  • ¿Tienes documentación clara sobre licencias y consentimientos?
  • ¿Cómo te protegerías ante una auditoría regulatoria?

2. Explorar contribuciones a OpenWALDO

Si tu startup trabaja con datos de dominio público o tiene experiencia en limpieza y categorización de datos, considera contribuir al proyecto. La gobernanza comunitaria significa que los contribuyentes activos pueden influir en la dirección del dataset.

3. Implementar prácticas de trazabilidad

Incluso si no usas OpenWALDO inmediatamente, adopta su filosofía de trazabilidad:

  • Documenta el origen de cada conjunto de datos
  • Mantén registros de licencias y consentimientos
  • Establece procesos para revisar y corregir datos problemáticos

El desafío de escalar la transparencia

Aunque OpenWALDO representa un avance significativo, enfrenta desafíos considerables. Let’s Data Science señala que esfuerzos comparables de datos abiertos a menudo enfrentan difíciles compensaciones entre escala del corpus, certeza de licencias, deduplicación, revisión de privacidad y la carga operativa de procesar correcciones.

Además, los 167.300 millones de tokens actuales son solo el 0,1-1% del tamaño de los datasets utilizados por modelos fronterizos como GPT-5 o Claude 4, que entrenan con billones de tokens.

Conclusión

OpenWALDO representa un experimento audaz para llevar los principios del código abierto al corazón del desarrollo de IA: los datos de entrenamiento. Para founders hispanohablantes, este proyecto ofrece tanto una oportunidad como una advertencia.

La oportunidad: acceso a datos transparentes, reducción de costos de entrenamiento y una comunidad colaborativa que puede acelerar el desarrollo de modelos especializados para mercados latinoamericanos y españoles.

La advertencia: la transparencia se está convirtiendo rápidamente en un requisito, no una opción. Reguladores, clientes empresariales y usuarios finales exigen cada vez más saber qué hay dentro de las «cajas negras» de IA.

Como dijo Kurtzer: «He pasado mi carrera viendo cómo el código abierto convierte a los usuarios en constructores, a los competidores en colaboradores, y los problemas compartidos en infraestructura común que opera a gran escala. OpenWALDO lleva ese modelo probado a la IA».

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...