OpenArt Arena: leaderboards por tarea, no por modelo

Un benchmark pensado para responder «¿qué modelo uso?», no «¿cuál es el mejor?»

OpenArt, la plataforma de creación creativa con IA con sede en San Francisco, lanzó esta semana el OpenArt Arena, un nuevo benchmark público que desglosa el rendimiento de los modelos de imagen y video en rankings separados por trabajo creativo, en lugar de una sola puntuación general.

La diferencia importa para quien factura. Una agencia que necesita un packshot de empaque, un equipo interno que previsualiza un comercial y un estudio de postproducción que altera metraje existente pueden describirse como «usando IA de video» y, sin embargo, exigir cosas muy distintas al modelo subyacente. Un ranking que colapsa esos trabajos en un único puntaje de preferencia sirve para encontrar sistemas generalistas, pero deja al equipo con poca guía sobre qué modelo enrutar a qué tarea de producción.

El Arena divide los resultados en tableros para film, e-commerce, diseño gráfico, motion design, edición de video, lip sync y animación, entre otros. Para construirlo, OpenArt recurrió a más de 800 profesionales creativos y expertos externos que realizaron comparaciones ciegas por pares —el método Bradley–Terry, un modelo estadístico de 1952 para calcular probabilidad de victoria en enfrentamientos cabeza a cabeza— y no asignaron puntuaciones aisladas.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Qué dicen los primeros resultados del Arena

En video, ByteDance manda. El modelo Seedance 2.5, propietario y servido por API, lidera el tablero general de video con 1.081 puntos, seguido por Alibaba Wan 3.0 con 1.004 y Seedance 2.0 con 1.000. Seedance 2.5 también lidera cuatro de los cinco tableros especializados, incluyendo film (1.049) y motion design (1.059), según VentureBeat.

La excepción —y la que mejor sostiene el argumento del Arena— es edición de video: Wan 3.0 gana por la mínima, con 1.034 contra 1.033 de Seedance 2.5. La diferencia de un punto cae dentro de los intervalos de confianza del 95% que OpenArt exhibe, así que técnicamente es un empate. Seedance 2.5 vuelve al primer puesto en lip sync, con 1.063 puntos. Modelos de ByteDance como Seedance 2.0 Mini también aparecen en el top 3, pero ninguno se ofrece con pesos abiertos.

En imagen no hay un solo ganador. OpenAI GPT Image 2 lidera diseño gráfico e image editing con 1.000 puntos en ambos tableros. Pero para imágenes orientadas a film, Seedream 5.0 Pro de Alibaba toma el primer lugar con 1.014 puntos, y para e-commerce también lidera con 1.004, apenas por encima de GPT Image 2 (1.000) y del Nano Banana 2 de Google (993). En el tablero overall de imagen, Seedream 5.0 Pro gana con 1.010 puntos, 10 puntos sobre GPT Image 2. El ranking se publicó antes de que OpenAI actualizara a GPT-Images-2.5, según VentureBeat, por lo que los tableros deberán actualizarse pronto.

La cuota de modelos abiertos en los tops de video es exigua: Wan 3.0 es la única alternativa prominente que Alibaba presenta como open source. Su repositorio bajo licencia Apache 2.0 contiene documentación y licenciamiento, pero —según VentureBeat— todavía no los pesos descargables que se esperan de un release verdaderamente open-weight y auto-hosteable. Para equipos creativos de empresa, no es un detalle menor: condiciona el control de despliegue, la residencia de datos, las opciones de customización y el costo total de propiedad.

Por qué importa el método: comparaciones ciegas y un «consejo de expertos»

OpenArt agrega prompts curados para cada tablero y los presenta a los evaluadores sin la etiqueta del modelo. Los jueces eligen lado a lado en lugar de asignar puntajes aislados, y OpenArt agrega esas preferencias con el modelo Bradley–Terry, la misma técnica estadística nacida en 1952 que el tenis y los rankings tipo Elo suelen usar para convertir duelos en una jerarquía ordenada.

El pool de jueces tiene dos capas. El Creative Expert Council, más pequeño, incluye figuras nombradas como el director de animación ganador de un Emmy William Lau, el creativo tecnológico Willonius «King Willonius» Hatcher, el líder de marketing David Shing y ejecutivos y docentes de Edelman y UCLA. Guan dijo que también están reclutando entre 800 y 1.000 «tastemakers» entre usuarios de OpenArt y comunidades creativas externas.

Esos números deben leerse como el pool planificado, no como verificados. OpenArt no divulgó para este lanzamiento el número final de jueces que efectivamente votaron, el total de comparaciones por pares producidas ni la cantidad de prompts en cada benchmark. Esa omisión es relevante porque competidores como Contra Labs y Arena.ai sí publican esos números sin necesidad de exponer todo su banco de pruebas.

La lógica detrás de mantener parte de los prompts en privado es legítima: un test estático 100% público termina midiendo qué tan bien los desarrolladores optimizan contra el test mismo, no la capacidad de generalización. Pero retener material de prueba crea una carga de transparencia correlativa: el usuario debe confiar en que los prompts no divulgados representan adecuadamente la profesión.

El mercado del benchmark creativo ya tenía contendientes

OpenArt no inventó la categoría. La nota de VentureBeat mapea tres competidores directos con muy distintos modelos de evaluación:

  • Contra Labs — Human Creativity Benchmark (HCB), lanzado en abril de 2026, recluta creativos profesionales, evalúa con comparaciones por pares y puntajes escalares, agrega con Bradley-Terry/Elo y publica metodología detallada con datasets. Va más allá de ganador-versus-perdedor: captura prompt adherence, usabilidad y atractivo visual, y distingue entre «convergencia» (legibilidad, corrección técnica donde los profesionales coinciden) y «divergencia» (donde el desacuerdo refleja diferencias legítimas de gusto).
  • Arena.ai ya ofrece rankings de imagen por categoría. Su tablero de Product, Branding & Commercial Design del 7 de septiembre reporta más de 1,9 millones de votos sobre 78 modelos —una escala radicalmente distinta a la de un panel curado de expertos.
  • Artificial Analysis —que explícitamente se describe como independiente y declara no aceptar compensación de proveedores de modelos— segmenta por caso de uso (Marketing & Advertising, Retail & E-commerce, Live-Action Film, Animation & Gaming, Architecture & Real Estate, UI/UX Design, Social Media & Creator Content) y acompaña los rankings con precio, latencia y filtrado por open-weight.

Donde Arena marca diferencia es en dos frentes: breadth of creative-job-specific video boards (film, motion design, edición de video y lip sync con criterios adaptados a cada disciplina) y un Consejo de Expertos más curado en lugar del voto masivo. Pero también está casado comercialmente con los modelos que evalúa.

El elefante en la sala: la independencia del benchmark

OpenArt opera una plataforma comercial de IA que agrega más de 100 modelos, vende acceso a muchos de los sistemas que evalúa (Seedance, Veo, Kling, Wan, GPT Image, Nano Banana, Seedream, Grok Imagine) y corre productos como Director sobre ellos. El Arena se va a integrar en su propio selector de modelo: el benchmark puede influir en qué modelo subyacente termina eligiendo un cliente, sin salir del entorno de OpenArt.

Según Guan, eso fue intencional. «Si un cliente obtiene malos resultados con el modelo equivocado, puede culpar a la plataforma», reconoció, y añadió que el Arena será público y «algo independiente» del resto de OpenArt —aunque sin partnerships externos en el lanzamiento.

Esto no significa que los resultados estén sesgados, pero sí significa que las empresas deberían aplicarle a este benchmark el mismo escrutinio que a cualquier benchmark generado por un proveedor. La gobernanza importa: OpenArt divulgó enfoque estadístico, estrategia de reclutamiento, los miembros nombrados del Consejo de Expertos y un plan para publicar parte de los prompts; lo que no divulgó — número de jueces que efectivamente participaron, comparaciones por pares producidas y prompts por tablero — es justo lo que permitiría comparar su escala con la de los estudios de Contra Labs o los millones de votos de Arena.ai.

El contexto de Seedance 2.5 que OpenArt no menciona

El liderazgo del Arena coincide con la adopción de mercado que documentan los lanzamientos recientes. Dreamina, la plataforma de ByteDance para creadores, lanzó Seedance 2.5 el 31 de julio de 2026 con un workflow que promete hasta 30 segundos de video continuo y soporte para hasta 50 referencias multimodales en una sola generación. Pippit siguió el 10 de agosto con una versión que añade resolución 4K y control de cámara con precisión de un segundo. Ambas buscan resolver tres problemas persistentes de la generación de video: clips demasiado cortos que exigen pegado manual, personajes o productos que cambian entre escenas y errores que obligan a regenerar todo el clip.

Pero Seedance 2.5 también llegó envuelto en polémica. Tras la tormenta desatada por Seedance 2.0 —clips virales no autorizados con Brad Pitt y Tom Cruise peleando, seguidos de cartas de cease-and-desist de Disney y Netflix—, el modelo 2.5 incorpora bloqueos más estrictos. La firma VN.ai, que somete modelos generativos a pruebas de estrés por copyright, concluyó que Seedance 2.5 bloquea alrededor del 80% de los prompts con material protegido y que el 100% de los intentos de generar video a partir de imágenes con copyright fueron infructuosos, según Deadline. No es perfecto: VN.ai logró producir un video fiel de Oscar, el personaje de Shark Tale, sin usar el nombre ni el título de DreamWorks.

Qué significa esto para tu startup

Si vendes producto o contenido en cualquier canal que requiera imagen o video sintético, deja de elegir un modelo ganador y empieza a enrutar por tarea.

Acciones concretas para tu equipo creativo:

  • Mapea primero tu pipeline de jobs, no de modelos. Haz una lista de las 3 a 5 tareas de producción que más repites (packshots de e-commerce, reels verticales, motion graphics para landing, lip sync para UGC, edición de planos existentes) y consulta el tablero del Arena que más se acerque a cada una. La diferencia entre GPT Image 2 y Seedream 5.0 Pro en e-commerce te costará horas de re-trabajo si tu brief pide tipografía limpia sobre packaging realista.
  • Complementa, no sustituyas, con un test interno. OpenArt mismo advierte: ninguna leaderboard reemplaza probar con tus propias marcas, tipografías y restricciones legales. Crea una suite de 5 a 10 prompts de referencia por tarea y revalida cada tres meses.
  • Calcula el costo de no-estandarizar. Un equipo que rutea entre Seedance 2.5 para lip sync y Wan 3.0 para edición de video sumará complejidad de proveedores y facturación. Haz el ejercicio: si la calidad marginal no compensa el costo operativo, estandariza. Si sí compensa, documenta el criterio de routing en una nota de una página para el equipo.
  • Verifica la cadena de derechos. Si tu pipeline toca cine, marcas o personajes reconocibles, el bloqueo del 80% de Seedance 2.5 sobre prompts con copyright es noticia, no garantía. Mantén un review humano de las salidas y considera un seguro de PI.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...