De 28% a 80% en diez meses: la IA aprende a pillar tus errores de montaje
En noviembre de 2025, el mejor modelo del mundo solo acertaba el 28% de los errores de montaje cuando le mostraban una foto de un mueble de IKEA a medio construir. En septiembre de 2026, GPT-6 Astra llega al 80% en la misma prueba. La cifra, del nuevo Furniture Assembly Benchmark (FAB) de Epoch AI, es de las que hacen sentarse al fundador a tomar nota: en apenas diez meses, los modelos frontera han pasado de suspender a aprobar con notable en una tarea que combina visión, lectura de diagramas y razonamiento espacial.
La prueba es tan sencilla de explicar como difícil de aprobar. Epoch AI montó tres muebles reales —el zapatero STÄLL, la cama TONSTAD y la cómoda GULLABERG— y fotografió 60 estados intermedios del ensamblaje. En algunos introdujo fallos deliberados: una tabla del revés, un tornillo en el orificio equivocado, una guía que se salta un paso. El modelo recibe la foto, el manual oficial en PDF, una herramienta de zoom y un intérprete de Python, y debe decir qué paso se hizo mal y por qué. Dispone de un presupuesto de 80 acciones por imagen y un tiempo medio por foto que, en el caso de GPT-6 Astra, ronda los tres minutos (según Blogspan, que cita la documentación de Epoch AI).
Qué mide el FAB y por qué IKEA es solo una excusa
El benchmark no pretende coronar al mejor montador de muebles del mundo. Lo que Epoch AI quiere testar es una habilidad mucho más cara para el software del futuro: conectar instrucciones abstractas con objetos físicos reales. Esa capacidad —leer un esquema, mirar una pieza, detectar que no coincide— es exactamente la que necesitará una IA para asistirnos en tareas de mantenimiento, reparación de electrodomésticos o diagnosis de averías siguiendo documentación técnica.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadEl formato es exigente porque imita lo que pasa en el mundo real. Epoch AI siguió montando después de introducir el error, así que el fallo no siempre está en el último paso visible. Los ángulos de las fotos no son los del manual. Las piezas se ven desde perspectivas distintas. Y el evaluador no es humano: es otro modelo (GPT-5.6 Sol, según Blogspan) que puntúa si la respuesta identifica bien la etapa errónea y describe correctamente el problema. Esta elección elimina sesgos del juez humano, pero introduce una dependencia: si el juez cambia, el ranking puede moverse.
El ranking actual: OpenAI lidera, Anthropic aguanta, China va por detrás
El corte de septiembre de 2026, según Epoch AI recogido por Blogspan y Tom’s Guide France, deja este podio:
- GPT-6 Astra (OpenAI): 80% de aciertos, ~3 minutos por foto.
- Claude Fable 5.1 (Anthropic): 70%.
- Claude Opus 5 (Anthropic): 61%.
Los modelos chinos open-weight, como Kimi K3, quedan al menos siete meses por detrás del grupo líder según Epoch AI, una brecha que el propio equipo prevé se irá cerrando a medida que se actualicen las pruebas.
Los sesgos importan tanto como la nota
Tan interesante como el ranking es el patrón de errores que detectó Epoch AI:
- Gemini y Qwen tienden al falso negativo inverso: asumen que siempre hay un fallo y lo encuentran aunque el mueble esté bien montado.
- Modelos previos de OpenAI y Anthropic caían en el sesgo contrario: daban por bueno un montaje que tenía errores.
El benchmark penaliza los dos extremos. Como resume Xataka en el artículo original, «era tan importante buscar errores en el montaje como saber cuándo dejar de buscarlos». Para un founder que integra visión por computador en su producto, esta lección es directa: la métrica que importa no es solo el acierto, es el umbral de decisión que el modelo aplica antes de marcar una pieza como defectuosa.
¿Estamos más cerca de un robot que monte muebles?
No. El FAB mide si la IA puede observar y verificar un trabajo hecho por una persona, no si puede planificar y ejecutar el montaje desde cero manipulando piezas. Es la diferencia entre mirar una foto y girar un tornillo. Xataka lo señala con claridad en su pieza: reconocer que una tabla está invertida con el manual delante es muy distinto a que una máquina la coloque bien, resuelva imprevistos y termine el mueble.
Aquí reaparece la paradoja de Moravec, citada en el artículo original: lo que a nosotros nos parece trivial —girar una pieza, encajar un listón— es lo que más cuesta automatizar, mientras la IA ya supera a humanos en cálculo y código. Por eso, según un reportaje de MIT Technology Review de agosto de 2026, los modelos siguen suspendiendo pruebas clásicas de rotación mental y razonamiento espacial 3D pensadas para humanos, aunque rindan bien en benchmarks de razonamiento abstracto como ARC-AGI.
Qué significa esto para tu startup
Si tu producto depende de visión por computador —inspección de calidad, soporte técnico con cámara, mantenimiento remoto, e-commerce visual, verificación de obras—, el FAB te deja tres lecturas prácticas:
- Tu benchmark interno debería parecerse al FAB, no a un test de matemáticas. Mide al modelo en tu tarea concreta, con tus fotos, tus manuales y tus fallos reales. La mejora de 28% a 80% en diez meses no se traslada automáticamente a tu caso; se traslada el ** método** de evaluación.
- Cuida el sesgo del modelo, no solo su precisión. Una IA que siempre dice «hay un error» colapsa la confianza del operario. Una que nunca lo dice pierde su valor. Calibra el umbral y monitoriza falsos positivos y falsos negativos por separado.
- Separa «verificar» de «hacer». Un asistente visual que valida el trabajo humano es productivamente viable hoy. Un robot que monta sin supervisión sigue siendo otro problema, con otro stack y otro timeline.
Fuentes
- Tenemos un nuevo «benchmark» para la IA: preguntarle si has montado correctamente tus muebles de Ikea o no — Xataka
- Furniture Assembly Benchmark: KI erkennt IKEA-Montagefehler jetzt zu 80 Prozent — Blogspan
- ChatGPT, Claude, Gemini : lequel repère le mieux les erreurs de montage IKEA ? — Tom’s Guide France
- AI models flub these intelligence tests. Can you fare any better? — MIT Technology Review
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













