# Epoch AI reporta un avance del 28% al 80% en una prueba de montaje

- Publicada: 2026-09-28T13:16:26.000Z
- Actualizada: 2026-09-28T14:25:47.100Z
- Sección: Modelos
- Temas: Investigación
- Página: https://aidailyjournal.com/es/n/2026/09/28/epoch-ai-reports-rise-from-28-to-80-in-furniture-assembly-test/
- Fuentes: [Xataka](https://xataka.com/robotica-e-ia/tenemos-nuevo-benchmark-para-ia-preguntarle-has-montado-correctamente-tus-muebles-ikea-no)

## Resumen

Epoch AI afirma que el desempeño en el Furniture Assembly Benchmark (FAB) pasó del 28%, logrado por Claude 4,5 en noviembre de 2025, al 80%, alcanzado por GPT-6 Astra en septiembre de 2026. Los modelos reciben una foto de un mueble de IKEA parcialmente montado, el manual de instrucciones, una herramienta para ampliar la imagen y un intérprete de Python; deben relacionar los diagramas con piezas reales, reconstruir los pasos del montaje y localizar errores, como una pieza invertida. Según Epoch AI, GPT-6 Astra tardó un promedio de tres minutos por foto, entre dos y diez veces menos que modelos que antes estaban entre los mejores. El benchmark mide razonamiento visual y espacial, no si los robots pueden montar muebles físicamente. Epoch también detectó sesgos: Gemini y Qwen tendían a señalar errores inexistentes, mientras que modelos anteriores de OpenAI y Anthropic aprobaban montajes defectuosos.

## Por qué importa (interpretación editorial)

El resultado sugiere avances relevantes en razonamiento visual y espacial, pero no permite concluir que los modelos puedan montar muebles físicamente. Los sesgos de diagnóstico identificados por Epoch AI también sugieren que las evaluaciones deben considerar tanto los errores señalados indebidamente como las fallas al detectar ensamblajes defectuosos.

_Resumen escrito por AI Daily Journal con palabras propias, a partir de las fuentes anteriores. Para más detalles, lee los artículos originales._
