28 de septiembre de 2026 Entiende lo que cambia. Descubre qué usar.

ModelosNoticia1 fuente

Epoch AI reporta un avance del 28% al 80% en una prueba de montaje

Epoch AI afirma que el desempeño en el Furniture Assembly Benchmark (FAB) pasó del 28%, logrado por Claude 4,5 en noviembre de 2025, al 80%, alcanzado por GPT-6 Astra en septiembre de 2026. Los modelos reciben una foto de un mueble de IKEA parcialmente montado, el manual de instrucciones, una herramienta para ampliar la imagen y un intérprete de Python; deben relacionar los diagramas con piezas reales, reconstruir los pasos del montaje y localizar errores, como una pieza invertida. Según Epoch AI, GPT-6 Astra tardó un promedio de tres minutos por foto, entre dos y diez veces menos que modelos que antes estaban entre los mejores. El benchmark mide razonamiento visual y espacial, no si los robots pueden montar muebles físicamente. Epoch también detectó sesgos: Gemini y Qwen tendían a señalar errores inexistentes, mientras que modelos anteriores de OpenAI y Anthropic aprobaban montajes defectuosos.

Por qué importa · interpretación editorial

El resultado sugiere avances relevantes en razonamiento visual y espacial, pero no permite concluir que los modelos puedan montar muebles físicamente. Los sesgos de diagnóstico identificados por Epoch AI también sugieren que las evaluaciones deben considerar tanto los errores señalados indebidamente como las fallas al detectar ensamblajes defectuosos.

Fuentes

Investigación

Una historia, varias fuentes

La cobertura de una misma historia reunida en una sola noticia, con enlace a cada original.

Resumen e interpretación separados

Lo que dicen las fuentes queda en el resumen; el contexto editorial aparece identificado aparte.

Hecho con IA, con fuentes

Resúmenes y traducciones generados con IA a partir de las notas originales, siempre enlazadas.