Epoch AI relata avanço de 28% a 80% em teste de montagem de móveis
A Epoch AI afirma que o desempenho no Furniture Assembly Benchmark (FAB) passou de 28%, obtidos pelo Claude 4,5 em novembro de 2025, para 80%, alcançados pelo GPT-6 Astra em setembro de 2026. Os modelos recebem uma foto de um móvel da IKEA parcialmente montado, o manual de instruções, uma ferramenta de ampliação e um intérprete de Python; precisam relacionar os diagramas às peças reais, reconstruir os passos e localizar erros, como uma peça invertida. Segundo a Epoch AI, o GPT-6 Astra levou em média três minutos por foto, entre duas e dez vezes menos que modelos anteriormente entre os melhores. O benchmark mede raciocínio visual e espacial, não a capacidade de robôs de montar móveis fisicamente. A Epoch também identificou vieses: Gemini e Qwen tendiam a apontar erros inexistentes, enquanto modelos anteriores da OpenAI e da Anthropic aprovavam montagens com falhas.
Por que importa · interpretação editorial
O resultado sugere avanços relevantes em raciocínio visual e espacial, mas não permite concluir que os modelos consigam montar móveis fisicamente. Os vieses de diagnóstico identificados pela Epoch AI também indicam que avaliações precisam considerar tanto erros detectados indevidamente quanto falhas em assemblies defeituosos.
Fontes
Pesquisa