Montar móveis da Ikea se tornou um rito de passagem, uma tarefa que testa a paciência e as relações interpessoais. Agora, essa experiência desafiadora também serve como um rigoroso teste para a inteligência artificial. Pesquisadores da Epoch AI desenvolveram um novo benchmark, o Furniture Assembly Benchmark, que utiliza a complexidade da montagem de peças suecas para avaliar a capacidade de raciocínio espacial e a identificação de erros por modelos de IA. A iniciativa surge em um momento em que empresas de tecnologia frequentemente exaltam a inteligência de seus sistemas, mas carecem de métricas universais e práticas para comparar suas verdadeiras capacidades.

A dificuldade em avaliar a "inteligência" real de modelos como ChatGPT e Claude reside na necessidade de testá-los em aplicações do mundo real. Ao apresentar a modelos de IA imagens de móveis da Ikea em diferentes estágios de montagem, com erros propositais, os pesquisadores buscam mensurar a habilidade dos sistemas em identificar e corrigir falhas, uma tarefa que reflete a complexidade de muitas atividades humanas.

O Desafio da Montagem e o Teste da IA

O projeto nasceu durante um retiro da Epoch AI, onde os pesquisadores buscavam uma forma concreta de testar as capacidades de IA. Inicialmente, tentaram simular um robô, guiando a IA passo a passo, mas os resultados foram caóticos. A ideia de pedir à IA para identificar erros em uma montagem já em andamento, proposta por Aiden Ament, mostrou-se mais promissora. "Isso reflete a realidade de que tudo bem cometer erros durante a montagem, desde que você consiga identificá-los e corrigi-los", explicou Greg Burnham, um dos pesquisadores, à Fast Company. Essa abordagem permite avaliar não apenas a capacidade de seguir instruções, mas também a de diagnosticar e resolver problemas em um processo.

Para o experimento, foram selecionados três produtos da Ikea com diferentes níveis de complexidade: o sapateiro Ställ (fácil), a cama Tonstad (médio) e a cômoda Gulliver (difícil). Os pesquisadores montaram as peças intencionalmente, tirando cerca de 60 fotos de cada etapa para alimentar os modelos de IA de empresas como OpenAI, Anthropic, Google, Moonshot e Alibaba. Cada sistema recebeu as imagens, o manual de instruções em PDF e ferramentas como um interpretador Python e um zoom para análise. A tarefa era identificar os erros cometidos e em qual ponto da montagem eles ocorreram, além de fornecer uma explicação para cada falha detectada.

Raciocínio Espacial e Correção de Erros em Foco

O objetivo do benchmark transcende a montagem de móveis. A intenção é avaliar se os modelos de IA podem oferecer orientação e solucionar problemas em tarefas físicas mais complexas. "Se os modelos conseguem raciocinar com rapidez e precisão suficientes neste domínio, é plausível que a IA possa em breve fornecer orientação confiável em tempo real para tarefas complexas de montagem e reparo físico", afirmaram Ament e Burnham em seu relatório. Eles consideram este desafio um bom proxy para diversas tarefas economicamente importantes que exigem raciocínio visual e espacial semelhante, como consertar um carro ou reparar eletrodomésticos.

Inicialmente, o modelo com melhor desempenho foi o Claude Opus da Anthropic, alcançando apenas 28% de precisão. No entanto, em um período de dez meses, a OpenAI demonstrou um avanço notável com um de seus modelos mais recentes, que atingiu 80% de precisão. Uma das descobertas mais significativas foi a velocidade de resposta: este modelo da OpenAI levou cerca de três minutos por foto, dez vezes mais rápido que outros modelos. Modelos chineses, em particular, pareceram ficar para trás em relação aos americanos.

Implicações e Limitações Atuais

O rápido progresso em raciocínio espacial e solução de problemas em um curto espaço de tempo é promissor, mas as limitações persistem, especialmente em velocidade e consistência na precisão. "O desenvolvimento da IA é um processo muito intensivo em capital, e o crescimento da receita das empresas de IA é necessário para o investimento contínuo", disse Burnham. Ele ressalta a busca por benchmarks em áreas onde o impacto da IA ainda é limitado. "Se a IA puder qualificar trabalhadores de fábrica para reparar máquinas complexas, por exemplo, isso poderia levar a menos tempo de inatividade." Por enquanto, a tarefa de montar seus próprios móveis parece segura.

Perguntas em Aberto e o Futuro Próximo

Ainda que os avanços sejam notáveis, a perfeição na montagem de móveis da Ikea continua sendo um horizonte distante para a IA. A capacidade de identificar e corrigir erros com alta precisão e velocidade ainda é um desafio. A disparidade de desempenho entre os modelos e a lentidão de alguns sistemas levantam questões sobre a escalabilidade e a aplicabilidade prática em cenários de alta pressão ou em larga escala.

A evolução desses benchmarks é crucial para entender o progresso real da IA em tarefas que exigem interação com o mundo físico. Enquanto a IA se aprimora, a montagem de móveis desafiadores permanece um domínio onde a inteligência humana ainda detém a vantagem, mas a corrida pela supremacia nesse quesito está longe de terminar.

Com reportagem de Brazil Valley

Source · Fast Company