A visão de robôs humanoides autônomos, capazes de realizar qualquer tarefa humana, tem sido um sonho persistente na ficção científica e, mais recentemente, um foco de investimento e especulação no mundo da tecnologia. Elon Musk, CEO da Tesla, prevê que seus robôs Optimus poderão automatizar quase todo o trabalho humano por um custo acessível, com vendas ao público previstas para o final de 2027. Essa euforia não é isolada; figuras como Marc Andreessen e Jensen Huang, líderes em capital de risco e tecnologia, compartilham a crença de que a robótica se tornará a maior indústria da história. Projeções de mercado indicam a existência de quase 1 bilhão de robôs com aparência e comportamento humanos até 2050, movimentando mais de US$ 5 trilhões.

O Ceticismo dos Especialistas e os Desafios da IA

Apesar do otimismo, muitos pesquisadores de robótica expressam ceticismo. A premissa de que os mesmos avanços em IA que alimentam chatbots como ChatGPT — capazes de imitar a linguagem humana — se traduzirão diretamente em destreza e utilidade no mundo físico é vista com ressalvas. Yann LeCun, um dos pioneiros da IA, destacou em Davos que nenhuma empresa de robótica tem, atualmente, a capacidade de tornar esses robôs suficientemente inteligentes para serem úteis. O problema central reside na diferença fundamental entre a inteligência baseada em linguagem e imagens e a inteligência necessária para navegar e interagir com a infinita variabilidade do ambiente físico. A facilidade de criar um robô que se pareça com um humano contrasta drasticamente com a dificuldade de fazer uma máquina que se mova e se comporte de forma fisicamente semelhante a uma pessoa, como aponta Jonathan Hurst, da Agility Robotics.

A Promessa e a Limitação dos Modelos VLA

O progresso na robótica tem sido impulsionado por novas abordagens em IA, especialmente os modelos de visão-linguagem-ação (VLA). Estes sistemas, treinados com vastas quantidades de dados de demonstrações humanas, permitem que robôs avaliem seus ambientes, planejem ações e as executem. O ALOHA 2, um sistema de braços robóticos utilizado pelo Google DeepMind para testar seu modelo Gemini Robotics, exemplifica essa capacidade. Ele pode realizar tarefas como empacotar um lunchbox, demonstrando um avanço significativo em relação a políticas de robôs rigidamente programadas por engenheiros. No entanto, a principal limitação desses modelos é clara: quando confrontados com tarefas fora de seu conjunto de treinamento, a probabilidade de falha é alta. A busca por uma "política generalista" que abranja "todo o espectro de tarefas" ainda está longe de ser alcançada, com os modelos atuais conseguindo realizar apenas "algumas coisas aqui e ali", conforme descrito por Edward Johns, do Imperial College London.

O Caminho para a Generalidade: Dados e Modelos de Mundo

A solução mais comum para alcançar maior generalidade em robôs é treiná-los com mais dados. Contudo, a robótica enfrenta um obstáculo que a IA de linguagem não teve: a escassez de dados de demonstração física de alta qualidade. Coletar esses dados através de teleoperação humana é caro e demorado, treinar com vídeos de pessoas resulta em baixa qualidade, e a implantação de robôs no mundo real para coleta de dados levanta questões de segurança e confiabilidade. A complexidade intrínseca das tarefas do mundo real, como preparar café, que envolve inúmeras variáveis e um "menu em constante mudança de possibilidades", sugere que a cobertura completa de dados para atingir a generalidade via VLA seria quase infinita. Alguns especialistas, como Yann LeCun, defendem que as abordagens de IA bem-sucedidas para linguagem não se aplicam diretamente a dados contínuos e ruidosos da robótica, propondo o uso de "modelos de mundo" — sistemas de IA treinados em vídeo e dados de sensores para prever resultados de ações e construir uma representação interna da realidade.

Perspectivas e Perguntas em Aberto

Embora a IA e os modelos de mundo representem áreas de pesquisa promissoras, a aplicação prática de robôs generalistas ainda está distante. Empresas como Physical Intelligence (PI) exploram abordagens "tudo incluído" para treinar IA robótica, com seu modelo π0.7 demonstrando sinais de "generalização composicional" — a habilidade de realizar tarefas não vistas diretamente, recombinando habilidades aprendidas. No entanto, mesmo nesse caso, a capacidade de generalização exata ainda é incerta, e a "70% de sucesso é como se não funcionasse", segundo Marc Raibert, fundador da Boston Dynamics. Os robôs que hoje vemos em demonstrações muitas vezes dependem de controle humano ou roteiros cuidadosamente elaborados. A verdadeira autonomia em ambientes caóticos e a capacidade de executar tarefas complexas e ambíguas permanecem desafios significativos. A transição de tarefas simples em ambientes controlados para o uso doméstico generalizado pode levar uma década ou mais, com a China liderando a produção de robôs humanoides a custos mais baixos. A questão fundamental permanece: as ferramentas de IA atuais são suficientes para a revolução robótica, ou um novo caminho, talvez focado em modelos de mundo mais sofisticados, é necessário para dotar as máquinas da intuição física e fluidez que elas precisam para realmente mudar nossas vidas?

Com reportagem de Brazil Valley

Source · MIT Technology Review