A interação com sistemas computacionais evoluiu ao longo das décadas, passando de interfaces de linha de comando (CLIs) para interfaces gráficas de usuário (GUIs) e interfaces de programação de aplicativos (APIs). Enquanto modelos de IA conseguem se integrar facilmente a CLIs e APIs, a navegação e manipulação de GUIs — projetadas primariamente para humanos — tem se mostrado um obstáculo persistente. A empresa francesa H apresentou uma solução para esse desafio com sua família de modelos Holo 4, que visa capacitar agentes de IA a interagir com ambientes de desktop e aplicações.

Os modelos Holo 4, construídos sobre as bases dos modelos Qwen 3.8 27B e Qwen 3.6 35B-A3B da Alibaba, foram otimizados para lidar com as três modalidades de interação: CLI, API e GUI. Através de técnicas de treinamento supervisionado e aprendizado por reforço, eles aprendem a realizar ações como apontar, clicar, rolar e digitar, emulando a interação humana com interfaces visuais. Essa versatilidade, segundo a H, confere aos seus modelos uma capacidade superior em comparação com modelos puramente focados em uso computacional. Paralelamente, a H atualizou seu modelo Holotron, baseado no Nemotron 3 da Nvidia, com funcionalidades similares.

Um dos exemplos demonstrados pela H envolve o uso do modelo Holo 4 27B para programar um modelo 3D da Torre Eiffel no software FreeCAD, utilizando a função de macro em vez da construção manual. Outra demonstração mostrou a recriação do logo da empresa através de formas extrudadas, evidenciando a flexibilidade dos modelos. Embora os benchmarks devam ser analisados com cautela, a H alega que o Holo 4 supera modelos de ponta significativamente maiores, como os da OpenAI, com uma fração de parâmetros. No entanto, o custo por tarefa pode ser mais elevado em comparação com modelos como o GPT 6 Luna, que, apesar de ter desempenho inferior em benchmarks específicos, é mais econômico.

A capacidade de rodar os modelos Holo 4 em hardware mais modesto é um ponto forte. Com pesos otimizados em precisões como BF16, FP8 e NVFP4, e uma versão GGUF compatível com Llama.cpp, LM Studio e Ollama, a H facilita a adoção por pesquisadores, entusiastas e empresas. A H também planeja lançar pesos de rascunho DSpark para acelerar a inferência via decodificação especulativa, uma técnica que emprega um modelo menor para prever saídas de um modelo maior, resultando em processamento mais rápido. A empresa também desenvolveu harnesses, como o HAI-Agents, para viabilizar a operação desses modelos, embora a compatibilidade com harnesses de terceiros seja teoricamente possível.

O desenvolvimento de IAs capazes de interagir com GUIs não é exclusivo da H. A AWS também anunciou modelos com capacidades semelhantes, e gigantes como OpenAI, Google e Anthropic investem nessa área. A necessidade de 'escapar da sandbox' — ou seja, interagir com o mundo real e sistemas externos — é um motor para essa evolução, abrindo caminho para interações humano-máquina mais fluidas e autônomas. As implicações para a automação de tarefas complexas, assistência virtual e desenvolvimento de software são vastas, sugerindo um futuro onde a IA não apenas processa dados, mas também age sobre eles de forma visual e interativa.

Com reportagem de Brazil Valley

Source · The Register