A General Instinct, empresa focada em inteligência artificial para robótica, anunciou o lançamento do InstinctFlash, um framework de alto desempenho projetado para otimizar a inferência de modelos de robótica em tempo real. A ferramenta, licenciada sob a licença AGPL-3.0, visa solucionar um problema recorrente no desenvolvimento de robôs: a lentidão na execução de modelos, que muitas vezes impede seu uso em ciclos de controle práticos.

O InstinctFlash foca em acelerar modelos de "world-action" (WAMs) e "vision-language agents" (VLAs), permitindo que algoritmos complexos, como os de 5 bilhões de parâmetros, operem em dispositivos de hardware mais acessíveis, como o Jetson Thor. Segundo a empresa, as otimizações de runtime podem gerar um aumento de velocidade de 1.2x a 7.9x. Quando combinadas com uma técnica de destilação de "few-step diffusion scheduler", a aceleração pode chegar a impressionantes 33.78x, como observado no modelo LingBot-VA.

Otimizações que Fazem a Diferença

A performance aprimorada do InstinctFlash advém de uma combinação de seis aspectos de otimização. Isso inclui a captura de grafos CUDA para otimizar a execução e o planejamento de memória, o reuso de estados de cache (KV e conditioning) para evitar computações redundantes em modelos de difusão, e a implementação de caminhos de atenção especializados para diferentes arquiteturas. Além disso, o framework utiliza kernels otimizados, explora a execução em precisão mista e FP8, e emprega a destilação de poucos passos para modelos de difusão e geração de ações. Essas melhorias são cruciais para que modelos de IA, que se tornam cada vez mais capazes, possam ser efetivamente implementados em robôs que exigem respostas rápidas e precisas.

Desempenho Comprovado em Cenários Reais

Os resultados apresentados pela General Instinct são notáveis. Em testes com 50 tarefas do projeto Robotwin2.0, o LingBot-VA, utilizando o InstinctFlash e operando com 2 passos visuais e 4 de ação, alcançou uma taxa de sucesso de 90.5%. Em comparação, a versão base, com 25 passos visuais e 50 de ação, obteve 92.1%. A pequena diferença na taxa de sucesso, aliada à drástica redução nos passos de processamento, demonstra a viabilidade do InstinctFlash para aplicações em tempo real. O framework já conta com o suporte a oito famílias de modelos VLA/WAM, incluindo pi0.5 e NVIDIA Cosmos Policy, e é compatível com GPUs como RTX 4090/5090 e o Jetson Thor. A promessa é que, ao fornecer um checkpoint do modelo treinado, o InstinctFlash cuide do restante, expondo o modelo acelerado via runtime Python ou servidor WebSocket compatível com OpenPI.

Impacto e Adoção no Ecossistema Robótico

O desenvolvimento do InstinctFlash foi motivado pela necessidade de contornar os limites de velocidade de inferência que frequentemente surgiam no deploy de políticas robóticas. A capacidade de rodar modelos de 5 bilhões de parâmetros em tempo real em hardware como o Jetson Thor abre novas possibilidades para o desenvolvimento de robôs autônomos, desde veículos autônomos até braços robóticos em linhas de produção. Equipes de empresas como Samsung e Siemens, além de startups de robótica, já teriam utilizado o InstinctFlash para acelerar seus modelos. A disponibilização pública do framework sob licença AGPL-3.0 sugere um movimento para fomentar a colaboração e a inovação na área, permitindo que mais desenvolvedores e pesquisadores explorem o potencial da IA em robótica.

Perguntas em Aberto e o Futuro da Inferência Robótica

Apesar dos avanços significativos, algumas questões permanecem. A longevidade e escalabilidade das otimizações em diferentes arquiteturas de hardware e modelos de IA ainda precisam ser extensivamente testadas em cenários de produção variados. Além disso, a curva de aprendizado para integrar o InstinctFlash em fluxos de trabalho de desenvolvimento existentes pode ser um fator a ser considerado. A adoção generalizada dependerá não apenas da performance bruta, mas também da facilidade de uso e do suporte contínuo da comunidade e da General Instinct. O futuro da inferência robótica parece caminhar para a democratização de modelos de ponta em plataformas mais acessíveis.

A disponibilização do InstinctFlash representa um passo importante para reduzir a lacuna entre a capacidade dos modelos de IA e as restrições de hardware no mundo real da robótica. A capacidade de executar modelos complexos em tempo real em dispositivos como o Jetson Thor pode acelerar significativamente a inovação em diversas indústrias.

Com reportagem de Brazil Valley

Source · Hacker News