O Jevstiller surge como uma solução inovadora para otimizar o uso de modelos de inteligência artificial, como o Jev, ao permitir que eles sejam executados localmente. Desenvolvido como um projeto open source, o Jevstiller visa replicar a funcionalidade de modelos maiores, aprendendo com as interações do usuário para responder a requisições mais comuns diretamente no hardware local. Essa abordagem promete não apenas acelerar o tempo de resposta, mas também reduzir significativamente os custos associados ao uso de tokens em serviços de IA na nuvem.

O modelo Jev, conhecido por sua eficiência em tarefas estruturadas como Choice, Score e Noul, opera com um custo de US$ 42 por bilhão de tokens de entrada e um tempo de resposta de cerca de 300 milissegundos. O Jevstiller, ao criar um modelo local, busca diminuir essa latência para até 15 milissegundos em CPUs de dispositivos. A principal vantagem é que as requisições respondidas localmente não consomem tokens, tornando o uso da IA mais econômico. Os criadores do Jevstiller afirmam que o sistema atinge uma concordância de 98% com o Jev original, lidando com solicitações familiares internamente e encaminhando as demais para o serviço na nuvem.

A arquitetura do Jevstiller funciona como um sistema de cache inteligente. Ele intercepta as requisições e determina se o modelo local tem confiança suficiente para responder. Se todas as partes de uma requisição puderem ser respondidas localmente, ela é processada no dispositivo. Caso contrário, a requisição inteira é enviada ao Jev original, e sua resposta é utilizada tanto para o usuário quanto para treinar o modelo local. Esse processo de aprendizado contínuo é fundamental para a manutenção da concordância com o Jev.

O treinamento inicial do Jevstiller envolve passar todas as requisições para o Jev e coletar pares de perguntas e respostas. Uma vez que haja um volume suficiente de exemplos, um processo em segundo plano ajusta um modelo 'estudante' e uma política de roteamento. As requisições que o modelo local considera familiares e confiáveis são respondidas sem intervenção externa. A manutenção dessa concordância é o principal desafio técnico, e os desenvolvedores implementaram um sistema de auditoria regular. Uma porcentagem fixa das requisições (2%) é sempre enviada ao Jev para validação, independentemente da confiança do modelo local, permitindo uma avaliação imparcial do seu desempenho.

Em um experimento, o Jevstiller demonstrou sua resiliência: quando um modelo Jev simulado alterou suas respostas, a taxa de compartilhamento local do Jevstiller caiu de 90% para 9% em quatro minutos. As auditorias detectaram a discrepância, e o modelo local foi re-treinado com as novas respostas em menos de uma hora, voltando a operar com 90% de compartilhamento local. Apesar dessa capacidade de adaptação, os criadores ressaltam que 'acordo não é precisão', indicando que o Jevstiller, assim como qualquer modelo de IA, pode cometer erros. A ferramenta oferece aos usuários a opção de configurar a taxa de concordância alvo e ajustar a frequência de retreinamento para equilibrar custo, performance e precisão.

Com reportagem de Brazil Valley

Source · The Register