A prática de engenharia de caos, popularizada pela Netflix há mais de uma década, consiste em introduzir falhas controladas em sistemas em funcionamento para testar sua resiliência. Agora, a Gremlin, startup que construiu seu negócio em torno dessa metodologia, está integrando inteligência artificial para automatizar ainda mais o processo de testes e solução de problemas.
O Foresight AI, um novo add-on aos serviços de engenharia de caos da Gremlin, quebra autonomamente a infraestrutura de software para descobrir bugs ocultos antes que eles surjam em produção. A ideia é simples, mas poderosa: desligar um servidor aleatório, um balanceador de carga ou até mesmo uma região inteira de um ambiente de nuvem e observar como o restante do sistema reage. Se ele continuar a servir os clientes sem interrupções, o teste foi bem-sucedido; caso contrário, indica a necessidade de mais trabalho em confiabilidade.
Kolton Andrus, um dos engenheiros que realizou engenharia de caos na Netflix, fundou a Gremlin para levar a injeção de falhas para empresas, agregando ferramentas de pontuação, relatórios executivos e responsabilidade organizacional. A adição de IA ao processo acelera consideravelmente a tarefa, segundo Andrus, ao automatizar muitas das etapas preparatórias e pós-teste que antes eram feitas manualmente. Embora os serviços de AIOps (Inteligência Artificial para Operações de TI) já sejam comuns para engenheiros de confiabilidade de sites (SREs), a maioria dessas ferramentas diagnostica problemas apenas após o sistema já ter falhado. A Gremlin, por outro lado, introduz a falha intencionalmente e, em seguida, oferece conselhos especializados sobre como evitar que ela ocorra novamente.
Mecanismos de IA na Engenharia de Caos
Para utilizar a Gremlin, os usuários instalam agentes em seus sistemas, capazes de injetar latência, encerrar contêineres (pods) ou esgotar a memória. Um serviço em nuvem da Gremlin observa as telemetrias resultantes em busca de sinais de fraqueza sistêmica. O diferencial da Gremlin reside em seu "Failure Atlas", um repositório de milhões de experimentos de engenharia de caos conduzidos ao longo da última década em "dezenas de milhares de sistemas".
A empresa desenvolveu um "harne ss" que conecta um modelo de linguagem grande (LLM) ao Failure Atlas, permitindo que ele gere respostas mais fundamentadas tecnicamente sobre o que deu errado, em vez de depender apenas de informações aleatórias coletadas na internet. A Gremlin utiliza uma variedade de LLMs, tanto proprietários quanto de código aberto, dependendo do desempenho. O Atlas mantém o LLM focado, minimizando as chamadas "alucinações" do modelo.
Implicações para a Resiliência e Segurança
As proteções existentes na Gremlin são construídas em torno das permissões de acesso do cliente e outras precauções de segurança para manter o "raio de explosão" (termo da empresa) sob controle. Uma vez induzida a falha no sistema, o Foresight AI determina a causa raiz, gera um código ou configuração que acredita que corrigirá o problema e, em seguida, pode aplicar a solução ou preparar um relatório para um SRE revisar. Essencialmente, é um loop agente de teste e substituição, mantendo humanos em pontos críticos, que opera até que a falha não seja mais induzida.
O público atual da Gremlin tende a ser de grandes empresas com alta carga computacional, muitas especializadas em serviços financeiros, varejo e SaaS corporativo. Elas usam a ferramenta para testar planos de recuperação de desastres, garantir a operação correta em condições subótimas e verificar se o Kubernetes está escalando adequadamente. Esses sistemas distribuídos complexos são particularmente difíceis de diagnosticar quando falham.
Desafios e o Futuro da Automação em Infraestrutura
A corrida corporativa para usar IA tanto na escrita de aplicações quanto na implantação de infraestrutura traz suas próprias complicações. A IA opera a uma velocidade que torna impossível para revisores humanos acompanharem, e seus erros podem ser significativos. Qualquer serviço que prometa quebrar sistemas para o bem maior exigirá aprovação nos mais altos níveis corporativos, segundo Jason English, analista da Intellyx.
Para que a engenharia de caos com IA funcione efetivamente, "precisamos mudar nossa mentalidade sobre risco", escreveu English. A adoção da IA na simulação de falhas representa um passo adiante na busca contínua por infraestruturas de software mais robustas e confiáveis, mas também exige uma nova abordagem à gestão de riscos e à supervisão humana. A capacidade de simular falhas de forma mais rápida e inteligente pode, paradoxalmente, levar a sistemas mais estáveis a longo prazo.
A integração de IA na engenharia de caos levanta questões sobre a velocidade da automação e a necessidade de supervisão humana. Enquanto a Gremlin busca otimizar a identificação de falhas, a comunidade de SREs e especialistas em segurança continua a debater o equilíbrio ideal entre automação e controle humano em ambientes de produção críticos. A jornada para sistemas verdadeiramente resilientes, impulsionada pela IA, está apenas começando.
Com reportagem de Brazil Valley
Source · The Register





