No dia 17 de agosto, o GitHub, a espinha dorsal do desenvolvimento de software para milhões de programadores e empresas, ficou indisponível por 7 horas e 47 minutos. A interrupção generalizada afetou desde a autenticação e o acesso a repositórios até serviços críticos como Actions e Copilot. Foi o segundo incidente significativo em um único mês, abalando a confiança na plataforma.
Em um post-mortem detalhado, a empresa, que é controlada pela Microsoft, admitiu a falha. A causa não foi uma mudança de código ou um ataque externo, mas algo mais fundamental: uma falha de capacidade. A infraestrutura do GitHub simplesmente não conseguiu acompanhar um novo pico de tráfego. O episódio serve como uma dura lição sobre os desafios de manter a confiabilidade em meio a um crescimento explosivo, mesmo para um gigante da tecnologia.
A anatomia de uma falha
O estopim da crise foi um componente de infraestrutura no data center da empresa nos Estados Unidos que não escalou conforme o esperado. A pressão se espalhou em cascata, derrubando múltiplos sistemas. A recuperação foi complexa, agravada por um loop de tentativas de reconexão do Copilot, que acabou gerando ainda mais tráfego e sobrecarregando os sistemas que estavam sendo restaurados. A raiz do problema, no entanto, é o hipercrescimento. Desde abril, o número de commits mensais na plataforma mais do que dobrou, saltando de 1,4 bilhão para 2,9 bilhões.
O diagnóstico do GitHub é que, embora o crescimento explique a pressão, ele não justifica a falha. A empresa reconheceu que suas práticas operacionais não acompanharam a complexidade e o ritmo da expansão. É um dilema clássico no mundo da tecnologia: o sucesso de uma plataforma pode se tornar seu maior risco operacional se a infraestrutura e os processos não evoluírem na mesma velocidade.
A aposta na Azure e o caminho à frente
Como resposta, o GitHub está acelerando um movimento estratégico que já estava em curso: a migração de sua infraestrutura para a nuvem da Microsoft. Hoje, a Azure já serve cerca de 58% da carga da plataforma e metade de todas as operações de Git, um salto expressivo em relação aos 12% de maio. Além de adicionar capacidade bruta — mais de 3 milhões de novos núcleos de CPU e 120 petabytes de armazenamento —, a aposta é que a elasticidade da nuvem ofereça a resiliência que seus data centers próprios não conseguiram garantir.
Paralelamente ao investimento em hardware e nuvem, a empresa está revisando seus processos internos. As lições dos incidentes de agosto levaram a duas mudanças imediatas: a aplicação de limites consistentes de retries entre serviços para evitar tempestades de requisições e a revisão de alertas de baixo nível que poderiam sinalizar falhas iminentes. A admissão da falha e a transparência na comunicação são um passo importante.
A promessa de "reconquistar a confiança" através da estabilidade da plataforma mostra que o GitHub entende seu papel como infraestrutura crítica. Para a comunidade de desenvolvedores, a estabilidade não é um recurso, é a premissa. O episódio é um lembrete de que, na economia digital, a confiabilidade é uma batalha contínua, nunca uma vitória definitiva.
Com reportagem de Brazil Valley
Source · The GitHub Blog





