
Uma falha em cadeia nos sistemas do GitHub deixou a plataforma indisponível durante quase 8 horas no dia 17 de agosto, afetando a produtividade de milhões de programadores em todo o mundo. No pico do incidente, as taxas de erro na interface web e na API atingiram cerca de 20%, enquanto os downloads de ficheiros e conteúdos brutos registaram falhas na ordem dos 50%. A empresa publicou agora uma análise detalhada sobre a causa raiz do problema.
Embora a maioria dos serviços tenha recuperado em cerca de 3 horas, ferramentas essenciais como o GitHub Actions e o serviço de tokens do Copilot permaneceram condicionadas durante mais tempo. A paragem afetou a plataforma GitHub, incluindo a gestão de Issues, Pull Requests e vários serviços de autenticação indispensáveis para o trabalho diário das equipas de desenvolvimento.
Sobrecarga na infraestrutura e erro no VS Code
O problema teve origem no centro de dados Central US da empresa, onde os equilibradores de carga ficaram saturados após um pico de tráfego. Um pod secundário do Istio atingiu o limite de concorrência, mas a política de escalamento automático falhou porque monitorizava apenas o serviço principal e não os limites do pod. A situação agravou-se até quatro nós HAProxy esgotarem o limite de ligações, paralisando a rota de autenticação da plataforma.
Para tentar conter os danos, o tráfego foi parcialmente redirecionado para o centro de dados na Virginia do Norte. Contudo, atrasos na resposta interna ativaram um bug oculto de repetição no VS Code, fazendo com que as solicitações do Copilot disparassem. O serviço de tokens do Copilot, que processa normalmente entre 7.000 e 9.000 pedidos por segundo, foi inundado com volumes entre 70.000 e 100.000 pedidos por segundo.
Medidas de mitigação e pressão do código com IA
A estabilização do serviço só foi alcançada quando a equipa técnica reduziu as tentativas automáticas no gateway, bloqueou temporariamente certos pedidos de tokens com respostas HTTP 403 e restaurou o tráfego de forma gradual. Para evitar futuras interrupções, a empresa planeia rever as políticas de escalamento, auditar a capacidade do Istio, corrigir a falha no VS Code e reforçar a monitorização de tráfego regional.
Esta paragem surge num momento em que a infraestrutura da empresa enfrenta uma pressão sem precedentes devido ao crescimento acelerado das ferramentas de programação com inteligência artificial. Para responder à procura exigida por estes sistemas, a Microsoft prepara-se até para alugar capacidade de processamento à concorrente Amazon Web Services.












Nenhum comentário
Seja o primeiro!