1. TugaTech » Internet e Redes » Noticias da Internet e Mercados
  Login     Registar    |                      

Siga-nos


Github 3D

Uma falha em cadeia nos sistemas do GitHub deixou a plataforma indisponível durante quase 8 horas no dia 17 de agosto, afetando a produtividade de milhões de programadores em todo o mundo. No pico do incidente, as taxas de erro na interface web e na API atingiram cerca de 20%, enquanto os downloads de ficheiros e conteúdos brutos registaram falhas na ordem dos 50%. A empresa publicou agora uma análise detalhada sobre a causa raiz do problema.

Embora a maioria dos serviços tenha recuperado em cerca de 3 horas, ferramentas essenciais como o GitHub Actions e o serviço de tokens do Copilot permaneceram condicionadas durante mais tempo. A paragem afetou a plataforma GitHub, incluindo a gestão de Issues, Pull Requests e vários serviços de autenticação indispensáveis para o trabalho diário das equipas de desenvolvimento.

Sobrecarga na infraestrutura e erro no VS Code

O problema teve origem no centro de dados Central US da empresa, onde os equilibradores de carga ficaram saturados após um pico de tráfego. Um pod secundário do Istio atingiu o limite de concorrência, mas a política de escalamento automático falhou porque monitorizava apenas o serviço principal e não os limites do pod. A situação agravou-se até quatro nós HAProxy esgotarem o limite de ligações, paralisando a rota de autenticação da plataforma.

Para tentar conter os danos, o tráfego foi parcialmente redirecionado para o centro de dados na Virginia do Norte. Contudo, atrasos na resposta interna ativaram um bug oculto de repetição no VS Code, fazendo com que as solicitações do Copilot disparassem. O serviço de tokens do Copilot, que processa normalmente entre 7.000 e 9.000 pedidos por segundo, foi inundado com volumes entre 70.000 e 100.000 pedidos por segundo.

Medidas de mitigação e pressão do código com IA

A estabilização do serviço só foi alcançada quando a equipa técnica reduziu as tentativas automáticas no gateway, bloqueou temporariamente certos pedidos de tokens com respostas HTTP 403 e restaurou o tráfego de forma gradual. Para evitar futuras interrupções, a empresa planeia rever as políticas de escalamento, auditar a capacidade do Istio, corrigir a falha no VS Code e reforçar a monitorização de tráfego regional.

Esta paragem surge num momento em que a infraestrutura da empresa enfrenta uma pressão sem precedentes devido ao crescimento acelerado das ferramentas de programação com inteligência artificial. Para responder à procura exigida por estes sistemas, a Microsoft prepara-se até para alugar capacidade de processamento à concorrente Amazon Web Services.

Foto do Autor

Aficionado por tecnologia desde o tempo dos sistemas a preto e branco

Ver perfil do usuário Enviar uma mensagem privada Enviar um email Facebook do autor Twitter do autor Skype do autor

conectado
Encontrou algum erro neste artigo?



Aplicações do TugaTechAplicações TugaTechDiscord do TugaTechDiscord do TugaTechRSS TugaTechRSS do TugaTechSpeedtest TugaTechSpeedtest TugatechHost TugaTechHost TugaTech