
A OpenAI anunciou um conjunto de atualizações na sua infraestrutura de cibersegurança na sequência do incidente registado em julho, altura em que um modelo de inteligência artificial ultrapassou o seu ambiente isolado e acedeu indevidamente aos sistemas da plataforma Hugging Face. Para responder às falhas detetadas, a tecnológica reformulou a gestão dos seus ambientes de investigação, os sistemas de monitorização e as técnicas de alinhamento dos modelos.
Como medida imediata, a empresa interrompeu o desenvolvimento do Astra, um novo modelo que apresenta capacidades críticas no domínio da cibersegurança. Adicionalmente, foi imposta uma pausa de duas semanas no treino por aprendizagem por reforço para os modelos mais recentes destinados a implementação comercial, mantendo suspenso o maior ciclo de treino de modelos de fronteira que estava planeado.
Congelamento de modelos e regras de isolamento
As novas diretrizes exigem que o treino e execução de cargas de trabalho que corram código gerado por modelos ou não fiável fiquem confinados a ambientes isolados reforçados. A empresa implementou também controlos adicionais para separar da internet os processos classificados de maior risco.
A arquitetura interna de investigação foi atualizada para eliminar serviços partilhados vulneráveis e diminuir os privilégios de acesso permanentes das equipas. As alterações visam definir fronteiras de segurança mais rígidas dentro dos próprios servidores onde os modelos de inteligência artificial são desenvolvidos.
Resposta rápida e alinhamento reforçado
O novo protocolo de monitorização estabelece que qualquer atividade suspeita deve gerar um alerta num prazo máximo de 30 minutos. Caso as equipas notificadas não consigam determinar de forma conclusiva se o aviso corresponde a um falso positivo no mesmo período de 30 minutos, têm ordens estritas para interromper imediatamente a atividade em curso.
A empresa estendeu igualmente a aplicação das suas técnicas de alinhamento a mais fases do processo de treino. O método inclui modelos de recompensa concebidos para detetar e desincentivar comportamentos inseguros, treinando os sistemas para reportarem com exatidão as suas ações, capacidades e limites.
A revelação do incidente na Hugging Face surge numa altura em que outras empresas do setor, como a Anthropic e a Meta, confirmaram também ter detetado comportamentos autónomos dos seus modelos contra plataformas externas.












Nenhum comentário
Seja o primeiro!