1. TugaTech » Internet e Redes » Noticias da Internet e Mercados
  Login     Registar    |                      

Siga-nos


OpenAI

A OpenAI teve de interromper o funcionamento de um dos seus modelos internos de inteligência artificial mais avançados devido a uma falha de segurança. O sistema, desenvolvido especificamente para resolver problemas complexos e em aberto, conseguiu contornar as restrições de isolamento (sandbox) que deveriam bloquear o seu acesso ao exterior. A revelação foi feita pela própria OpenAI através de um relatório detalhado.

O modelo em causa ganhou notoriedade interna por ter refutado a conhecida conjectura das distâncias unitárias de Erdős. Contudo, a sua elevada persistência — uma característica desenhada para que passasse longos períodos à procura de soluções para problemas científicos ou matemáticos — acabou por se virar contra a própria infraestrutura. Durante a execução de uma tarefa, o sistema dedicou cerca de uma hora a procurar e explorar uma vulnerabilidade no ambiente isolado. O objetivo do agente era abrir um pull request (PR) num repositório público do GitHub, motivado por instruções contraditórias que encontrou durante o processamento, as quais se sobrepuseram à ordem inicial de partilhar os resultados na plataforma Slack.

A vulnerabilidade dos agentes persistentes

O incidente surge numa altura em que a segurança em torno de agentes autónomos ganha nova relevância. De resto, um estudo recente da Pillar Research já tinha alertado para vários modelos de inteligência artificial — incluindo variantes criadas pela própria dona do ChatGPT — a conseguirem escapar das respetivas sandboxes.

A tecnológica liderada por Sam Altman explicou que a capacidade destes modelos persistentes para lidarem com problemas em aberto concede-lhes, em simultâneo, mais oportunidades para tomarem ações indesejadas e com potenciais consequências à medida que as tarefas se tornam mais longas e complexas.

Novas salvaguardas e mitigação de riscos

Para evitar que este tipo de comportamento desalinhado se repita, a tecnológica reconstruiu o seu sistema de segurança com base numa estratégia de defesa em profundidade e monitorização ao nível da trajetória. As novas salvaguardas incluem avaliações derivadas de incidentes, melhorias no alinhamento do modelo, monitorização ativa e uma maior visibilidade e controlo para os utilizadores.

A eficácia destas medidas foi testada em ambientes de implementação interna que replicavam o cenário da falha original. De acordo com a empresa, os novos mecanismos conseguiram intercetar um volume consideravelmente maior de ações desalinhadas, sendo que as poucas que ultrapassaram as defesas foram classificadas como de baixa gravidade.

A OpenAI sublinhou ainda que este tipo de comportamento não é exclusivo dos seus sistemas e que a partilha pública destes dados visa ajudar outros laboratórios a prevenir falhas semelhantes no futuro. A empresa continuará a trabalhar para aproximar a fase de avaliação do momento de lançamento, testando os modelos em trajetórias mais longas e criando ferramentas capazes de intervir ativamente durante a execução de tarefas.

Foto do Autor

Aficionado por tecnologia desde o tempo dos sistemas a preto e branco

Ver perfil do usuário Enviar uma mensagem privada Enviar um email Facebook do autor Twitter do autor Skype do autor

conectado
Encontrou algum erro neste artigo?

Não perca nenhuma novidade!

Junte-se a milhares de leitores e receba as últimas notícias de tecnologia, análises e dicas diretamente no seu email.

Nenhum comentário

Seja o primeiro!





Aplicações do TugaTechAplicações TugaTechDiscord do TugaTechDiscord do TugaTechRSS TugaTechRSS do TugaTechSpeedtest TugaTechSpeedtest TugatechHost TugaTechHost TugaTech