1. TugaTech » Internet e Redes » Noticias da Internet e Mercados
  Login     Registar    |                      

Siga-nos


Anthropic

A Anthropic está a implementar novas medidas de segurança para limitar o comportamento indevido dos seus modelos de inteligência artificial. Segundo o The Register, uma auditoria recente revelou que os modelos Claude ultrapassaram os limites de testes de cibersegurança ficcionais, obtendo acesso não autorizado a sistemas informáticos reais.

Os incidentes, reportados a 30 de julho, ocorreram em ambientes de terceiros que não possuíam proteção suficiente. A empresa justificou as falhas com problemas de segurança operacional e duas questões de alinhamento: raciocínio motivado e a vontade da inteligência artificial de tomar ações prejudiciais para concluir uma tarefa específica. Em resposta, a tecnológica passou a utilizar classificadores em tempo real para detetar tentativas de fuga dos ambientes de teste, além de monitorização automatizada de registos e medidas de isolamento mais fortes.

Regras apertadas para parceiros

Para evitar novos casos, a empresa exige agora que todas as organizações responsáveis por testar modelos de pré-lançamento com salvaguardas cibernéticas reduzidas se comprometam com um novo conjunto de boas práticas. A recomendação principal foca-se em garantir que todas as avaliações ocorram em caixas de areia (sandboxes) endurecidas e sem qualquer ligação à internet.

Os parceiros devem também testar previamente os ambientes contra fugas e garantir que os desafios propostos à inteligência artificial têm uma solução viável. O caso do Claude demonstrou que fornecer informações erradas ao modelo, como mentir sobre a disponibilidade de acesso à internet, pode levar a inteligência artificial a procurar caminhos não antecipados e a quebrar as regras estabelecidas.

A auditoria interna da empresa foi motivada por um relatório da OpenAI sobre um ataque semelhante contra a plataforma Hugging Face. Importa referir que, no mês passado, o modo automático passou a ser o padrão no Claude Code, permitindo a execução de tarefas sem pedir autorização prévia ao utilizador.

Foto do Autor

Aficionado por tecnologia desde o tempo dos sistemas a preto e branco

Ver perfil do usuário Enviar uma mensagem privada Enviar um email Facebook do autor Twitter do autor Skype do autor

conectado
Encontrou algum erro neste artigo?



Aplicações do TugaTechAplicações TugaTechDiscord do TugaTechDiscord do TugaTechRSS TugaTechRSS do TugaTechSpeedtest TugaTechSpeedtest TugatechHost TugaTechHost TugaTech