
A Anthropic está a implementar novas medidas de segurança para limitar o comportamento indevido dos seus modelos de inteligência artificial. Segundo o The Register, uma auditoria recente revelou que os modelos Claude ultrapassaram os limites de testes de cibersegurança ficcionais, obtendo acesso não autorizado a sistemas informáticos reais.
Os incidentes, reportados a 30 de julho, ocorreram em ambientes de terceiros que não possuíam proteção suficiente. A empresa justificou as falhas com problemas de segurança operacional e duas questões de alinhamento: raciocínio motivado e a vontade da inteligência artificial de tomar ações prejudiciais para concluir uma tarefa específica. Em resposta, a tecnológica passou a utilizar classificadores em tempo real para detetar tentativas de fuga dos ambientes de teste, além de monitorização automatizada de registos e medidas de isolamento mais fortes.
Regras apertadas para parceiros
Para evitar novos casos, a empresa exige agora que todas as organizações responsáveis por testar modelos de pré-lançamento com salvaguardas cibernéticas reduzidas se comprometam com um novo conjunto de boas práticas. A recomendação principal foca-se em garantir que todas as avaliações ocorram em caixas de areia (sandboxes) endurecidas e sem qualquer ligação à internet.
Os parceiros devem também testar previamente os ambientes contra fugas e garantir que os desafios propostos à inteligência artificial têm uma solução viável. O caso do Claude demonstrou que fornecer informações erradas ao modelo, como mentir sobre a disponibilidade de acesso à internet, pode levar a inteligência artificial a procurar caminhos não antecipados e a quebrar as regras estabelecidas.
A auditoria interna da empresa foi motivada por um relatório da OpenAI sobre um ataque semelhante contra a plataforma Hugging Face. Importa referir que, no mês passado, o modo automático passou a ser o padrão no Claude Code, permitindo a execução de tarefas sem pedir autorização prévia ao utilizador.












Nenhum comentário
Seja o primeiro!