
Uma equipa de investigadores de cibersegurança da Varonis conseguiu manipular o assistente com inteligência artificial Copilot da Microsoft para que este revelasse, passo a passo, a forma exata de comprometer o seu próprio sistema. Através de perguntas sucessivas sobre o motivo de um ataque estar a falhar, o modelo acabou por expor dados confidenciais e permitir a alteração da sua memória persistente.
A técnica do meta-hacking aplicada aos modelos de linguagem
A vulnerabilidade, batizada de CoSnitch, baseia-se na incapacidade de o modelo de linguagem distinguir entre os dados de uma consulta e uma instrução de execução. Inicialmente, os peritos questionaram o assistente sobre como executar uma instrução automaticamente sem intervenção do utilizador, um parâmetro que tinha sido desativado pela empresa para evitar ataques de injeção de comandos.
Perante a recusa inicial do sistema, a equipa adotou uma abordagem diferente: em vez de insistir na ordem, reformulou as questões para simular o funcionamento normal da arquitetura. A investigação colocou dúvidas sobre a estrutura de URLs, ligações profundas e o comportamento do sistema ao carregar dados prévios. Cada explicação da IA sobre o motivo de algo não funcionar estreitou o caminho até ao ponto fraco do código.
Os peritos explicaram que "cada 'isso não funciona porque...' é um convite para investigar o porque", sublinhando que a resistência do próprio modelo fez parte da técnica. Este processo de engenharia social direcionado ao motor de raciocínio, denominado "meta-hacking", convenceu a ferramenta a cooperar sem a necessidade de recorrer a engenharia reversa do software.
Correção disponibilizada após terceira vulnerabilidade descoberta
A demonstração provou que a falha permitia enviar informações privadas para um servidor externo e envenenar a memória contínua do assistente. A vulnerabilidade foi identificada originalmente em dezembro de 2025 e reportada à tecnológica, que lançou uma atualização de segurança para fechar a brecha na terça-feira.
A CoSnitch representa a terceira vulnerabilidade de relevo encontrada pela empresa no assistente em 2026, juntando-se aos incidentes Reprompt e SearchLeak. Até ao momento, não existem evidências de que esta técnica tenha sido explorada por cibercriminosos em cenários reais. A correção do problema reforça a necessidade de controlar com rigor o acesso a ferramentas baseadas em inteligência artificial no ambiente corporativo.












Nenhum comentário
Seja o primeiro!