Novo Método AI Jailbreak ‘Bad Likert Judge’ Aumenta as Taxas de Sucesso de Ataque em Mais de 60%

Os pesquisadores de segurança cibernética lançaram luz sobre uma nova técnica de jailbreak que poderia ser usada para superar os corrimãos de segurança de um grande modelo de linguagem (LLM) e produzir respostas potencialmente prejudiciais ou maliciosas.
A estratégia de ataque multi-turn (aka many-shot) foi codinomeada Juiz Mau Likert pelos pesquisadores da Unidade 42 da Palo Alto Networks, Yongzhe Huang, Yang Ji, Wenjun Hu, Jay Chen, Akshata Rao e Danny Tsechansky.
“A técnica pede ao LLM alvo para atuar como um juiz marcando a nocividade de uma determinada resposta usando o Escala de likert, uma escala de classificação que mede o acordo ou desacordo de um respondente com uma declaração”, a equipe da Unidade 42 disse.
“Em seguida, pede ao LLM para gerar respostas que contenham exemplos que se alinham com as escalas. O exemplo que tem a maior escala Likert pode potencialmente conter o conteúdo prejudicial.”
A explosão na popularidade da inteligência artificial nos últimos anos também levou a uma nova classe de explorações de segurança chamada injeção imediata isso é expressamente projetado para fazer com que um modelo de aprendizado de máquina ignore o comportamento pretendido passando instruções especialmente criadas (ou seja, prompts).
Um tipo específico de injeção imediata é um método de ataque apelidado jailbreak a muitos tiros, o que aproveita o LLM longo janela de contexto e atenção para criar uma série de prompts que gradualmente empurram o LLM para produzir uma resposta maliciosa sem acionar suas proteções internas. Alguns exemplos desta técnica incluem Crescendo e Delícia Enganosa.
A última abordagem demonstrada pela Unidade 42 implica empregar o LLM como juiz para avaliar a nocividade de uma determinada resposta usando a escala psicométrica Likert e, em seguida, pedir ao modelo que forneça respostas diferentes correspondentes aos vários escores.
Em testes realizados em uma ampla gama de categorias contra seis LLMs de geração de texto de última geração da Amazon Web Services, Google, Meta, Microsoft, OpenAI e NVIDIA revelaram que a técnica pode aumentar a taxa de sucesso do ataque (ASR) em mais de 60% em comparação com os prompts de ataque simples em média.
Essas categorias incluem ódio, assédio, autoflagelação, conteúdo sexual, armas indiscriminadas, atividades ilegais, geração de malware e vazamento imediato do sistema.
“Ao alavancar a compreensão do LLM sobre conteúdo prejudicial e sua capacidade de avaliar respostas, essa técnica pode aumentar significativamente as chances de contornar com sucesso os corrimãos de segurança do modelo”, disseram os pesquisadores.
“Os resultados mostram que os filtros de conteúdo podem reduzir o ASR em uma média de 89,2 pontos percentuais em todos os modelos testados. Isso indica o papel crítico da implementação de filtragem de conteúdo abrangente como uma prática recomendada ao implantar LLMs em aplicativos do mundo real.”
O desenvolvimento vem dias depois que um relatório do The Guardian revelou que a OpenAI Ferramenta de pesquisa ChatGPT poderia ser enganado em gerar resumos completamente enganosos, pedindo-lhe para resumir páginas da web que contêm conteúdo oculto.
“Essas técnicas podem ser usadas de forma maliciosa, por exemplo, para fazer com que o ChatGPT retorne uma avaliação positiva de um produto, apesar das críticas negativas na mesma página”, disse o jornal britânico U.K disse.
“A simples inclusão de texto oculto por terceiros sem instruções também pode ser usada para garantir uma avaliação positiva, com um teste incluindo avaliações falsas extremamente positivas que influenciaram o resumo retornado pelo ChatGPT.”