- Pesquisadores da Anthropic descobriram uma nova vulnerabilidade em grandes modelos de linguagem (LLMs) chamada 'many-shot jailbreaking', onde a preparação do modelo com várias perguntas inofensivas pode eventualmente levá-lo a fornecer respostas inadequadas, como instruções para fabricar uma bomba.
- A vulnerabilidade é atribuída ao aumento da'janela de contexto'dos LLMs mais recentes, permitindo-lhes reter grandes quantidades de dados na memória de curto prazo.
- Para resolver esse problema, os pesquisadores estão trabalhando para classificar e contextualizar as consultas antes de submetê-las ao modelo, a fim de mitigar o risco enquanto mantêm os níveis de desempenho.
Uma nova vulnerabilidade em grandes modelos de linguagem: o 'many-shot jailbreaking' permite obter respostas inadequadas ao preparar o modelo com perguntas inofensivas.
Pesquisadores da Anthropic descobrem um bug nos LLMs
Como fazer uma IA responder a uma pergunta que não deveria? Existem muitas técnicas de 'jailbreak', e os pesquisadores da Anthropic acabaram de encontrar uma nova, onde grandes modelos de linguagem (LLMs) podem ser convencidos a lhe dizer como fabricar uma bomba se você os preparar primeiro com algumas dezenas de perguntas menos perigosas.
Esta pesquisa foi documentada em um artigo e compartilhada com a comunidade de IA, revelando que LLMs com janelas de contexto mais amplas tendem a ter melhor desempenho em várias tarefas quando recebem muitos exemplos no prompt. Isso inclui perguntas triviais, onde a exposição repetida melhora a precisão das respostas ao longo do tempo. No entanto, esse mesmo mecanismo se estende às respostas para consultas inadequadas, tornando mais provável que o modelo obedeça após ter sido preparado com uma série de perguntas inofensivas.
Leia também:Abuso de IA? Disney evita críticas graças ao pôster de 'Loki'
Crescente preocupação com o abuso de IA
Esse bug pode criar agitação no setor de tecnologia, gerando preocupação do público sobre o abuso de IA. Embora o mecanismo exato por trás desse comportamento permaneça obscuro, os pesquisadores supõem que ele envolve a capacidade do modelo de discernir a intenção do usuário com base no contexto fornecido.
A equipe já informou seus pares, e até mesmo seus concorrentes, sobre esse ataque, esperando que isso 'fomente uma cultura onde explorações desse tipo sejam abertamente compartilhadas entre provedores de LLMs e pesquisadores'. No entanto, mitigar essa vulnerabilidade apresenta desafios, pois limitar a janela de contexto impacta negativamente o desempenho do modelo.

