A pesquisa dos pesquisadores da Anthropic sobre o uso oculto de grandes modelos de linguagem é perfilada pela BTW Media porque evidências publicadas a vinculam à infraestrutura da internet, governança, dependências operacionais ou visibilidade de mercado.
A pesquisa dos pesquisadores da Anthropic sobre o uso oculto de grandes modelos de linguagem é rastreada como uma instituição de infraestrutura de internet dentro do ecossistema de infraestrutura de internet.
Guia de pontuação de confiança
Várias fontes públicas
- Pesquisadores da Anthropic descobriram uma nova vulnerabilidade em grandes modelos de linguagem (LLMs) chamada 'many-shot jailbreaking', onde a preparação do modelo com várias perguntas inofensivas pode eventualmente levá-lo a fornecer respostas inadequadas, como instruções para fabricar uma bomba.
- A vulnerabilidade é atribuída ao aumento da'janela de contexto'dos LLMs mais recentes, permitindo-lhes reter grandes quantidades de dados na memória de curto prazo.
- Para resolver esse problema, os pesquisadores estão trabalhando para classificar e contextualizar as consultas antes de submetê-las ao modelo, a fim de mitigar o risco enquanto mantêm os níveis de desempenho.
Uma nova vulnerabilidade em grandes modelos de linguagem: o 'many-shot jailbreaking' permite obter respostas inadequadas ao preparar o modelo com perguntas inofensivas.
Pesquisadores da Anthropic descobrem um bug nos LLMs
Como fazer uma IA responder a uma pergunta que não deveria? Existem muitas técnicas de 'jailbreak', e os pesquisadores da Anthropic acabaram de encontrar uma nova, onde grandes modelos de linguagem (LLMs) podem ser convencidos a lhe dizer como fabricar uma bomba se você os preparar primeiro com algumas dezenas de perguntas menos perigosas.
Esta pesquisa foi documentada em um artigo e compartilhada com a comunidade de IA, revelando que LLMs com janelas de contexto mais amplas tendem a ter melhor desempenho em várias tarefas quando recebem muitos exemplos no prompt. Isso inclui perguntas triviais, onde a exposição repetida melhora a precisão das respostas ao longo do tempo. No entanto, esse mesmo mecanismo se estende às respostas para consultas inadequadas, tornando mais provável que o modelo obedeça após ter sido preparado com uma série de perguntas inofensivas.
Leia também:Abuso de IA? Disney evita críticas graças ao pôster de 'Loki'
Crescente preocupação com o abuso de IA
Esse bug pode criar agitação no setor de tecnologia, gerando preocupação do público sobre o abuso de IA. Embora o mecanismo exato por trás desse comportamento permaneça obscuro, os pesquisadores supõem que ele envolve a capacidade do modelo de discernir a intenção do usuário com base no contexto fornecido.
A equipe já informou seus pares, e até mesmo seus concorrentes, sobre esse ataque, esperando que isso 'fomente uma cultura onde explorações desse tipo sejam abertamente compartilhadas entre provedores de LLMs e pesquisadores'. No entanto, mitigar essa vulnerabilidade apresenta desafios, pois limitar a janela de contexto impacta negativamente o desempenho do modelo.
Briefing de Sinal
- Sinal: Pesquisadores da Anthropic descobrem o uso oculto de grandes modelos de linguagem
- Região: Global
- Classe de Mercado: Tendências globais de serviços em nuvem
Presença Operacional
- As fontes publicadas devem identificar as partes afetadas, a abrangência operacional e a exposição de mercado antes que este mapa de tendências seja considerado completo.
Contexto de Mercado
- Relevância operacional: Médio
- Horizonte temporal: Próximo trimestre
O que assistir
- Fique atento a declarações oficiais, atualizações regulatórias, exposição de clientes ou parceiros e divulgações de acompanhamento.
Briefing para Membros
Contexto de Tendência Aprofundado
Faça login com o nível de associação correto para desbloquear o briefing completo e as notas de origem.
Apenas para Strategic Circle
Strategic Circle
Aberto a todos os leitores. Desbloqueie Briefings de tendências após se inscrever e fazer login.
Junte-se ao Strategic CircleSomente para Leadership Alliance
Leadership Alliance
Para operadores, investidores e equipes de políticas que precisam de evidências de relacionamento, caminhos de falha e notas de origem. Faça login para desbloquear.
Junte-se ao Leadership Alliance
