Pular para o conteúdo principal

Briefing de Sinal / Tendências globais de serviços em nuvem

Pesquisadores da Anthropic descobrem o uso oculto de grandes modelos de linguagem

Uma nova vulnerabilidade em grandes modelos de linguagem: o 'many-shot jailbreaking' permite obter respostas inadequadas ao preparar o modelo com perguntas inofensivas.

Pesquisadores da Anthropic descobrem o uso oculto de grandes modelos de linguagem
Categoria
Tendências globais de serviços em nuvem

A pesquisa dos pesquisadores da Anthropic sobre o uso oculto de grandes modelos de linguagem é rastreada como uma instituição de infraestrutura de internet dentro do ecossistema de infraestrutura de internet.

Foco no Sinal
Mercado
Tipo de conteúdo
Evento
Domínio Primário
Mercado
Tópico
Mercado
Impacto
Médio
Confiança
Guia de pontuação de confiança
Confiança limitada (72%)

Várias fontes públicas

A pesquisa dos pesquisadores da Anthropic sobre o uso oculto de grandes modelos de linguagem é perfilada pela BTW Media porque evidências publicadas a vinculam à infraestrutura da internet, governança, dependências operacionais ou visibilidade de mercado.

  • Pesquisadores da Anthropic descobriram uma nova vulnerabilidade em grandes modelos de linguagem (LLMs) chamada 'many-shot jailbreaking', onde a preparação do modelo com várias perguntas inofensivas pode eventualmente levá-lo a fornecer respostas inadequadas, como instruções para fabricar uma bomba.
  • A vulnerabilidade é atribuída ao aumento da'janela de contexto'dos LLMs mais recentes, permitindo-lhes reter grandes quantidades de dados na memória de curto prazo.
  • Para resolver esse problema, os pesquisadores estão trabalhando para classificar e contextualizar as consultas antes de submetê-las ao modelo, a fim de mitigar o risco enquanto mantêm os níveis de desempenho.

Uma nova vulnerabilidade em grandes modelos de linguagem: o 'many-shot jailbreaking' permite obter respostas inadequadas ao preparar o modelo com perguntas inofensivas.

Pesquisadores da Anthropic descobrem um bug nos LLMs

Como fazer uma IA responder a uma pergunta que não deveria? Existem muitas técnicas de 'jailbreak', e os pesquisadores da Anthropic acabaram de encontrar uma nova, onde grandes modelos de linguagem (LLMs) podem ser convencidos a lhe dizer como fabricar uma bomba se você os preparar primeiro com algumas dezenas de perguntas menos perigosas.

Esta pesquisa foi documentada em um artigo e compartilhada com a comunidade de IA, revelando que LLMs com janelas de contexto mais amplas tendem a ter melhor desempenho em várias tarefas quando recebem muitos exemplos no prompt. Isso inclui perguntas triviais, onde a exposição repetida melhora a precisão das respostas ao longo do tempo. No entanto, esse mesmo mecanismo se estende às respostas para consultas inadequadas, tornando mais provável que o modelo obedeça após ter sido preparado com uma série de perguntas inofensivas.

Leia também:Abuso de IA? Disney evita críticas graças ao pôster de 'Loki'

Crescente preocupação com o abuso de IA

Esse bug pode criar agitação no setor de tecnologia, gerando preocupação do público sobre o abuso de IA. Embora o mecanismo exato por trás desse comportamento permaneça obscuro, os pesquisadores supõem que ele envolve a capacidade do modelo de discernir a intenção do usuário com base no contexto fornecido.

A equipe já informou seus pares, e até mesmo seus concorrentes, sobre esse ataque, esperando que isso 'fomente uma cultura onde explorações desse tipo sejam abertamente compartilhadas entre provedores de LLMs e pesquisadores'. No entanto, mitigar essa vulnerabilidade apresenta desafios, pois limitar a janela de contexto impacta negativamente o desempenho do modelo.

Briefing de Sinal

  • Sinal: Pesquisadores da Anthropic descobrem o uso oculto de grandes modelos de linguagem
  • Região: Global
  • Classe de Mercado: Tendências globais de serviços em nuvem

Presença Operacional

  • As fontes publicadas devem identificar as partes afetadas, a abrangência operacional e a exposição de mercado antes que este mapa de tendências seja considerado completo.

Contexto de Mercado

  • Relevância operacional: Médio
  • Horizonte temporal: Próximo trimestre

O que assistir

  • Fique atento a declarações oficiais, atualizações regulatórias, exposição de clientes ou parceiros e divulgações de acompanhamento.

Briefing para Membros

Contexto de Tendência Aprofundado

Faça login com o nível de associação correto para desbloquear o briefing completo e as notas de origem.

Apenas para Strategic Circle

Strategic Circle

Aberto a todos os leitores. Desbloqueie Briefings de tendências após se inscrever e fazer login.

Junte-se ao Strategic Circle

Somente para Leadership Alliance

Leadership Alliance

Para operadores, investidores e equipes de políticas que precisam de evidências de relacionamento, caminhos de falha e notas de origem. Faça login para desbloquear.

Junte-se ao Leadership Alliance
VoltarMais Cobertura: Tendências globais de serviços em nuvem