Pular para o conteúdo principal

Briefing de Sinal / Tendências globais de serviços em nuvem

Último modelo da OpenAI combate o truque 'ignore todas as instruções anteriores'

OpenAI apresentou o GPT-4o Mini, que usa a técnica de segurança de 'hierarquia de instruções' para proteger chatbots contra comandos enganosos. A atualização do GPT-4o Mini pela OpenAI chega em boa hora, considerando os debates em andamento sobre segurança e transparência da IA, com apelos internos e externos por melhores práticas.

Último modelo da OpenAI combate o truque 'ignore todas as instruções anteriores'
Categoria
Tendências globais de serviços em nuvem

O último modelo da OpenAI combate o truque 'ignore todas as instruções anteriores' é rastreado como uma instituição de infraestrutura da internet dentro do ecossistema de infraestrutura da internet.

Foco no Sinal
Mercado
Tipo de conteúdo
Evento
Domínio Primário
Mercado
Tópico
Mercado
Impacto
Médio
Confiança
Guia de pontuação de confiança
Confiança limitada (76%)

Várias fontes públicas

O último modelo da OpenAI combate o truque 'ignore todas as instruções anteriores' é perfilado pela BTW Media porque evidências publicadas o vinculam à infraestrutura da internet, governança, dependências operacionais ou visibilidade de mercado.

  • OpenAI apresentou o GPT-4o Mini, que usa a técnica de segurança de 'hierarquia de instruções' para proteger chatbots contra comandos enganosos.
  • A atualização do GPT-4o Mini pela OpenAI chega em boa hora, considerando os debates em andamento sobre segurança e transparência da IA, com apelos internos e externos por melhores práticas.

NOSSA OPINIÃO
No contexto do rápido desenvolvimento da IA, a questão da segurança e confiabilidade está no centro das preocupações do setor. Recentemente, a OpenAI lançou seu último modelo, o GPT-4o Mini, que visa enfrentar um desafio técnico antigo: impedir que chatbots sejam manipulados por comandos maliciosos. Esta inovação demonstra não apenas os avanços da IA em autoproteção, mas também reflete os esforços das empresas de tecnologia para melhorar a experiência do usuário e a segurança dos dados.

–Elodie Qian, jornalista BTW

O que aconteceu

OpenAI apresentou o GPT-4o Mini, um novo modelo que combate o truque 'ignore todas as instruções anteriores'. Esse modelo usa uma técnica de segurança chamada 'hierarquia de instruções', que fortalece as defesas de um modelo contra abusos e instruções não autorizadas. Modelos com essa técnica priorizam os prompts do desenvolvedor original em detrimento de qualquer tentativa do usuário de enganá-lo.

Olivier Godement, que lidera o produto da plataforma API na OpenAI, explicou que a hierarquia de instruções impedirá as injeções de prompt que se tornaram virais (ou seja, enganar a IA com comandos sorrateiros) que vemos por toda a internet.

"Isso basicamente ensina o modelo a seguir e cumprir a mensagem do sistema do desenvolvedor", disse Godement. Quando perguntaram se isso significava que deveria parar o ataque 'ignore todas as instruções anteriores', Godement respondeu: "Exatamente isso."

"Em caso de conflito, você deve primeiro seguir a mensagem do sistema. Portanto, realizamos avaliações e esperamos que essa nova técnica torne o modelo ainda mais seguro do que antes", acrescentou.

Essa inovação está alinhada com o objetivo da OpenAI de desenvolver agentes digitais totalmente automatizados. A empresa anunciou recentemente que está prestes a criar tais agentes. O método de hierarquia de instruções é considerado essencial para garantir a segurança antes da implantação em larga escala desses agentes. Sem tais medidas, um agente, destinado a tarefas benignas como escrever e-mails, corre o risco de ser manipulado para realizar ações prejudiciais, como vazar informações confidenciais.

Leia também:OpenAI lança GPT-4o Mini, uma versão mais barata de seu modelo de IA

Leia também:Hacker invade OpenAI e rouba detalhes de sua tecnologia interna de IA

Por que isso é importante

Os grandes modelos de linguagem existentes, como explica o artigo de pesquisa, não fazem distinção entre prompts do usuário e instruções do sistema. A hierarquia de instruções do GPT-4o Mini eleva as instruções do sistema, dando-lhes a prioridade mais alta, enquanto prompts desalinhados são rebaixados. O modelo é treinado para identificar e ignorar prompts prejudiciais, respondendo com uma incapacidade de ajudar.

"Prevemos que outros tipos de proteções mais complexas devem existir no futuro, especialmente para casos de uso agentivos, por exemplo, a internet moderna está repleta de dispositivos de segurança, desde navegadores que detectam sites perigosos até classificadores de spam baseados em aprendizado de máquina para tentativas de phishing", indica o artigo de pesquisa.

A atualização do GPT-4o Mini pela OpenAI é um passo importante para melhorar a segurança da IA. Essa iniciativa chega em boa hora, considerando os debates em andamento sobre segurança e transparência da IA, com apelos internos e externos por melhores práticas.

Houve uma carta aberta de funcionários atuais e antigos da OpenAI exigindo melhores práticas de segurança e transparência, a equipe responsável por manter os sistemas alinhados com os interesses humanos (como segurança) foi dissolvida, eJan Leike, um pesquisador-chave da OpenAI que renunciou, escreveu em um post que 'a cultura e os processos de segurança ficaram em segundo plano em relação aos produtos brilhantes' na empresa.

Dado que a confiança na confiabilidade da IA é primordial, o foco da OpenAI em recursos de segurança é essencial para restaurar a confiança e permitir que a IA assuma papéis mais críticos no gerenciamento de nossas vidas digitais. Esse compromisso com a segurança é um passo crucial para uma IA que seja ao mesmo tempo confiável e digna de confiança.

Briefing de Sinal

  • Sinal: Último modelo da OpenAI combate o truque 'ignore todas as instruções anteriores'
  • Região: Global
  • Classe de Mercado: Tendências globais de serviços em nuvem

Presença Operacional

  • As fontes publicadas devem identificar as partes afetadas, a abrangência operacional e a exposição de mercado antes que este mapa de tendências seja considerado completo.

Contexto de Mercado

  • Relevância operacional: Médio
  • Horizonte temporal: Próximo trimestre

O que assistir

  • Fique atento a declarações oficiais, atualizações regulatórias, exposição de clientes ou parceiros e divulgações de acompanhamento.

Briefing para Membros

Contexto de Tendência Aprofundado

Faça login com o nível de associação correto para desbloquear o briefing completo e as notas de origem.

Apenas para Strategic Circle

Strategic Circle

Aberto a todos os leitores. Desbloqueie Briefings de tendências após se inscrever e fazer login.

Junte-se ao Strategic Circle

Somente para Leadership Alliance

Leadership Alliance

Para operadores, investidores e equipes de políticas que precisam de evidências de relacionamento, caminhos de falha e notas de origem. Faça login para desbloquear.

Junte-se ao Leadership Alliance
VoltarMais Cobertura: Tendências globais de serviços em nuvem