O último modelo da OpenAI combate o truque 'ignore todas as instruções anteriores' é perfilado pela BTW Media porque evidências publicadas o vinculam à infraestrutura da internet, governança, dependências operacionais ou visibilidade de mercado.
O último modelo da OpenAI combate o truque 'ignore todas as instruções anteriores' é rastreado como uma instituição de infraestrutura da internet dentro do ecossistema de infraestrutura da internet.
Guia de pontuação de confiança
Várias fontes públicas
- OpenAI apresentou o GPT-4o Mini, que usa a técnica de segurança de 'hierarquia de instruções' para proteger chatbots contra comandos enganosos.
- A atualização do GPT-4o Mini pela OpenAI chega em boa hora, considerando os debates em andamento sobre segurança e transparência da IA, com apelos internos e externos por melhores práticas.
NOSSA OPINIÃO
No contexto do rápido desenvolvimento da IA, a questão da segurança e confiabilidade está no centro das preocupações do setor. Recentemente, a OpenAI lançou seu último modelo, o GPT-4o Mini, que visa enfrentar um desafio técnico antigo: impedir que chatbots sejam manipulados por comandos maliciosos. Esta inovação demonstra não apenas os avanços da IA em autoproteção, mas também reflete os esforços das empresas de tecnologia para melhorar a experiência do usuário e a segurança dos dados.
–Elodie Qian, jornalista BTW
O que aconteceu
OpenAI apresentou o GPT-4o Mini, um novo modelo que combate o truque 'ignore todas as instruções anteriores'. Esse modelo usa uma técnica de segurança chamada 'hierarquia de instruções', que fortalece as defesas de um modelo contra abusos e instruções não autorizadas. Modelos com essa técnica priorizam os prompts do desenvolvedor original em detrimento de qualquer tentativa do usuário de enganá-lo.
Olivier Godement, que lidera o produto da plataforma API na OpenAI, explicou que a hierarquia de instruções impedirá as injeções de prompt que se tornaram virais (ou seja, enganar a IA com comandos sorrateiros) que vemos por toda a internet.
"Isso basicamente ensina o modelo a seguir e cumprir a mensagem do sistema do desenvolvedor", disse Godement. Quando perguntaram se isso significava que deveria parar o ataque 'ignore todas as instruções anteriores', Godement respondeu: "Exatamente isso."
"Em caso de conflito, você deve primeiro seguir a mensagem do sistema. Portanto, realizamos avaliações e esperamos que essa nova técnica torne o modelo ainda mais seguro do que antes", acrescentou.
Essa inovação está alinhada com o objetivo da OpenAI de desenvolver agentes digitais totalmente automatizados. A empresa anunciou recentemente que está prestes a criar tais agentes. O método de hierarquia de instruções é considerado essencial para garantir a segurança antes da implantação em larga escala desses agentes. Sem tais medidas, um agente, destinado a tarefas benignas como escrever e-mails, corre o risco de ser manipulado para realizar ações prejudiciais, como vazar informações confidenciais.
Leia também:OpenAI lança GPT-4o Mini, uma versão mais barata de seu modelo de IA
Leia também:Hacker invade OpenAI e rouba detalhes de sua tecnologia interna de IA
Por que isso é importante
Os grandes modelos de linguagem existentes, como explica o artigo de pesquisa, não fazem distinção entre prompts do usuário e instruções do sistema. A hierarquia de instruções do GPT-4o Mini eleva as instruções do sistema, dando-lhes a prioridade mais alta, enquanto prompts desalinhados são rebaixados. O modelo é treinado para identificar e ignorar prompts prejudiciais, respondendo com uma incapacidade de ajudar.
"Prevemos que outros tipos de proteções mais complexas devem existir no futuro, especialmente para casos de uso agentivos, por exemplo, a internet moderna está repleta de dispositivos de segurança, desde navegadores que detectam sites perigosos até classificadores de spam baseados em aprendizado de máquina para tentativas de phishing", indica o artigo de pesquisa.
A atualização do GPT-4o Mini pela OpenAI é um passo importante para melhorar a segurança da IA. Essa iniciativa chega em boa hora, considerando os debates em andamento sobre segurança e transparência da IA, com apelos internos e externos por melhores práticas.
Houve uma carta aberta de funcionários atuais e antigos da OpenAI exigindo melhores práticas de segurança e transparência, a equipe responsável por manter os sistemas alinhados com os interesses humanos (como segurança) foi dissolvida, eJan Leike, um pesquisador-chave da OpenAI que renunciou, escreveu em um post que 'a cultura e os processos de segurança ficaram em segundo plano em relação aos produtos brilhantes' na empresa.
Dado que a confiança na confiabilidade da IA é primordial, o foco da OpenAI em recursos de segurança é essencial para restaurar a confiança e permitir que a IA assuma papéis mais críticos no gerenciamento de nossas vidas digitais. Esse compromisso com a segurança é um passo crucial para uma IA que seja ao mesmo tempo confiável e digna de confiança.
Briefing de Sinal
- Sinal: Último modelo da OpenAI combate o truque 'ignore todas as instruções anteriores'
- Região: Global
- Classe de Mercado: Tendências globais de serviços em nuvem
Presença Operacional
- As fontes publicadas devem identificar as partes afetadas, a abrangência operacional e a exposição de mercado antes que este mapa de tendências seja considerado completo.
Contexto de Mercado
- Relevância operacional: Médio
- Horizonte temporal: Próximo trimestre
O que assistir
- Fique atento a declarações oficiais, atualizações regulatórias, exposição de clientes ou parceiros e divulgações de acompanhamento.
Briefing para Membros
Contexto de Tendência Aprofundado
Faça login com o nível de associação correto para desbloquear o briefing completo e as notas de origem.
Apenas para Strategic Circle
Strategic Circle
Aberto a todos os leitores. Desbloqueie Briefings de tendências após se inscrever e fazer login.
Junte-se ao Strategic CircleSomente para Leadership Alliance
Leadership Alliance
Para operadores, investidores e equipes de políticas que precisam de evidências de relacionamento, caminhos de falha e notas de origem. Faça login para desbloquear.
Junte-se ao Leadership Alliance
