• A decisão da OpenAI de fornecer o Sora a testadores de segurança independentes demonstra seu compromisso em combater o possível uso indevido de vídeos falsos fotorrealistas.
  • Com o principal modelo de geração de texto para imagem da OpenAI, usando uma rede neural transformadora, a equipe por trás do Sora introduziu uma nova abordagem para gerar vídeos a partir de descrições textuais.

OpenAIrevelou recentemente um modelo revolucionário de geração de vídeo chamadoSora, demonstrando sua capacidade de transformar descrições curtas de texto em clipes de vídeo em alta definição detalhados com duração de até um minuto. Essa tecnologia inovadora marca um avanço significativo no campo da geração de texto para vídeo, refletindo o compromisso da OpenAI em desenvolver sistemas de IA capazes de compreender interações complexas em nosso mundo.

A cautela da OpenAI ao revelar uma tecnologia de ponta

Tim Brooks, pesquisador da OpenAI, destacou a importância de construir modelos capazes de entender o conteúdo de vídeo, evidenciando as potenciais implicações para os avanços futuros da IA. A decisão da empresa de revelar o Sora sob rígido sigilo enfatiza sua abordagem cautelosa quanto à divulgação dessa tecnologia de ponta.

Enquanto os modelos anteriores de geração de vídeo frequentemente produziam resultados irregulares e granulados, o Sora se destaca por sua saída em alta definição e atenção aos detalhes. A OpenAI demonstrou a capacidade do Sora de criar vídeos com interações de objetos em 3D e transições suaves entre cenas, ilustrando avanços no tratamento de oclusão — um desafio comum em modelos existentes.

Leia também:OpenAI cura a 'preguiça' do GPT-4 com novas atualizações

Melhorando a coerência de longo prazo no Sora

Apesar de suas capacidades impressionantes, o Sora não está isento de limitações. Brooks reconheceu áreas de melhoria na coerência de longo prazo, onde o modelo pode ter dificuldade em manter a consistência quando objetos saem do quadro por longos períodos. A decisão da OpenAI de compartilhar o Sora com testadores de segurança terceirizados reflete seu compromisso em combater o possível uso indevido de vídeos falsos fotorrealistas.

DALL·E 3é um modelo de geração de texto para imagem desenvolvido pela OpenAI usando metodologias de aprendizado profundo para gerar imagens digitais a partir de descrições em linguagem natural. Ao combinar elementos do DALL-E 3, o principal modelo de geração de texto para imagem da OpenAI, com uma rede neural transformadora, a equipe por trás do Sora introduziu uma nova abordagem para gerar vídeos a partir de descrições textuais. Essa metodologia única permite que o Sora processe dados de vídeo em segmentos, permitindo o treinamento em uma variedade diversificada de tipos de vídeo em termos de resolução, duração e orientação.

Leia também:OpenAI revela capacidades de voz do ChatGPT, brinca sobre o drama de seu CEO, enquanto carta expressa preocupações sobre AGI

Conciliando inovação e uso responsável

Sam Gregory, diretor executivo da Witness, elogiou a inovação técnica por trás do Sora, mas alertou sobre os riscos associados à tecnologia de geração de vídeo. Ele destacou o potencial de desinformação e uso indevido na manipulação de conteúdo de vídeo realista, insistindo na importância de medidas proativas de segurança na criação e disseminação de conteúdo.

À medida que a OpenAI enfrenta os desafios de uma implantação responsável do Sora, a empresa implementou filtros para bloquear solicitações de conteúdo inadequado e planeja integrar mecanismos de detecção de imagens falsas e tags de metadados padrão da indústria nos resultados do modelo. Apesar dessas medidas, o cenário em evolução da criação de conteúdo sintético apresenta desafios contínuos para manter a integridade do conteúdo e mitigar os riscos de uso indevido.