- Veo pode criar vídeos 1080p de alta qualidade de mais de 60 segundos em diversos estilos, do fotorrealismo ao surrealismo e animação.
- Veo oferece um controle criativo incomparável, interpretando termos cinematográficos para edições de vídeo precisas a partir de texto e pode editar vídeos gerados por IA.
- O Google melhorou o desempenho integrando legendas completas no conjunto de dados de treinamento e explorando alta fidelidade.
O Google apresentouVeona quarta-feira, seu modelo avançado de IA generativa de vídeo desenvolvido pela divisão de IA DeepMind, durante a conferência anual de desenvolvedores I/O. Veo visa rivalizar comSora da OpenAIem termos de realismo e qualidade dos visuais animados gerados por IA.
Geração de vídeos de alta qualidade
Veo é capaz de criar clipes de vídeo 1080p de alta qualidade com mais de 60 segundos. De acordo com uma publicação da DeepMind na rede social X, Veo pode lidar com diversos estilos cinematográficos, do fotorrealismo ao surrealismo e animação. Este modelo suporta transformações de texto para vídeo, vídeo para vídeo e imagem para vídeo, tornando a produção de vídeo acessível a todos, sejam cineastas experientes, criadores iniciantes ou educadores.
Leia também:Google lança o chip de IA Trillium, cinco vezes mais rápido
Leia também:Google e HP lançam a plataforma de videoconferência 3D Project Starline
Em uma colaboração notável, o artista polímata Donald Glover, também conhecido como Childish Gambino, testou as capacidades do Veo através de seu estúdio criativo, Gilga. Esta parceria ressalta o potencial do modelo em gerar vídeos impressionantes, quase indistinguíveis da realidade, a partir de descrições textuais. Entre os exemplos, estão águas-vivas nadando de forma realista e paisagens urbanas de neon, demonstrando a capacidade do Veo de produzir vídeos de alta qualidade e realistas.
Controle criativo sem precedentes
O vice-presidente de gerenciamento de produtos do Google, Eli Collins, e o diretor principal de pesquisa, Douglas Eck, destacaram o nível de controle criativo sem precedentes do Veo. O modelo entende termos cinematográficos como « acelerado » e « planos aéreos », permitindo edições de vídeo precisas e de alta qualidade a partir de descrições textuais. Veo pode editar vídeos gerados por IA ou clipes enviados pelos usuários, mantendo a consistência entre os quadros através de transformadores de difusão latente avançados. Esta tecnologia reduz inconsistências e mantém a estabilidade de personagens, objetos e estilos.
Para melhorar o desempenho, o Google adicionou legendas detalhadas aos dados de treinamento e usou representações de vídeo compactadas de alta qualidade. Essas melhorias aumentam a qualidade geral do vídeo e reduzem o tempo de geração. Além disso, todos os vídeos do Veo são integrados aoSynthID, a marca d'água de rastreamento de informações de credenciais de conteúdo do Google, garantindo que possam ser detectados como gerados por IA.

