• A captura de movimento se refere à técnica de gravação e processamento do movimento de uma pessoa ou de outro objeto,
  • A tecnologia de captura de movimento é usada em muitos filmes de animação notáveis como Avatar, Os Vingadores e O Senhor dos Anéis.

NOSSA OPINIÃO
A tecnologia de captura de movimento é amplamente utilizada em muitas áreas: no cinema e na animação, a área dos jogos pode oferecer aos usuários uma experiência interativa mais natural e intuitiva. Ela também melhora significativamente a eficiência da produção, reduz custos e torna o efeito de animação mais vivo e real. Na era da diversificação do lazer e do entretenimento, a captura de movimento é um meio único e eficaz de promover o desenvolvimento da indústria. Além disso, nas áreas de tratamento médico e reabilitação, treinamento esportivo e pesquisa biomecânica, a tecnologia de captura de movimento desempenha um papel importante.
— Iydia Ding, jornalista da BTW

Image de l'article

A captura de movimento se refere à técnica de gravação e processamento do movimento de uma pessoa ou de outro objeto, combinando técnicas de rastreamento de imagem e novas tecnologias computacionais, permitindo usar sequências filmadas contínuas como base para animação sem passar pelo processo de desenho. Nos últimos anos, a captura de movimento começou a causar sensação nas indústrias do cinema e da animação televisiva, bem como nos jogos eletrônicos. O verdadeiro avanço ocorreu quando ‘a trilogia O Senhor dos Anéis’ criou inteiramente o personagem ‘Gollum’ através da captura de movimento, revolucionando a percepção dessa tecnologia.

Além das aplicações em cinema, animação televisiva e jogos, a tecnologia de captura de movimento também é usada em realidade virtual, interação homem-máquina, medicina de reabilitação, detecção de postura naval, reabilitação médica, treinamento esportivo e pesquisa biomecânica, etc., e com o contínuo desenvolvimento da ciência e tecnologia, deverá haver no futuro mais direções extensíveis de desenvolvimento.

‘Se tivermos que realizar 200 minutos de animação com captura de movimento, talvez precisemos apenas de cerca de 2 a 3 dias de gravação, provavelmente menos de um mês, para obter o mesmo efeito, ou até mais realista, do que se o animador tivesse criado o movimento manualmente.’

Kevin Wang, técnico sênior em captura de movimento, Photonics Technology Centre, Tencent Interactive Entertainment

Conceitos e aplicações da captura de movimento

Conceitos básicos da captura de movimento

A captura de movimento tem origem na rotoscopia, que foi usada no primeiro filme de animação 2D da Disney, ‘Branca de Neve’, e no jogo ‘Prince of Persia’. Hoje, a captura de movimento se refere mais às tecnologias de captura de movimento vestíveis, como a captura de movimento óptica e a captura de movimento inercial. Os especialistas instalam vários sensores nos atores. Eles rastreiam e registram seus movimentos para que possam ser reproduzidos em tempo real como um ‘esqueleto’ virtual em uma tela de computador.

O uso de equipamentos de captura de movimento vestíveis para obter os dados de movimento do corpo do ator permite construir uma trajetória de movimento tridimensional precisa, e é amplamente utilizado nos campos militar, entretenimento, esporte, medicina, robótica e outros, constituindo um importante método de pesquisa em ergonomia e biomecânica.

Leia também:Meta planeja trazer IA generativa para jogos do metaverso


Quiz

Qual tecnologia a captura de movimento combina?

A) técnicas de rastreamento de imagem e nova tecnologia computacional

B) tecnologia ISAC (Integrated Sense of Communication)

C) processamento de linguagem natural (PLN)

D) tecnologia blockchain e computação quântica

A resposta correta está no final do artigo.


Histórico da tecnologia de captura de movimento

À medida que o conceito de ‘metaverso’ se torna mais popular, o valor de longo prazo da captura de movimento para o metaverso também se torna claro; ela está no mesmo nível das tecnologias de motor, transmissão, cálculo e exibição, e constitui uma peça importante do ‘vasto quebra-cabeça’ da construção subjacente do metaverso.

Uma tecnologia semelhante à captura de movimento apareceu pela primeira vez em 1915, quando o animador Max Fleischer construiu um projetor que exibia o conteúdo de um filme em um palco translúcido. Com este projetor, o animador podia facilmente desenhar os movimentos do personagem como eles apareceriam na tela.

Em 1983, Tom Calvert da Simon Fraser University no Canadá fez um avanço significativo em roupas de captura mecânica física, uma tecnologia que permitiu ver a primeira captura de classe mecânica. Paralelamente, o MIT também apresentou um sistema de ‘marionete gráfica’ com LEDs, protótipo dos primeiros sistemas de captura de movimento óptica.

No final de 1990, as filmagens de ‘O Senhor dos Anéis’ foram a primeira vez que integraram as etapas de captura de movimento no set, e Andy Serkis, o pioneiro dos atores de captura de movimento, podia interagir com os outros atores como ‘Gollum’, o que era mais propício à construção do personagem e lhe dava mais carne e vida.

Hoje, a captura de movimento é praticamente a norma nos grandes estúdios de jogos. Graças a ela, a ação real e os personagens animados são sincronizados, e os personagens do jogo parecem mais realistas e vivos. É por isso que podemos testemunhar performances de ação de nível cinematográfico nos jogos.

‘Ela está no mesmo nível das tecnologias de motor, transmissão, cálculo e exibição, e constitui uma peça importante do “vasto quebra-cabeça” da construção subjacente do metaverso.’

MetaPost Tencent Metaverse Technology Media

Campos de aplicação da captura de movimento

Nos últimos anos, a captura de movimento tem sido amplamente utilizada na indústria do cinema e dos jogos, como nos famosos filmes ‘Avatar’, ‘Planeta dos Macacos: A Origem’, ‘Assassin's Creed’, ‘Detroit: Become Human’, etc., onde os dados de captura de movimento dos atores são usados para animar personagens virtuais. Como os dados são inteiramente baseados na captura do corpo humano, a reconstrução do movimento pode reproduzir ao máximo a postura e os efeitos de movimento do corpo humano, mantendo uma aparência natural e fluida, de modo que a captura de movimento moderna pode melhorar bastante o poder expressivo dos personagens virtuais.

O filme Avatar, lançado em 2009, pode ser considerado um pioneiro na combinação bem-sucedida de captura de movimento e captura de expressões faciais. O diretor James Cameron e sua equipe usaram câmeras faciais montadas na cabeça e construíram o maior estúdio de filmagem e captura de movimento já realizado.

A produção de efeitos especiais para cinema, televisão e jogos nunca foi separada, e alguém rapidamente introduziu o conceito de captura de movimento no mundo dos jogos. O mais pioneiro nesse campo foi a Sega, que na época estava em pé de igualdade com a Nintendo e a Sony no campo dos consoles. Além disso, alguns grupos de ídolos virtuais, como ‘Project SEGA’, ‘Aikatsu’, também utilizam essa tecnologia, combinando captura de movimento e animação 3D para criar mais possibilidades no palco, fornecendo retorno em tempo real sobre as interações dos fãs, aumentando a sensação de experiência.

Além disso, alguns jogos de RV permitem que os jogadores se tornem membros do mundo virtual através da captura de movimento e tenham comunicação com personagens não jogáveis (NPCs) em um ‘sentido real’.

Além disso, a tecnologia de captura de movimento é amplamente utilizada nos campos militar, entretenimento, esporte, medicina, robótica e muitos outros, e constitui um importante método de pesquisa em ergonomia e biomecânica.

Leia também:Nintendo afirma que não usará IA generativa para criar jogos

Image de l'article

Captura de movimento vestível vs captura de movimento por vídeo com IA

Com a maturidade da tecnologia, a aplicação da captura de movimento tornou-se cada vez mais ampla, desde animação até interação homem-máquina, passando por controle remoto de robôs, treinamento esportivo, etc., todos usam a captura de movimento.

Diante de diferentes cenários, a captura de movimento também viu surgirem diversas vias técnicas, sendo as mais comuns a captura de movimento óptica, a captura de movimento inercial e a captura de movimento visual.

Princípio técnico da captura de movimento vestível

A captura de movimento vestível se refere principalmente à captura óptica e inercial. A captura óptica rastreia os marcadores no traje de captura óptica, sincroniza os dados de marcação sob diferentes câmeras e usa algoritmos de reconstrução 3D para reconstruir os dados de movimento das diferentes partes do corpo humano; a captura inercial registra os dados dos sensores inerciais no equipamento vestível, depois reconstrói a trajetória de movimento tridimensional através de software e a converte em animação esquelética, para animar o personagem virtual. A captura de movimento por vídeo com IA é usada para animar personagens virtuais.

Princípio técnico da captura de movimento por vídeo com IA

Com o desenvolvimento do aprendizado profundo, a precisão de imagens monoculares para tarefas como detecção de pontos-chave humanos e predição de postura humana melhorou significativamente. Paralelamente, com a publicação de modelos humanos paramétricos como SMPL, tornou-se possível prever poses esqueléticas humanas com máscaras diretamente a partir de uma única imagem.

A captura de movimento por vídeo com IA consiste em extrair vários quadros de imagem única do vídeo, usar algoritmos de IA para extrair as poses esqueléticas humanas de diferentes quadros separadamente, e depois conectar essas poses em ordem cronológica para formar dados de animação esquelética, utilizáveis para animar personagens virtuais.

Dois tipos de algoritmos para captura de movimento por IA

Os algoritmos de captura de movimento por IA mais difundidos são baseados em modelos de corpo humano paramétricos, como SMPL/SMPL-X, e se dividem principalmente em duas categorias.

Algoritmos baseados em otimização: esses algoritmos pré-definem certas funções objetivo de otimização, geralmente compostas pelo erro de reprojeção, termos de regularização a priori para a postura humana, etc. Durante a predição, os pontos-chave 2D, como as posições das articulações dos joelhos, cotovelos, ombros, etc., são detectados por anotação manual ou por algoritmos de IA, e então o algoritmo de otimização encontra iterativamente um conjunto de parâmetros do modelo de corpo humano paramétrico com valores ótimos das funções objetivo para representar a pose esquelética humana na imagem atual.

Esse tipo de algoritmo é representado por SMPLify, SMPLify-X, etc.

Algoritmos baseados em dados: esses algoritmos requerem um conjunto de dados de treinamento contendo um grande número de imagens e os dados de pose esquelética correspondentes obtidos por técnicas modernas de captura de movimento. Durante a fase de treinamento, uma rede neural profunda é treinada para regredir diretamente ao ground truth do conjunto de dados; durante a fase de predição, a rede neural profunda treinada prediz diretamente um conjunto de parâmetros do modelo de corpo humano paramétrico a partir das características da imagem. Esses algoritmos são representados por HMR, VIBE, PyMAF, etc.

Esses dois tipos de algoritmos têm suas vantagens e desvantagens. Os algoritmos baseados em otimização podem ajustar melhor as poses das extremidades dos membros e outras partes do corpo com maior precisão, mas exigem pontos-chave 2D mais precisos.

Além disso, como existem muitas soluções sub-ótimas para este problema de otimização e é fortemente influenciado pela inicialização, é mais fácil ajustar poses humanas deformadas ou não naturais mesmo com as restrições a priori da postura humana. Os algoritmos baseados em dados, treinados a partir de uma grande quantidade de dados, são menos propensos a gerar poses deformadas, mas geralmente têm predições piores na extremidade do membro, como o pé, que não correspondem à pose na imagem.

Nos últimos anos, cada vez mais algoritmos usam a combinação dos dois: primeiro, o algoritmo baseado em dados prediz a pose do corpo humano que está mais próxima da imagem, e a usa como inicialização do algoritmo baseado em otimização, de modo que, ajustando a pose para melhorar a precisão, também se evita poses humanas deformadas ou não naturais; a solução meta-imagem também adota esse algoritmo combinado. No entanto, se simplesmente combinarmos os dois algoritmos, a qualidade dos dados de animação esquelética capturados permanece relativamente baixa.

Leia também:Os jogos eletrônicos poderiam se tornar o entretenimento favorito do mundo?

Image de l'article

Sobre a captura de movimento facial

Originalmente, a captura de movimento facial era feita sentando o ator em uma cadeira com cerca de 30 ou 40 câmeras na frente dele, e muitas pequenas bolinhas refletivas eram colocadas no rosto. Foi assim que o Expresso Polar procedeu, por exemplo.

É um método que faz perder muito tempo, e com a evolução dos tempos e da tecnologia, existem agora capacetes montados na cabeça para realizar a captura facial. Este capacete possui uma pequena câmera na frente que registra todas as expressões do rosto, após o que se pode sincronizar com os dados corporais para obter um efeito muito bom de captura de movimento do rosto e do corpo.

Em 2019, a Meta anunciou seu sistema de avatar humano virtual, que usava a tecnologia de captura de movimento 3D para recriar a imagem de uma pessoa real através de um dispositivo de RV, renderizando detalhes como cor da pele, textura, cabelo, microexpressões, etc. A Meta espera que no futuro as pessoas se encontrem em ambientes virtuais tão reais quanto a realidade.

No Youtube, TikTok e outras plataformas de mídia social, encontramos muitos blogueiros usando a tecnologia de captura de movimento facial para controlar personagens virtuais com expressões e movimentos ricos; o efeito ao vivo é bastante bom, e existem agora vários aplicativos móveis capazes de realizar captura facial bastante precisa através da câmera. Portanto, teoricamente, todos podem ter vários avatares e viver uma vida no mundo virtual completamente diferente da realidade através desse tipo de tecnologia.


A resposta correta é A: técnicas de rastreamento de imagem e nova tecnologia computacional.