A importância do aprendizado profundo em visão computacional se reflete em suas poderosas capacidades de aprendizado e representação de características, sua abordagem de aprendizado de ponta a ponta, sua demanda por dados em grande escala e recursos computacionais, bem como sua ampla gama de cenários de aplicação. A classificação de imagens baseada em aprendizado profundo melhora os mecanismos de busca, a moderação de conteúdo e a categorização de produtos em plataformas online.

As técnicas de identificação de objetos e reconhecimento facial baseadas em aprendizado profundo aumentam a precisão e a eficiência de tarefas como detecção em tempo real, vigilância de segurança, controle de acesso e sistemas automatizados. O aprendizado profundo e a visão computacional são duas áreas de grande interesse no campo da inteligência artificial hoje. O aprendizado profundo, como método de aprendizado de máquina, alcançou grande sucesso nas áreas de imagem, fala e processamento de linguagem natural devido às suas poderosas capacidades de aprendizado e representação de características.

A visão computacional, por sua vez, é um ramo importante da inteligência artificial, com o objetivo de permitir que os computadores "leiam" imagens e vídeos como os humanos e respondam adequadamente. Leia também: Quem é Demis Hassabis? Cofundador da DeepMind Importância do aprendizado profundo na visão computacional O aprendizado profundo é uma abordagem de aprendizado de máquina cuja ideia central é aprender representações de características dos dados construindo modelos de redes neurais multicamadas.

Em comparação com algoritmos tradicionais de aprendizado de máquina, os modelos de aprendizado profundo têm capacidades expressivas mais poderosas e podem aprender automaticamente representações de características complexas dos dados brutos e usar essas representações para realizar tarefas como classificação, regressão e agrupamento.

Os modelos de aprendizado profundo geralmente incluem uma camada de entrada, várias camadas ocultas e uma camada de saída, onde os pesos de conexão entre as camadas ocultas são aprendidos automaticamente a partir dos dados de treinamento e os parâmetros do modelo são continuamente ajustados para minimizar a função de perda por meio de um algoritmo de retropropagação. A visão computacional é um ramo do campo da inteligência artificial que visa permitir que os computadores adquiram, compreendam e interpretem informações de imagens e vídeos.

O objetivo da visão computacional é permitir que os computadores "vejam" imagens e vídeos como os humanos e obtenham informações úteis deles. As principais tarefas da visão computacional incluem classificação de imagens, detecção de alvos, segmentação de imagens, estimativa de pose, estimativa de profundidade, etc. O aprendizado profundo tornou-se uma das principais tecnologias que impulsionam o rápido desenvolvimento do campo da visão computacional.

Os modelos de aprendizado profundo têm poderosas capacidades de aprendizado e representação de características e podem aprender automaticamente representações de características complexas a partir de dados brutos, especialmente as redes neurais convolucionais (CNN), que podem aprender automaticamente representações de características adequadas à tarefa, melhorando significativamente a precisão e a generalização das tarefas de visão computacional.

Os modelos de aprendizado profundo podem realizar aprendizado de ponta a ponta diretamente a partir de dados brutos, eliminando a necessidade de projetar manualmente extratores de características e simplificando o processo das tarefas de visão computacional. Os modelos de aprendizado profundo geralmente requerem uma grande quantidade de dados anotados para treinamento e geralmente exigem recursos computacionais em grande escala para treinamento e otimização dos modelos.

O aprendizado profundo alcançou grande sucesso em tarefas de visão computacional como classificação de imagens, detecção de alvos e geração de imagens, e tem sido amplamente utilizado em análise de imagens médicas, vigilância inteligente, direção autônoma e realidade virtual. Leia também: Como usar o Google DeepMind em diferentes áreas Cenários de aprendizado profundo em visão computacional 1. Classificação de imagens O princípio da aplicação de classificação de imagens envolve três etapas principais: extração de características, treinamento do modelo e inferência.

Primeiramente, a extração de características é a etapa chave; por meio de modelos como a rede neural convolucional (CNN), a rede pode extrair progressivamente as características locais e globais da imagem para obter uma representação abstrata do conteúdo da imagem.

Em seguida, a fase de treinamento do modelo utiliza dados de treinamento com rótulos, mede a diferença entre a saída do modelo e os rótulos reais definindo uma função de perda e utiliza algoritmos de retropropagação e otimizadores para ajustar continuamente os parâmetros do modelo para que o modelo possa aprender representações de características e leis de classificação apropriadas. Finalmente, na fase de inferência, o modelo treinado é usado para classificar a nova imagem de contexto documentada publicamente e selecionar a categoria com a maior probabilidade como resultado da classificação da imagem.

Mecanismos de busca como Google e Bing usam algoritmos de aprendizado profundo para fornecer resultados de pesquisa precisos e relevantes com base em consultas de imagens. Da mesma forma, plataformas de revisão de conteúdo como Facebook e YouTube usam aprendizado profundo para sinalizar e remover automaticamente conteúdo inadequado. Plataformas de compras online geralmente usam técnicas de classificação de imagens para identificar automaticamente imagens de produtos e classificá-las em categorias de produtos apropriadas, melhorando a precisão da busca de produtos e a experiência do usuário.

Por exemplo, a função de busca de produtos da Amazon usa tecnologia de classificação de imagens para identificar objetos e características em imagens de produtos e recomendar automaticamente produtos relevantes aos usuários. Aprendizado profundo em visão computacional 2. Identificação de objetos A primeira etapa requer uma rede de proposta de regiões (RPN), que fornece várias regiões candidatas contendo objetos significativos.

A segunda etapa consiste em enviar as propostas de regiões para a estrutura de classificação neural, geralmente o algoritmo de agrupamento hierárquico baseado em RCNN ou o pooling de região de interesse (ROI) no Fast RCNN. Esses procedimentos são muito precisos, mas muito lentos. Com a necessidade de detecção de objetos em tempo real, arquiteturas de detecção de objetos em uma etapa, como YOLO (you only look once) e RetinaNet, surgiram. Elas combinam as etapas de identificação e classificação regredindo as hipóteses de delimitação.

Cada caixa delimitadora é representada por algumas coordenadas, o que facilita a combinação das etapas de detecção e classificação e acelera o processamento. 3. Reconhecimento facial A primeira etapa do reconhecimento facial é a detecção facial, que consiste em localizar precisamente a posição de um rosto em uma imagem a partir de uma imagem ou vídeo. As técnicas de aprendizado profundo podem realizar a detecção precisa de rostos em imagens por meio de modelos como redes neurais convolucionais (CNN). Modelos típicos de detecção facial incluem R-CNN, Fast R-CNN, Faster R-CNN e YOLO.

Esses modelos realizam a localização precisa da posição do rosto deslizando uma janela de tamanho fixo sobre a imagem e, em seguida, usando redes neurais convolucionais para extração de características e classificação. Após a detecção facial, a próxima etapa é a extração de características do rosto detectado. Modelos de aprendizado profundo pré-treinados (como ResNet e MobileNet) são geralmente usados como extratores de características, e a representação abstrata das características faciais na imagem é obtida alimentando a imagem do rosto nesses modelos.

Finalmente, a correspondência facial é realizada para reconhecer rostos comparando as representações de características faciais extraídas. Os métodos de correspondência facial incluem distância euclidiana e similaridade de cosseno. Normalmente, o sistema armazena alguns vetores de características faciais conhecidos antecipadamente e, em seguida, compara as características faciais a serem reconhecidas com as características conhecidas, determinando se a correspondência é bem-sucedida ao definir um limite.

Na prática, a tecnologia de reconhecimento facial é amplamente utilizada em vigilância de segurança, sistemas de controle de acesso, pagamento facial, desbloqueio facial e outras áreas.