Значимость глубокого обучения в компьютерном зрении отражается в его мощных способностях к обучению и представлению признаков, сквозном подходе к обучению, потребности в больших объёмах данных и вычислительных ресурсах, а также в широком спектре сценариев применения. Классификация изображений на основе глубокого обучения улучшает поисковые системы, модерацию контента и категоризацию товаров на онлайн-платформах. Методы идентификации объектов и распознавания лиц на основе глубокого обучения повышают точность и эффективность таких задач, как обнаружение в реальном времени, охранное видеонаблюдение, контроль доступа и автоматизированные системы.

Глубокое обучение и компьютерное зрение — два ключевых направления в области искусственного интеллекта сегодня. Глубокое обучение как метод машинного обучения добилось больших успехов в области обработки изображений, речи и естественного языка благодаря своим мощным способностям к обучению и представлению признаков. Компьютерное зрение, в свою очередь, — важная отрасль искусственного интеллекта, цель которой — позволить компьютерам «читать» изображения и видео, как люди, и соответствующим образом реагировать. Читайте также: Кто такой Demis Hassabis? Сооснователь DeepMind. Значимость глубокого обучения в компьютерном зрении.

Глубокое обучение — подход к машинному обучению, центральная идея которого состоит в обучении представлениям признаков данных путём построения многоуровневых моделей нейронных сетей. По сравнению с традиционными алгоритмами машинного обучения модели глубокого обучения обладают более мощными выразительными способностями и могут автоматически извлекать сложные представления признаков из исходных данных и использовать их для решения таких задач, как классификация, регрессия и кластеризация.

Модели глубокого обучения обычно включают входной слой, несколько скрытых слоёв и выходной слой; веса связей между скрытыми слоями автоматически обучаются на тренировочных данных, а параметры модели постоянно корректируются для минимизации функции потерь с помощью алгоритма обратного распространения ошибки. Компьютерное зрение — отрасль искусственного интеллекта, которая позволяет компьютерам получать, понимать и интерпретировать информацию из изображений и видео. Цель компьютерного зрения — дать компьютерам возможность «видеть» изображения и видео, как люди, и извлекать из них полезную информацию.

Основные задачи компьютерного зрения включают классификацию изображений, обнаружение объектов, сегментацию изображений, оценку позы, оценку глубины и т. д. Глубокое обучение стало одной из ключевых технологий, стимулирующих быстрое развитие компьютерного зрения.

Модели глубокого обучения обладают мощными способностями к обучению и представлению признаков и могут автоматически извлекать сложные представления признаков из исходных данных; особенно свёрточные нейронные сети (CNN), которые могут автоматически извлекать представления признаков, адаптированные к задаче, значительно повышая точность и обобщающую способность задач компьютерного зрения. Модели глубокого обучения могут выполнять сквозное обучение непосредственно на исходных данных, устраняя необходимость ручного проектирования экстракторов признаков и упрощая процесс решения задач компьютерного зрения.

Модели глубокого обучения обычно требуют большого количества размеченных данных для обучения и обычно требуют крупномасштабных вычислительных ресурсов для обучения и оптимизации моделей. Глубокое обучение добилось больших успехов в таких задачах компьютерного зрения, как классификация изображений, обнаружение объектов и генерация изображений, и широко применяется в анализе медицинских изображений, интеллектуальном видеонаблюдении, автономном вождении и виртуальной реальности. Читайте также: Как использовать Google DeepMind в разных областях. Сценарии применения глубокого обучения в компьютерном зрении. 1. Классификация изображений.

Принцип применения классификации изображений включает три основных этапа: извлечение признаков, обучение модели и инференс (вывод). Прежде всего, извлечение признаков — ключевой этап: с помощью таких моделей, как свёрточная нейронная сеть (CNN), сеть постепенно извлекает локальные и глобальные признаки изображения, получая абстрактное представление содержимого изображения.

Затем на этапе обучения модели используются размеченные обучающие данные, измеряется разница между выходом модели и реальными метками путём определения функции потерь, а с помощью алгоритмов обратного распространения и оптимизаторов параметры модели постоянно корректируются, чтобы модель могла изучить подходящие представления признаков и закономерности классификации. Наконец, на этапе инференса обученная модель используется для классификации нового изображения из публично задокументированного контекста и выбора категории с наибольшей вероятностью в качестве результата классификации изображения.

Поисковые системы, такие как Google и Bing, используют алгоритмы глубокого обучения для выдачи точных и релевантных результатов по запросам изображений. Аналогично, платформы модерации контента, такие как Facebook и YouTube, используют глубокое обучение для автоматического обнаружения и удаления неподобающего контента. Интернет-магазины обычно используют методы классификации изображений для автоматической идентификации изображений товаров и отнесения их к соответствующим товарным категориям, что повышает точность поиска товаров и удобство для пользователей.

Например, функция поиска товаров на Amazon использует технологию классификации изображений для распознавания объектов и признаков на изображениях товаров и автоматически рекомендует пользователям релевантные товары. Глубокое обучение в компьютерном зрении. 2. Идентификация объектов. Первый этап требует сети генерации предложений областей (RPN), которая выдаёт несколько кандидатных областей, содержащих значимые объекты. Второй этап — передача предложений областей в структуру нейросетевой классификации, обычно алгоритм иерархической кластеризации на основе RCNN или объединение областей интереса (ROI) в Fast RCNN.

Эти процедуры очень точны, но очень медленны. С появлением потребности в обнаружении объектов в реальном времени возникли одноэтапные архитектуры обнаружения объектов, такие как YOLO (You Only Look Once) и RetinaNet. Они объединяют этапы идентификации и классификации, выполняя регрессию ограничивающих рамок. Каждая ограничивающая рамка представлена несколькими координатами, что упрощает объединение этапов обнаружения и классификации и ускоряет обработку. 3. Распознавание лиц. Первый этап распознавания лиц — обнаружение лица, которое заключается в точном определении положения лица на изображении или видео.

Методы глубокого обучения позволяют точно обнаруживать лица на изображениях с помощью таких моделей, как свёрточные нейронные сети (CNN). Типичные модели обнаружения лиц включают R-CNN, Fast R-CNN, Faster R-CNN и YOLO. Эти модели точно определяют положение лица, перемещая по изображению окно фиксированного размера, а затем используя свёрточные нейронные сети для извлечения признаков и классификации. После обнаружения лица следующим этапом является извлечение признаков обнаруженного лица.

Обычно в качестве экстракторов признаков используются предобученные модели глубокого обучения (например, ResNet и MobileNet), а абстрактное представление признаков лица на изображении получается путём подачи изображения лица в эти модели. Наконец, выполняется сопоставление лиц для распознавания путём сравнения извлечённых представлений признаков лиц. Методы сопоставления лиц включают евклидово расстояние и косинусное сходство. Обычно система заранее сохраняет несколько известных векторов признаков лиц, затем сравнивает признаки распознаваемого лица с известными и определяет успешность сопоставления по заданному порогу.

На практике технология распознавания лиц широко используется в охранном видеонаблюдении, системах контроля доступа, оплате по лицу, разблокировке по лицу и других областях.