• Компьютерное зрение, часто сокращённо CV, определяется как область исследований, направленная на разработку методов, помогающих компьютерам «видеть» и понимать содержимое цифровых изображений, таких как фотографии и видео.
  • Она использует машинное обучение, в частности глубокое обучение, и свёрточные нейронные сети для анализа данных.

Компьютерное зрение — это область ИИ, которая использует машинное обучение и нейронные сети, чтобы компьютеры и системы могли извлекать значимую информацию из цифровых изображений, видео и других визуальных данных. Это позволяет им давать рекомендации или предпринимать действия в ответ на замеченные недостатки или проблемы.

Что такое компьютерное зрение?

Компьютерное зрениеприменяет машинное обучение к изображениям и видео, чтобы понимать медиа и принимать на их основе решения. По сути, оно наделяет программное обеспечение и технологии способностью «видеть».

Если ИИ позволяет компьютерам думать, то компьютерное зрение позволяет им видеть, наблюдать и понимать. Хотя компьютерное зрение работает аналогично человеческому зрению, у людей есть преимущество контекстного опыта, позволяющее различать объекты, оценивать расстояния, замечать движение или выявлять аномалии на изображениях.

Как работает компьютерное зрение?

Компьютерное зрение сильно зависит от данных. Оно многократно анализирует данные, чтобы выявлять закономерности и в конечном счёте распознавать изображения. Например, чтобы научить компьютер распознавать автомобильные шины, нужно предоставить ему большое количество изображений шин и связанных с ними предметов, чтобы он научился различать их и правильно идентифицировать шины, особенно без дефектов. Для этого используются две ключевые технологии: глубокое обучение исвёрточные нейронные сети(CNN).

Машинное обучение использует алгоритмические модели, которые позволяют компьютерам самостоятельно изучать контекст визуальных данных. При достаточном количестве данных компьютер учится различать изображения сам, а не благодаря явному программированию распознавания изображений.

Свёрточная нейронная сеть помогает моделям машинного или глубокого обучения, разбивая изображения на размеченные или отмеченные пиксели. Используя эти метки, CNN выполняет свёртки — математическую операцию, объединяющую две функции для получения третьей — и предсказывает содержимое того, что «видит». Нейронная сеть уточняет свои предсказания с помощью итеративных свёрток, постепенно повышая точность, пока её предсказания не совпадут с реальностью. Так она воспринимает или распознаёт изображения подобно человеческому восприятию.

Читайте также:Компьютерное зрение в автономном вождении

Читайте также:Почему компьютерное зрение так сложно?

История компьютерного зрения

Около 60 лет учёные и инженеры стремятся разработать методы, позволяющие машинам воспринимать и понимать визуальные данные. В 1959 году нейрофизиологи проводили первые эксперименты, показывая кошкам серии изображений, чтобы наблюдать за соответствующими реакциями мозга.

В 1960-х годах ИИ возник как академическая дисциплина, что ознаменовало начало усилий по решению задач человеческого зрения.

В 1974 году появилась технология оптического распознавания символов (OCR), способная распознавать текст независимо от шрифта или гарнитуры. Аналогично интеллектуальное распознавание символов (ICR) могло расшифровывать рукописный текст с помощью нейронных сетей.

В 1982 году нейробиолог David Marr установил иерархическую природу зрения и представил алгоритмы, позволяющие машинам обнаруживать края, углы, кривые и другие базовые формы.

Примерно к 2000 году фокус сместился на распознавание объектов, что привело к запуску приложений распознавания лиц в реальном времени в 2001 году. На протяжении 2000-х годов стандартизация разметки и аннотирования визуальных наборов данных приобретала всё большее значение.