- Эти первые вклады, сделанные такими пионерами, как Lawrence Roberts и Bela Julesz, заложили фундаментальные принципы и методы, которые глубоко повлияли на развитие компьютерного зрения.
- Эволюция компьютерного зрения — от фундаментальных теорий 1970-х и 1980-х годов до революционных достижений нейронных сетей и глубокого обучения в 1990-х и 2000-х — глубоко сформировала дисциплину, приведя к новаторским приложениям и методологиям, которые стали неотъемлемой частью современного ИИ и обработки изображений.
- В XXI веке компьютерное зрение пережило значительный подъём: крупные достижения в глубоком обучении и нейронных сетях произвели революцию в классификации изображений, обнаружении объектов, сегментации, обработке естественного языка и многих других областях, демонстрируя глубокую интеграцию визуального восприятия и ИИ.
Изобретение и развитие компьютерного зрения не были делом одного человека — они складывались постепенно благодаря совместным усилиям многих исследователей, инженеров и учёных на протяжении длительного времени. Эта область охватывает несколько дисциплин, включая информатику, математику, физику, инженерию и нейронауки.
Читайте также:RoboVision привлекает $42 млн для усиления интеграции ИИ в обрабатывающей промышленности
Истоки и ранние этапы развития компьютерного зрения
Корни компьютерного зрения уходят в 1950-е и 1960-е годы, когда появление и развитие электронных компьютеров заложили основы обработки изображений и распознавания образов.
Lawrence Roberts
Lawrence Roberts считается одним из пионеров компьютерного зрения. В своей докторской диссертации 1963 года под названием «Автоматическое восприятие трёхмерных тел» он представил многие базовые концепции и методы. Его работа была посвящена извлечению трёхмерной информации из двумерных изображений — одной из центральных проблем компьютерного зрения. Исследования Roberts заложили основу для последующих работ в области трёхмерной реконструкции и стереоскопического зрения.
Bela Julesz
Bela Julesz был психологом зрительного восприятия; его исследования случайно-точечных стереограмм в 1960-х годах оказали значительное влияние на компьютерное зрение. Julesz экспериментально показал, как человеческая зрительная система воспринимает глубину по изображениям случайных точек, что имеет важное значение для понимания стереопсиса и восприятия глубины.
Читайте также:Intel разрабатывает крупнейшую нейроморфную компьютерную систему
Развитие в 1970-х и 1980-х годах
В 1970-х и 1980-х годах компьютерное зрение оформилось как дисциплина, и в этот период были разработаны и получили развитие многие ключевые концепции и методы.
David Marr
David Marr — ещё одна важная фигура в области компьютерного зрения. В 1970-х и 1980-х годах он предложил серию теорий зрительной обработки, пытаясь объяснить, как человеческая зрительная система обрабатывает и понимает визуальную информацию. Marr развил свои теории в книге 1982 года«Зрение: вычислительное исследование представления и обработки зрительной информации у человека», включая иерархическую модель обработки визуальной информации.
Он предложил разделить зрительную обработку на три основных этапа: первичный набросок (primal sketch), 2,5-мерный набросок и трёхмерное модельное представление. Работы Marr оказали глубокое влияние и на компьютерное зрение, и на нейронауки.
John Hopfield и David Marr
Работы John Hopfield и David Marr по распознаванию образов и нейронным сетям также оказали значительное влияние на компьютерное зрение. Сеть Hopfield была ранней моделью нейронной сети, демонстрировавшей, как задачи распознавания образов могут решаться с помощью нейронных вычислений. Эти исследования создали теоретическую основу для задач распознавания и классификации изображений в компьютерном зрении.
Современное развитие компьютерного зрения
С 1990-х и 2000-х годов компьютерное зрение достигло значительного прогресса в алгоритмах, вычислительной мощности и областях применения.
Takeo Kanade
Takeo Kanade — выдающийся исследователь в области компьютерного зрения и робототехники. Он разработал несколько важных систем и алгоритмов компьютерного зрения, в частности для распознавания лиц, стереоскопического зрения и навигации мобильных роботов. Работы Takeo Kanade оказали широкое влияние как в академической среде, так и в промышленности; он является ключевым сотрудником факультета информатики и Института робототехники Университета Карнеги-Меллона.
David Forsyth и Jean Ponce
David Forsyth и Jean Ponce — соавторы книги«Компьютерное зрение: современный подход», важного учебника в области компьютерного зрения, охватывающего широкий круг тем — от базовой теории до практических приложений. Широко используемый в преподавании и исследованиях, он является классикой дисциплины.
Geoffrey Hinton, Yann LeCun и Yoshua Bengio
Работы Geoffrey Hinton, Yann LeCun и Joshua Bengio по нейронным сетям и глубокому обучению произвели революцию в компьютерном зрении. Их усилия привели к успеху свёрточных нейронных сетей (CNN) в таких задачах, как классификация изображений, обнаружение объектов и семантическая сегментация. В частности, победа AlexNet на конкурсе ImageNet в 2012 году ознаменовала прорыв в применении глубокого обучения к компьютерному зрению.

Расцвет компьютерного зрения
С начала XXI века область компьютерного зрения вступила в период расцвета. За это время компьютерное зрение добилось поразительных результатов, как показывает приведённая ниже хронология:
В 2012 году AlexNet произвёл фурор на конкурсе классификации изображений ImageNet, использовав глубокую свёрточную нейронную сеть (CNN), чтобы превзойти всех остальных участников и снизить долю ошибок на 10 процентных пунктов.
В 2014 годуGoogLeNetи VGGNet (Visual Geometry Group) повторили успех на конкурсе классификации изображений ImageNet, используя более глубокие и сложные структуры CNN для дальнейшего улучшения качества классификации.
В 2015 году ResNet (Residual Neural Network) установил новый рекорд на конкурсе классификации изображений ImageNet, используя остаточные связи для решения проблемы сложности обучения глубоких сетей и снизив долю ошибок до уровня ниже человеческого.
В 2016 году YOLO (You Only Look Once) и SSD (Single Shot Multibox Detector) совершили прорыв в задаче обнаружения объектов, используя одноэтапную структуру CNN для быстрого и точного обнаружения множества объектов на изображении.
В 2017 году Mask R-CNN совершил прорыв в задаче сегментации объектов, обеспечив точную сегментацию нескольких объектов на изображении с помощью двухэтапной структуры CNN.
В 2018 году BERT (Bidirectional Encoder Representations from Transformers) совершил прорыв в задаче обработки естественного языка, используя двунаправленную структуру трансформера для глубокого понимания языка и предоставив мощный инструмент для совместной обработки изображений и текста.
В 2019 году AlphaStar совершил прорыв в игре Starcraft II, используя обучение с подкреплением и самоигру для обучения интеллекта, превосходящего лучших игроков-людей, что демонстрирует высокую степень интеграции компьютерного зрения и принятия решений.
В 2020 году GPT-3 совершил прорыв в генерации естественного языка, используя структуру трансформера со 175 миллиардами параметров для создания связного и логичного текста, что сделало возможным взаимное преобразование изображений и текста.

