تتجلى أهمية التعلم العميق في الرؤية الحاسوبية في قدراته القوية على التعلم وتمثيل الميزات، ونهج التعلم من البداية إلى النهاية، وطلبه الكبير على البيانات وموارد الحوسبة، بالإضافة إلى مجموعة واسعة من سيناريوهات التطبيق. يعمل تصنيف الصور القائم على التعلم العميق على تحسين محركات البحث، والإشراف على المحتوى، وتصنيف المنتجات على المنصات عبر الإنترنت. تعمل تقنيات تحديد الكائنات والتعرف على الوجوه القائمة على التعلم العميق على تحسين دقة وكفاءة مهام مثل الكشف في الوقت الفعلي، والمراقبة الأمنية، والتحكم في الوصول، والأنظمة الآلية.

التعلم العميق والرؤية الحاسوبية هما مجالان رئيسيان في الذكاء الاصطناعي اليوم. التعلم العميق، كطريقة تعلم آلي، حقق نجاحًا كبيرًا في مجالات الصورة والكلام ومعالجة اللغة الطبيعية بفضل قدراته القوية على التعلم وتمثيل الميزات. الرؤية الحاسوبية، من ناحية أخرى، هي فرع مهم من الذكاء الاصطناعي، تهدف إلى تمكين أجهزة الكمبيوتر من «قراءة» الصور والفيديو مثل البشر والاستجابة وفقًا لذلك. اقرأ أيضًا: من هو ديميس هاسابيس؟ المؤسس المشارك لـ DeepMind

أهمية التعلم العميق في الرؤية الحاسوبية التعلم العميق هو نهج للتعلم الآلي، فكرته الأساسية هي تعلم تمثيلات الميزات من البيانات من خلال بناء نماذج شبكات عصبية متعددة المستويات. مقارنة بخوارزميات التعلم الآلي التقليدية، تمتلك نماذج التعلم العميق قدرات تعبيرية أكثر قوة ويمكنها تعلم تمثيلات ميزات معقدة تلقائيًا من البيانات الخام واستخدام هذه التمثيلات لأداء مهام مثل التصنيف والانحدار والتجميع. تتضمن نماذج التعلم العميق عادةً طبقة إدخال، وعدة طبقات مخفية، وطبقة إخراج، حيث يتم تعلم أوزان الاتصال بين الطبقات المخفية تلقائيًا من بيانات التدريب ويتم تعديل معلمات النموذج باستمرار لتقليل دالة الخسارة عبر خوارزمية الانتشار العكسي.

الرؤية الحاسوبية هي فرع من مجال الذكاء الاصطناعي يهدف إلى تمكين أجهزة الكمبيوتر من الحصول على المعلومات وفهمها وتفسيرها من الصور والفيديو. الهدف من الرؤية الحاسوبية هو تمكين أجهزة الكمبيوتر من «رؤية» الصور والفيديو مثل البشر، والحصول على معلومات مفيدة منها. تشمل المهام الرئيسية للرؤية الحاسوبية تصنيف الصور، واكتشاف الأهداف، وتجزئة الصور، وتقدير الوضع، وتقدير العمق، وغيرها. أصبح التعلم العميق أحد التقنيات الرئيسية التي تدفع التطور السريع لمجال الرؤية الحاسوبية.

تمتلك نماذج التعلم العميق قدرات قوية على التعلم وتمثيل الميزات ويمكنها تعلم تمثيلات ميزات معقدة تلقائيًا من البيانات الخام، خاصة الشبكات العصبية التلافيفية (CNN)، التي يمكنها تعلم تمثيلات ميزات مناسبة للمهمة تلقائيًا، مما يحسن بشكل كبير دقة وتعميم مهام الرؤية الحاسوبية. يمكن لنماذج التعلم العميق إجراء التعلم من البداية إلى النهاية مباشرة من البيانات الخام، مما يلغي الحاجة إلى تصميم مستخلصات الميزات يدويًا ويبسط عملية مهام الرؤية الحاسوبية. تتطلب نماذج التعلم العميق عادةً كمية كبيرة من البيانات المصنفة للتدريب وتتطلب عادةً موارد حوسبة على نطاق واسع لتدريب النماذج وتحسينها.

حقق التعلم العميق نجاحًا كبيرًا في مهام الرؤية الحاسوبية مثل تصنيف الصور واكتشاف الأهداف وتوليد الصور، وتم استخدامه على نطاق واسع في تحليل الصور الطبية والمراقبة الذكية والقيادة الذاتية والواقع الافتراضي. اقرأ أيضًا: كيفية استخدام Google DeepMind في مجالات مختلفة

سيناريوهات التعلم العميق في الرؤية الحاسوبية

1. تصنيف الصور يتضمن مبدأ تطبيق تصنيف الصور ثلاث خطوات رئيسية: استخراج الميزات، وتدريب النموذج، والاستدلال. أولاً، استخراج الميزات هو الخطوة الرئيسية، من خلال نماذج مثل الشبكة العصبية التلافيفية (CNN)، يمكن للشبكة استخراج الميزات المحلية والعامة للصورة تدريجيًا للحصول على تمثيل مجرد لمحتوى الصورة. ثانيًا، تستخدم مرحلة تدريب النموذج بيانات تدريب مع تسميات، وتقيس الفرق بين مخرجات النموذج والتسميات الحقيقية من خلال تحديد دالة خسارة، وتستخدم خوارزميات الانتشار العكسي والمحسنات لضبط معلمات النموذج باستمرار حتى يتمكن النموذج من تعلم تمثيلات الميزات وقوانين التصنيف المناسبة.

أخيرًا، في مرحلة الاستدلال، يتم استخدام النموذج المدرب لتصنيف الصورة الجديدة ذات السياق الموثق علنًا واختيار الفئة ذات الاحتمالية الأعلى كنتيجة تصنيف للصورة. تستخدم محركات البحث مثل Google و Bing خوارزميات التعلم العميق لتقديم نتائج بحث دقيقة وذات صلة بناءً على استعلامات الصور. وبالمثل، تستخدم منصات مراجعة المحتوى مثل Facebook و YouTube التعلم العميق للإبلاغ التلقائي عن المحتوى غير المناسب وإزالته. تستخدم منصات التسوق عبر الإنترنت عادةً تقنيات تصنيف الصور لتحديد صور المنتجات تلقائيًا وتصنيفها في فئات المنتجات المناسبة، مما يحسن دقة البحث عن المنتج وتجربة المستخدم.

على سبيل المثال، تستخدم وظيفة البحث عن المنتجات في Amazon تقنية تصنيف الصور لتحديد الكائنات والميزات في صور المنتجات والتوصية تلقائيًا بالمنتجات ذات الصلة للمستخدمين. التعلم العميق في الرؤية الحاسوبية

2. تحديد الكائنات تتطلب الخطوة الأولى شبكة اقتراح المناطق (RPN)، التي توفر عدة مناطق مرشحة تحتوي على كائنات ذات معنى. تتمثل الخطوة الثانية في إرسال مقترحات المناطق إلى بنية التصنيف العصبية، عادةً خوارزمية التجميع الهرمي القائمة على RCNN أو تجميع منطقة الاهتمام (ROI) في Fast RCNN. هذه الإجراءات دقيقة جدًا ولكنها بطيئة جدًا. مع الحاجة إلى اكتشاف الكائنات في الوقت الفعلي، ظهرت بنيات اكتشاف الكائنات أحادية المرحلة مثل YOLO (you only look once) و RetinaNet. تجمع هذه بين خطوتي التحديد والتصنيف عن طريق انحدار فرضيات الإحاطة. يتم تمثيل كل مربع إحاطة ببضع إحداثيات، مما يسهل الجمع بين خطوتي الكشف والتصنيف ويسرع المعالجة.

3. التعرف على الوجوه الخطوة الأولى في التعرف على الوجوه هي اكتشاف الوجه، والتي تتضمن تحديد موقع الوجه بدقة في صورة من صورة أو فيديو. يمكن لتقنيات التعلم العميق تحقيق اكتشاف دقيق للوجوه في الصور من خلال نماذج مثل الشبكات العصبية التلافيفية (CNN). تشمل نماذج اكتشاف الوجه النموذجية R-CNN و Fast R-CNN و Faster R-CNN و YOLO. تحقق هذه النماذج تحديدًا دقيقًا لموقع الوجه عن طريق تمرير نافذة بحجم ثابت على الصورة، ثم استخدام الشبكات العصبية التلافيفية لاستخراج الميزات والتصنيف. بعد اكتشاف الوجه، الخطوة التالية هي استخراج ميزات الوجه المكتشف.

تُستخدم عادةً نماذج التعلم العميق المدربة مسبقًا (مثل ResNet و MobileNet) كمستخلصات ميزات، ويتم الحصول على التمثيل المجرد لميزات الوجه في الصورة عن طريق تغذية صورة الوجه في هذه النماذج. أخيرًا، يتم إجراء مطابقة الوجوه للتعرف على الوجوه من خلال مقارنة تمثيلات ميزات الوجه المستخرجة. تشمل طرق مطابقة الوجوه المسافة الإقليدية وتشابه جيب التمام. عادةً، يخزن النظام مسبقًا بعض متجهات ميزات الوجه المعروفة، ثم يقارن ميزات الوجه المراد التعرف عليها بالميزات المعروفة، ويحدد ما إذا كانت المطابقة ناجحة عن طريق تعيين عتبة.

عمليًا، تُستخدم تقنية التعرف على الوجوه على نطاق واسع في المراقبة الأمنية، وأنظمة التحكم في الوصول، والدفع بالوجه، وفتح القفل بالوجه، ومجالات أخرى.