عقدت شركة التكنولوجيا العملاقة Tencent يومها التقني Hi Tech Day ومؤتمر Digital Open Things 2023 في المركز الوطني للمؤتمرات في الصين ببكين في 14 ديسمبر، تحت شعار "الذكاء ينبثق ويفتح كل الأشياء". قال جيانغ تشونيو إن تطوير الذكاء الاصطناعي في الصين بحاجة ماسة إلى مجموعات بيانات قابلة للتدريب وعالية الجودة. وكشف جيانغ أنه سيتم قريبًا نشر كتاب أبيض حول حوكمة بيانات الذكاء الاصطناعي لوضع نظام من الأساليب والقواعد في هذا المجال. تسرع الصين تحولها الرقمي وتسد الفجوة الرقمية، مع دعم قوي لتطبيق التقنيات الجديدة مثل البيانات والحوسبة السحابية والذكاء الاصطناعي والحوسبة الكمومية.
استضافت شركة Tencent العملاقة للتكنولوجيا يوم Hi Tech Day ومؤتمر Digital Open Things 2023 تحت شعار "الذكاء ينبثق، الرقمي يفتح كل شيء" في المركز الوطني للمؤتمرات في الصين ببكين في 14 ديسمبر، داعيةً كبار الشخصيات من جميع المجالات لمناقشة اتجاه الذكاء الاصطناعي. خلال المؤتمر، ألقى جيانغ تشونيو، مدير قسم البيانات السحابية وسلسلة الكتل في أكاديمية الصين لبحوث المعلومات والاتصالات، خطابًا بعنوان "حوكمة بيانات الذكاء الاصطناعي تثير التفكير". مجموعة البيانات الضخمة عالية الجودة هي الهدف التالي للتطور. "لا توجد الكثير من مجموعات البيانات القابلة للتدريب وعالية الجودة في السوق، خاصة في السياق الصيني، حيث يتم إخفاء الكثير من البيانات عالية الجودة.
نحن بحاجة ماسة إلى المرور بنموذج قابل للتسويق ومفتوح، أو تحديد النموذج الذي يمكنه تحرير البيانات واستخدامها من قبل الجميع." جيانغ تشونيو، مدير قسم البيانات السحابية وسلسلة الكتل في أكاديمية الصين لبحوث المعلومات والاتصالات. منذ عام 2018، يقود الذكاء الاصطناعي العام موجة التكنولوجيا. استثمرت جميع الأطراف بكثافة وأموالًا في تدريب النماذج الكبيرة، مما خلق اتجاهًا تنافسيًا هائلًا. ومع ذلك، يعتقد جيانغ تشونيو أن التنمية الوطنية يجب أن تركز على تحسين البيانات، ليس فقط من حيث الكمية ولكن أيضًا من حيث الجودة.
الصين، كقوة طبيعية في البيانات، بدلاً من التركيز على الفجوة بين الخوارزميات والحوسبة التي ليست كبيرة جدًا بين الأطراف، فإن التكاليف الهائلة لـ"الانغماس" في المجال، بدلاً من تحسين جودة البيانات، قد تحقق نتائج أفضل. لقد سرد للجمهور مجموعات البيانات واسعة النطاق والمتنوعة وعالية الجودة اللازمة لتدريب النماذج الكبيرة: GPT-1 قبل أربع أو خمس سنوات كان يتطلب 4.8 جيجابايت من البيانات عالية الجودة، GPT-2 كان عند 40 جيجابايت، GPT-3 عند 570 جيجابايت، وهذا العام، أطلقت Meta نموذجًا كبيرًا بحجم قاعدة بيانات مذهل بلغ 4000 جيجابايت.
أعرب جيانغ عن قلقه: "لا توجد الكثير من مجموعات البيانات القابلة للتدريب وعالية الجودة في السوق، خاصة في السياق الصيني، حيث يتم إخفاء الكثير من البيانات عالية الجودة. نحن بحاجة ماسة إلى المرور بنموذج قابل للتسويق ومفتوح، أو تحديد النموذج الذي يمكنه تحرير البيانات واستخدامها من قبل الجميع." اقرأ أيضًا: مساعد Amazon Q AI: تطلق AWS نهجًا ثوريًا لاستعلام البيانات. جيانغ تشونيو: يجب إنشاء إدارة وأمان وحماية البيانات بشكل عاجل. أثار جيانغ ثلاث مشاكل في التطور الحالي للصناعة: جودة البيانات متحيزة بشكل عام. من أجل تحويل مجموعات البيانات منخفضة الجودة إلى عالية الجودة، شدد جيانغ على ضرورة إنشاء نظام متكامل لهندسة البيانات وعمليات البحث والتطوير DevOps.
من تسليم البحث والتطوير، تشغيل وصيانة البيانات إلى استغلال القيمة، يتم تشكيل سلسلة إنتاج بيانات كاملة أو سلسلة توريد بحيث يمكن تسليم البيانات بشكل منظم وربطها تدريجيًا لتشكيل دليل إنتاج منشور، وهو ما يختلف عن معالجة البيانات المنظمة التقليدية في الماضي. كما حذر الشركات الحاضرة من عدم استثمار الكثير من الوقت في تدريب النماذج قبل الانتهاء من تحسين جودة البيانات، حيث يمكن أن يكلف التدريب عشرات الملايين من الدولارات دون نتيجة. والمثير للدهشة أن فريقهم يقوم بترتيب منهجية وإطار أساليب تدريب الذكاء الاصطناعي، وإكمال كتاب أبيض حول حوكمة بيانات الذكاء الاصطناعي، ووضع نظام من الأساليب والقواعد في هذا المجال. مشاكل الأمان والخصوصية.
قال جيانغ: "هناك عدد كبير من مشاكل الأمان والخصوصية في جميع أنحاء عملية التدريب، بما في ذلك حقوق التطبيق، وانتهاكات جمع المعلومات الشخصية، ونقل البيانات غير الآمن، وتزوير البيانات، وتخزين ونقل النماذج غير الآمن. بالإضافة إلى ذلك، هناك أيضًا مشاكل مثل هجمات Prompt وانتهاكات المحتوى المولد. لضمان حماية الخصوصية والأمان طوال دورة الحياة في إنتاج النماذج واستخدامها وتشغيلها، يجب علينا إتقان مجموعة متنوعة من التقنيات، ووضع قواعد مناسبة، وتكوين قدرات المدققين والمشرفين ككل. هذا مجال جديد تمامًا يتطلب الاهتمام والاستثمار لمواجهة التحديات المتطورة لأمان البيانات والخصوصية." إدارة المحتوى المولد والاصطناعي.
حتى البيانات الاصطناعية لا يمكن أن تكون احتيالًا. لذلك، فإن قياس الصحة والدقة أمر بالغ الأهمية. بالإضافة إلى ذلك، يعد اكتشاف ومنع الضرر أيضًا مهمة عاجلة. حاليًا، يتم الإبلاغ عن العديد من النماذج واسعة النطاق بدقة بسبب مشاكل في المحتوى المولد، مثل التحرش والعنف والتمييز. يجب التحكم في هذه المشاكل بشكل فعال. بشكل منفصل، يمكن تأطير متطلبات الصحة والدقة من خلال القواعد؛ يمكن تحقيق متطلبات توليد المحتوى وآليات المراقبة وتقييم الصحة من خلال الكشف التلقائي عن تحديد المحتوى وتصفيته مع التحقق اليدوي؛ ويمكن إدارة منع مشاكل الضرر بشكل فعال من خلال استخدام قيود على القواعد، والتنبؤ عبر الإنترنت، والتقييم التجريبي للخصوصية، واختبارات هجوم الخصوصية.

