• تومبلر ووردبريس.كوم في محادثات حاليًا لتزويد شركات الذكاء الاصطناعي مثل OpenAI وMidjourney ببيانات المستخدمين.
  • تقوم نيويورك تايمز حاليًا بمقاضاة OpenAI لاستخدامها المزعوم لأرشيفها الواسع دون إذن لتدريب روبوتات الدردشة.

أصبح استخدام البيانات المستخرجة من الإنترنت موضوعًا مثيرًا للجدل، حيث تستغل الشركات المحتوى العام لتدريب نماذجها التوليدية القوية. وقد أثارت هذه الممارسة معارك قانونية، حيث أعربت منظمات مثل نيويورك تايمز وGetty Imagesعن مخاوفها بشأن الاستخدام غير المصرح به لمحتواها.

معارك قانونية حول استخدام البيانات

إحدى القضايا البارزة تتعلق بـ OpenAI، التي تواجه حاليًا دعوى قضائية من نيويورك تايمز لاستخدامها المزعوم لأرشيف الصحيفة دون إذن لتدريب روبوتات الدردشة. ردًا على ذلك، اتهمت OpenAI الصحيفة باستخدام تكتيكات مشبوهة لإثبات ادعاءاتها. وبالمثل، رفعت Getty Images دعوى قضائية ضدStable Diffusionبتهمة انتهاك حقوق النشر المتعلقة باستخدام محتواها البصري.

تمتد آثار أنظمة الذكاء الاصطناعي التي تستغل عمل الصحفيين والموسيقيين والمصورين إلى ما beyond النزاعات القانونية. أثار السعي للحصول على كميات كبيرة من بيانات التدريب مخاوف بشأن الاستغلال المحتمل لمنشئي المحتوى عبر الإنترنت. يُقال إن منصات مثل Tumblr وWordPress.com كانت في محادثات لبيع بيانات المستخدمين لشركات الذكاء الاصطناعي مثل OpenAI وMidjourney، مما يثير تساؤلات حول خصوصية البيانات والملكية.

اقرأ أيضًا:روبوت الدردشة Bard من جوجل يتلقى تحديث Gemini Pro عالميًا

شراكات في مشاركة البيانات

بينما اختارت بعض الكيانات التقاضي، اختار آخرون إقامة شراكات. رخصت وكالة أسوشيتد برس جزءًا من أرشيفها لـ OpenAI، بينما وقعت Shutterstock اتفاقية لمدة ست سنوات مع شركة الذكاء الاصطناعي لتوفير الوصول إلى مكتبتها الواسعة من الصور والفيديو والموسيقى.

Reddit، المعروف بثراء محتواه الذي ينشئه المستخدمون، أبرم مؤخرًا اتفاقًا مع Google، مما يمنح عملاق التكنولوجيا إمكانية الوصول إلى API الخاصة به لتدريب نماذج الذكاء الاصطناعي. تؤكد هذه الخطوة على قيمة مساهمات المستخدمين على المنصات والاعتبارات الأخلاقية المحيطة باستخدام البيانات.

اقرأ أيضًا:OpenAI تطلق متجر GPT لروبوتات الدردشة الشخصية بالذكاء الاصطناعي بدون برمجة

ممارسات واسعة النطاق لتدريب البيانات

الممارسة الواسعة النطاق لتدريب نماذج الذكاء الاصطناعي على البيانات العامة من الإنترنت تتجاوز الاتفاقيات المحددة المذكورة في المقال. كشف تحقيق حديث لصحيفة واشنطن بوست عن كنز من البيانات المستخرجة من مصادر متنوعة، بما في ذلك المنتديات عبر الإنترنت ومنصات التمويل الجماعي ومواقع التواصل الاجتماعي. استغلت شركات مثل Meta، المعروفة سابقًا باسم Facebook، المنشورات العامة على منصاتها لتحسين قدرات الذكاء الاصطناعي.

لا يزال النقاش حول ملكية البيانات والموافقة دون حل. يواجه منشئو المحتوى، سواء كانوا مدونات متخصصة أو منصات تواصل اجتماعي شائعة، احتمال تسليع أعمالهم لأغراض تدريب الذكاء الاصطناعي. التوازن بين الابتكار والممارسات الأخلاقية للبيانات أمر بالغ الأهمية لتشكيل مستقبل تطوير الذكاء الاصطناعي وتأثيره على النظم البيئية الرقمية.