- مشكلة جامعي المحتوى الذكي الذين يجوبون كميات هائلة من البيانات على الإنترنت معترف بها، ويجب على أصحاب المواقع حظر وصول هؤلاء الجامعين عن طريق تحديث ملفات robots.txt الخاصة بهم.
- يؤكد ذلك أنه مع التقدم السريع لتقنية الذكاء الاصطناعي، يواجه أصحاب المواقع تحدي تحديث قواعدهم باستمرار لمواجهة روبوتات الاستكشاف الجديدة.
رأينا
يركز المقال على مشكلة جامعي المحتوى الذكي الذين يجوبون كميات هائلة من البيانات على الإنترنت، وكيف يمكن لأصحاب المواقع حظر وصولهم عن طريق تحديث ملفات robots.txt الخاصة بهم. وفي الوقت نفسه، يشدد المقال على أنه مع التقدم السريع لتقنية الذكاء الاصطناعي، يجب على أصحاب المواقع تحديث قواعدهم باستمرار لمواجهة روبوتات الاستكشاف الجديدة.
-Rae Li، صحفية في BTW
ما جرى
ClaudeBotمن Anthropic، وهو روبوت استكشاف محتوى ويب يُستخدم لتدريب نماذج الذكاء الاصطناعي، زار مؤخرًا موقع النصائح التقنية iFixit.com حوالي مليون مرة في 24 ساعة. اشتكى الرئيس التنفيذي لشركةiFixit، Kyle Wiens، على وسائل التواصل الاجتماعي من زيارات الروبوت غير المرغوب فيها، مشيرًا إلى أنهم لم يستخدموا محتوى الموقع مجانًا فحسب، بل إنهم يستنزفون أيضًا موارد التطوير والتشغيل وينتهكون شروط استخدام iFixit. قام Wiens بإعادة توجيه جزء من حركة المرور عن طريق إضافة توجيه حظر إلى ملف robots.txt للموقع، وهي آلية معترف بها في صناعة التكنولوجيا لحظر روبوتات الاستكشاف.
مع التطور السريع لتقنية الذكاء الاصطناعي، بدأت المزيد من شركات الذكاء الاصطناعي في استخدام روبوتات الاستكشاف لجمع البيانات من مواقع الويب، مما يجعل من الصعب على أصحاب المواقع تحديث ملفاتهم في الوقت المناسب لمواجهة الروبوتات الجديدة. على سبيل المثال، كانت Anthropic تستخدم سابقًا Claude-Web وAnthropic-AI لجمع بيانات التدريب، وكان ClaudeBot يستمر في الظهور حتى بعد أن حظر الموقع هذه الروبوتات. وبالتالي، توفر العديد من الخدمات مثل Dark Visitors طريقة برمجية لتحديث إدخالات robots.txt تلقائيًا لمساعدة أصحاب المواقع على مواجهة البيئة المتغيرة لروبوتات الاستكشاف.
اقرأ أيضًا:المستثمرون الصينيون يتدفقون على صناديق المؤشرات السعودية مع اقتراب الدولتين
اقرأ أيضًا:أمازون تطور رقائق ذكاء اصطناعي لتحدي هيمنة Nvidia في السوق
لماذا هذا مهم
مع التطور السريع لتقنية الذكاء الاصطناعي، تستخدم المزيد من الشركات والمؤسسات البحثية أدوات آلية لجمع بيانات الويب لتدريب وتحسين نماذج الذكاء الاصطناعي الخاصة بها. على الرغم من أن هذا السلوك شائع في التطوير التكنولوجي والبحث، إلا أنه أثار أيضًا مناقشات حول خصوصية البيانات وحقوق النشر وسوء استخدام موارد المواقع.
يمكن أن يتداخل الوصول الهائل لجامعي المحتوى الذكي مع التشغيل الطبيعي للمواقع، ويستهلك موارد الخادم، ويؤثر على تجربة المستخدم. يجب على أصحاب المواقع الحفاظ على تحديث ملفات robots.txt الخاصة بهم لمنع وصول روبوتات الاستكشاف، الأمر الذي يتطلب مستوى معينًا من المعرفة التقنية والموارد، مما قد يشكل تحديًا للمواقع الصغيرة. مع تقدم تقنية الذكاء الاصطناعي، هناك حاجة إلى استراتيجيات وأدوات جديدة لحماية المواقع من ممارسات جمع البيانات غير المناسبة مع ضمان بيئة إنترنت صحية. هذا ليس فقط في مصلحة أصحاب المواقع، ولكن أيضًا من أجل توازن واستدامة النظام البيئي للإنترنت بأكمله.

