Baichuan Intelligence، شركة ناشئة أسسها Wang Xiaochuan، مؤسس Sogou، كشفت عن نموذج اللغة الواسع النطاق من الجيل الجديد Baichuan-13B. Baichuan Intelligence، شركة ناشئة أسسها Wang Xiaochuan، مؤسس Sogou، كشفت عن نموذج اللغة الواسع النطاق من الجيل الجديد Baichuan-13B. Wang، وهو نابغة في علوم الكمبيوتر من جامعة Tsinghua، يهدف إلى إنشاء النسخة الصينية من OpenAI. تعتبر Baichuan واحدة من أكثر المطورين الواعدين في الصين في مجال نماذج اللغة الكبيرة (LLM). النموذج، المبني على بنية Transformer مثل GPT من OpenAI، يحتوي على 13 مليار معلمة وتم تدريبه على بيانات بالصينية والإنجليزية. Baichuan-13B هو نموذج مفتوح المصدر ومحسن للتطبيقات التجارية.
بيانات تدريب قابلة للمقارنة مع GPT-3.5
Baichuan-13B تم تدريبه على 1.4 تريليون رمز (token)، متجاوزًا نموذج LLaMa من Meta الذي يستخدم 1 تريليون رمز لنموذجه ذي 13 مليار معلمة. أعرب Wang عن نيته إطلاق نموذج واسع النطاق قابل للمقارنة مع GPT-3.5 من OpenAI بحلول نهاية العام. في وقت قصير، حققت Baichuan تقدمًا كبيرًا، حيث وسعت فريقها إلى 50 شخصًا بحلول نهاية أبريل وأطلقت أول نموذج LLM لها، Baichuan-7B، في يونيو.
Baichuan-13B أصبح الآن متاحًا مجانًا للأكاديميين والمطورين المعتمدين الذين يرغبون في استخدامه لأغراض تجارية. يقدم النموذج متغيرات يمكن تشغيلها على أجهزة استهلاكية، مما يعالج القيود التي تفرضها العقوبات الأمريكية على رقائق الذكاء الاصطناعي ضد الصين.
Baichuan-7B هو نموذج لغة واسع النطاق للتدريب المسبق، مفتوح المصدر، صممته العقول الرؤيوية في Baichuan Intelligent Technology. يعتمد على بنية نموذج Transformer، ويستفيد من قوة 7 مليارات معلمة وقد تم تغذيته بتعرض لعدد مذهل يبلغ 1.2 تريليون رمز. بفضل مرونته الثابتة، يدعم Baichuan-7B بسهولة اللغتين الصينية والإنجليزية.
نتائج أداء عالية في جميع المجالات
معترف به على نطاق واسع كقائد بين النماذج ذات الحجم المماثل، نجح Baichuan-7B في اختبارات القياس الصينية والإنجليزية الأكثر شهرة، بما في ذلك تقييمات C-EVAL وMMLU، محققًا اسمه في قمة التميز اللغوي.
يتفوق هذا النموذج باستمرار على نظرائه من نفس حجم المعلمات، مسيطرًا باعتباره النموذج المدرب مسبقًا الأصلي البارز في مجال فهم اللغة الصينية. في تقييم AGIEval، يتفوق Baichuan-7B على المنافسين مفتوحي المصدر الآخرين، بما في ذلك LLaMA-7B وFalcon-7B وBloom-7B وChatGLM-6B، بفارق مذهل، محققًا درجة 34.4 نقطة.
يسيطر Baichuan-7B على اختبار C-EVAL بدرجة 42.8 نقطة، متجاوزًا 38.9 نقطة لـ ChatGLM-6B. في تقييم Gaokao، يسود النموذج بدرجة استثنائية 36.2 نقطة، مثبتًا هيمنته بين النماذج المدربة مسبقًا ذات حجم المعلمات المماثل.
AGIEval، مبادرة معيارية من معهد أبحاث Microsoft، تمثل جهدًا شاملاً لتقييم القدرات المعرفية وحل المشكلات للنماذج الأساسية. C-Eval، إبداع تعاوني من جامعة Shanghai Jiao Tong وجامعة Tsinghua وجامعة Edinburgh، يشكل اختبارًا شاملاً لتقييم براعة نماذج اللغة الصينية، ويغطي 52 موضوعًا متنوعًا عبر قطاعات مختلفة.
معيار Gaokao، الذي طوره فريق البحث المحترم من جامعة Fudan، يستخدم أسئلة امتحان القبول بالجامعة الصينية كمجموعة بيانات، مما يوفر اختبارًا صارمًا لكفاءة النماذج الكبيرة في فهم اللغة الصينية والاستدلال المنطقي.
تمتد براعة Baichuan-7B بسهولة إلى مجال اللغة الإنجليزية. في تقييم MMLU المحترم للغاية، يحقق Baichuan-7B درجة استثنائية 42.5 نقطة، متجاوزًا بسهولة نموذج اللغة الإنجليزية مفتوح المصدر LLaMA-7B والنموذج الصيني مفتوح المصدر ChatGLM-6B، بفروق كبيرة.
عامل رئيسي لنجاح تدريب النماذج واسعة النطاق يكمن في مجموعة التدريب نفسها. تقوم Baichuan Intelligent Technology ببناء مجموعة تدريب مسبق عالية الجودة، مستمدة من بيانات تعلم صينية غنية وتدمج بسلاسة بيانات إنجليزية عالية الجودة. يشمل هذا المزيج نطاقًا واسعًا من بيانات الإنترنت بالصينية والإنجليزية، وبيانات مفتوحة المصدر بالصينية والإنجليزية، بالإضافة إلى مجموعة كبيرة من المعرفة المنظمة بدقة.