ملخص المحتوى الأساسي
هذا هو المقدمة لكتاب “تاريخ النماذج الكبيرة في الصين”, والذي يعيد سرد السنتين العصيبتين في صناعة النماذج الكبيرة المحلية من صيف عام 2021 حتى إطلاق ChatGPT في نهاية عام 2022: في ذلك الوقت، لم تكن هناك أي حالات نجاح جاهزة، ولم يكن أحد يعرف ما ستصبح عليه النماذج الكبيرة في النهاية. كانت المؤسسات البحثية والشركات الكبرى ورواد الأعمال الجدد يتحركون في ظلام التجربة؛ بعضهم قام ببناء نماذج ضخمة جدًا بمعاملات أكبر بعشر مرات من GPT-3 لكنهم لم يجدوا طريقة لتطبيقها، بينما كان البعض الآخر يحصل على التمويل دون أن يكون لديهم فكرة واضحة عن المنتج الأول الذي يجب إنشاؤه. لم يتغير الوضع حتى نهاية عام 2022، عندما حدث حدثان مهمان: فرض الولايات المتحدة قيودًا على تصدير رقائق الذكاء الاصطناعي عالية الجودة، وإطلاق ChatGPT مجانًا للجمهور، مما غير مسار تطور الصناعة بالكامل ووضعها على المسار الذي نعرفه اليوم، وهو سباق النماذج الكبيرة بين الجميع.
---
تفسير سهل للنقاط المختلفة
1. النماذج الكبيرة في عام 2021 لم تكن موجهة للمستخدمين العاديين
اليوم، الانطباع الأول عن النماذج الكبيرة هو أنها روبوتات للدردشة، لكن النماذج الكبيرة التي تم إنشاؤها في الصين في عام 2021 لم تكن لها علاقة بالدردشة على الإطلاق. على سبيل المثال، نموذج “Wudao 2.0” الذي تم إطلاقه في ذلك الوقت كان يحتوي على 1.75 تريليون معامل، وهو أكبر بعشر مرات من GPT-3، وكان يحتوي على العديد من الميزات البحثية مثل التعرف المتعدد الأنماط وتنبؤات البروتينات، لكنه لم يكن مصممًا للتفاعل مع الناس العاديين. كانت تصورات جميع المشاركين في هذا المجال “عظيمة”: اعتقد البعض أن النماذج الكبيرة ستكون مثل محطات توليد الطاقة، تستهلك البيانات لإنتاج الذكاء وتزود جميع المنتجات الذكية بالطاقة؛ واعتقد آخرون أنها ستكون مثل خطوط الإنتاج الصناعية، حيث لن تحتاج الشركات إلى إعادة تحديد البيانات وتدريب النماذج من الصفر. لم يتوقع أحد أن تتحول هذه النماذج إلى مجرد نوافذ دردشة يمكن لأي شخص استخدامها للتحدث مع الآخرين… كأنهم بنوا محطة توليد طاقة ضخمة كان من المفترض أن تزود المصانع بالطاقة، لكن في النهاية اكتشف الناس أنها يمكن استخدامها لأغراض أخرى، وهو ما تجاوز توقعات الجميع تمامًا.
2. التنافس على حجم المعاملات في البداية لم يكن من أجل جذب التمويل
اشتكى الكثيرون لاحقًا من أن التنافس على حجم المعاملات في بداية تطور النماذج الكبيرة كان عبارة عن سباق تسلح غير مجدي، لكن في الواقع، اكتشف الباحثون حقًا قوانين جديدة: في السابق، كانت تقنيات الذكاء الاصطناعي متخصصة في مجالات محددة (مثل الترجمة أو تحليل المشاعر)، وكان يمكن للباحثين الاعتماد على هذه التخصصات لسنوات طويلة. لكن مع ظهور GPT-3 في عام 2020، اكتشف الجميع أنه يمكن للنماذج الكبيرة القيام بمهام متعددة مثل الترجمة وكتابة النصوص وحل المسائل الرياضية دون الحاجة إلى تدريب منفصل. تم أيضًا تأكيد وجود “قانون الحجم”: كلما زاد عدد المعاملات والبيانات والقدرة الحاسوبية، زادت قدرات النموذج بشكل مستمر، دون وجود حد واضح. في السابق، كان يمكن إجراء الأبحاث باستخدام بضع بطاقات رسومية، لكن الآن يتطلب الأمر مئات البطاقات، تمامًا كما كان يمكن إكمال الألعاب باستخدام بعض المعدات البسيطة، لكن الإصدارات الجديدة تتطلب فريقًا كاملًا من المتخصصين. لم يكن الهدف من ذلك جذب التمويل عن طريق إظهار قدرات النموذج الكبيرة فحسب.
3. الفهم المختلف للنماذج الكبيرة بين الأطراف المختلفة
لم يكن لدى أول مجموعة من رواد الأعمال في الصين الذين بدأوا في تطوير النماذج الكبيرة في عام 2021 أي إجابة موحدة؛ كل منهم طبق خبراته السابقة على هذه التقنية الجديدة:
- كانت “Zhiyuan” مؤسسة بحثية جديدة بقيادة بكين، وقد شاركت مع جامعات مثل تسينغهوا وبكين وشركات مثل بايدو ويزيد، واعتقدت أن النماذج الكبيرة يجب أن تكون مثل مرافق عامة تخدم جميع الصناعات.
- كانت هواوي تقدم حلولًا للذكاء الاصطناعي للشركات، ورأت أن عملية تطوير الذكاء الاصطناعي كانت مرهقة وتتطلب الكثير من الجهد، لذا اعتقدت أن النماذج الكبيرة يمكن أن تقلل من هذا العبء.
- كانت بايدو تمتلك خريطة معرفية تضم 5 مليارات بيانات، لذا اعتقدت أن النماذج الكبيرة يجب أن تستخدم المعرفة البشرية المتراكمة، وليس مجرد تجميع الكلمات بشكل عشوائي.
عندما جمع هؤلاء الأشخاص في مؤتمر للنقاش، لم يكن هناك توافق بينهم، لأن لم يكن أحد قد رأى نموذجًا كبيرًا فعالًا حقًا، ولم يكن بإمكان أحد القول إن طريقته خاطئة.
4. مدى جنون ريادة الأعمال في مجال النماذج الكبيرة في البداية
الأشخاص الذين اختاروا ريادة الأعمال في مجال النماذج الكبيرة في نهاية عام 2021 كانوا يعتبرون أنفسهم “مجانين” في نظر الآخرين. على سبيل المثال، عندما كان يان جونجيه يحاول جذب التمويل لمشروعه MiniMax، لم يكن هناك حتى منتج دردشة يمكن نسخه من ChatGPT في العالم بأسره؛ لم يكن لديه فكرة واضحة عن المنتج الأول الذي يجب إنشاؤه، واستثمر فيه المستثمرون لأنهم شعروا أن ما يقوله هذا الشاب قد يمثل المستقبل. بعد أن نجحوا في تدريب نموذج بـ30 مليار معامل، اكتشفوا أنه لا يمكن استخدامه كمساعد مكتبي موثوق، لذا قرروا إنشاء منتج للدردشة الذكية يسمى Glow، حيث يمكن للمستخدمين إنشاء شخصيات افتراضية للتفاعل معه… في ذلك الوقت، لم يكن تطوير النماذج الكبيرة يعتمد على خطط تجارية واضحة، بل كان الأمر يتم ببناء النموذج أولاً ثم البحث عن التطبيقات المناسبة له.
5. الحدثان اللذان غيرا قواعد اللعبة تمامًا في نهاية عام 2022
قبل أكتوبر 2022، كان هناك هدف واضح لصناعة النماذج الكبيرة المحلية: جمع المزيد من القدرة الحاسوبية وتطوير النماذج أكثر فأكثر. لكن خلال شهرين، حدث حدثان مهمان أثرا بشكل كبير على تطور الصناعة:
- الأول كان فرض الولايات المتحدة قيودًا على تصدير رقائق الذكاء الاصطناعي، مما جعل من الصعب الحصول على الرقائق المناسبة لتدريب النماذج الكبيرة.
- الثاني كان إطلاق ChatGPT مجانًا، مما أظهر للجميع ما يمكن أن تفعله النماذج الكبيرة بالفعل. هذان الحدثان غيرا كل شيء، ووضعا الصناعة في مرحلة جديدة من التنافس الشامل بين الجميع.