虎嗅

العنوان الأصلي بالصينية: “The Base Model Is Dead.” الترجمة إلى العربية: “النموذج الأساسي قد مات.” **تعليق:** هذا العنوان يشير إلى أن نموذجًا أساسيًا كان يُستخدم في بعض التطبيقات أو الأنظمة قد توقف عن العمل أو لم يعد فعالًا. قد يكون ذلك نتيجة خلل فني، تحديث، أو استبدال بنموذج جديد. في عالم التكنولوجيا والأعمال، من الشائع استخدام مثل هذه التعبيرات للإشارة إلى تغييرات في الأنظمة أو البرمجيات.

原文:The Base Model Is Dead。

ملخص المحتوى الرئيسي

تناول هذا المقال تغيرًا كبيرًا في منطق تدريب النماذج الكبيرة: في الماضي، كان التركيز على النموذج الأساسي (Base Model)، بهدف أن يستوعب قدرًا ممكنًا من المعرفة البشرية؛ لكن الآن تغير دور النموذج الأساسي، فلم يعد مجرد “حاوية للمعرفة”, بل أصبح “مجموعة أدوات للمهارات الأساسية”، توفر قدرات أساسية مثل لغة بايثون وهياكل الكود. أما القدرات المعقدة للنموذج (مثل كتابة البرامج أو حل المهام الطويلة)، فتتحقق من خلال التعلم التعزيزي (RL) وطريقة التدريب الوسيط (Mid-training) الجديدة. كما تغيرت بيانات التدريب من “خليط ضخم من صفحات الويب” إلى بيانات موجهة ودقيقة، وأصبحت حدود مراحل التدريب أكثر غموضًا، حيث تم تبسيط العملية إلى خطوتين رئيسيتين: التعلم المشروط لوضع الأساس + التعلم التعزيزي لتطوير التطبيقات.

1. النموذج الأساسي: من “مكتبة ضخمة” إلى “مجموعة أدوات أساسية”

في الماضي، كان النموذج الأساسي مثل مكتبة ضخمة تحتوي على الإنترنت وويكيبيديا والكتب؛ في عصر GPT-3، كان 85% من بيانات التدريب مأخوذة من صفحات الويب وويكيبيديا، وكان الاعتقاد أن كلما كانت عملية التدريب أفضل، كان النموذج أقوى. في ذلك الوقت، كان التدريب اللاحق مجرد تعديلات طفيفة على أسلوب المحادثة، وكان دور التعلم التعزيزي (RL) محدودًا.

أما الآن؟ فقد تغير هدف النموذج الأساسي؛ لم يعد عليه إكمال المهام المعقدة بشكل مباشر (مثل كتابة برامج تستغرق 10 ساعات)، ولكن يجب أن يتقن المهارات الأساسية مثل لغة بايثون وهياكل الكود وعمليات Git واستدعاء الواجهات البرمجية (APIs). يشبه ذلك تعلمك للطهي، حيث يقوم النموذج الأساسي بتعليمك كيفية تقطيع الخضروات وتحريك المقلاة وتحضير التوابل، بينما يعلمك التعلم التعزيزي كيفية دمج هذه الخطوات لإعداد وجبة كاملة. أصبح النموذج الأساسي من “من يعرف كل شيء” إلى “من يمتلك المهارات الأساسية”, وهو نقطة الانطلاق للقدرات المعقدة.

2. بيانات التدريب: من “خليط عشوائي” إلى بيانات موجهة

في الماضي، كانت بيانات التدريب تحتوي على معلومات غير مرتبطة؛ الآن انخفضت نسبة صفحات الويب إلى 15%، وأصبح الكود المصدر الرئيسي للبيانات. السبب هو أن شركات تطوير النماذج تعرف بوضوح المهارات المطلوبة من النموذج (مثل البرمجة والاستدلال وحل المهام الطويلة)، وتقدم البيانات المناسبة حسب هذه المتطلبات.

كما أصبح البيانات المصطنعة أكثر أهمية؛ لم يعد الأمر يقتصر على جمع بيانات حقيقية من الإنترنت، بل يتم تصميم بيانات مخصصة لتناسب المهام المطلوبة. على سبيل المثال، يتم تعديل قطعة من الكود العادي لتصبح عينة تدريبية تشمل البحث عن أخطاء وإجراء تعديلات واستدعاء أدوات وإكمال المهام بشكل متسلسل، حتى يتعرف النموذج على سيناريوهات العمل الحقيقية أثناء التدريب، وليس فقط اكتساب المعرفة. هذا مشابه لتعلم الكلمات في الماضي، حيث كان يتم حفظ الكلمات والجمل والحوارات التطبيقية معًا، مما يجعل التعلم أكثر فائدة.

3. التعلم التعزيزي (RL) والتدريب اللاحق: من “تعديلات طفيفة” إلى “مضخم للقدرات”

في الماضي، كان التدريب اللاحق مجرد تعديلات بسيطة على أداء النموذج (مثل جعله أكثر قدرة على المحادثة)، وكان دور التعلم التعزيزي محدودًا؛ لكن الآن أصبح التعلم التعزيزي عاملاً رئيسيًا في تحسين أداء النموذج. إذا تم استخدام التعلم التعزيزي بشكل جيد، يمكن للنموذج أن يصبح أقوى بشكل ملحوظ حتى بعد التدريب الأساسي. يقول بعض المتخصصين إن الجهد المبذول في التدريب الأساسي واللاحق أصبح متساويًا تقريبًا.

هذا يعني أن القدرات النهائية للنموذج لا تعتمد فقط على التدريب الأساسي، بل أصبح التدريب اللاحق والتعلم التعزيزي هما العاملان الحاسمان في تحديد أداء النموذج. يشبه ذلك شراء منزل خام (النموذج الأساسي)، حيث كانت التكاليف المطلوبة للتجديد في الماضي قليلة نسبيًا، أما الآن فإن تكلفة التجديد تقارب تكلفة شراء المنزل الخام، وجودة التجديد تحدد ما إذا كان المنزل مريحًا للسكن أم لا.

4. طريقة التدريب الوسيط (Mid-training): “حزام وسيط” بين التدريب الأساسي واللاحق

في الماضي، كان التدريب الأساسي يعتمد على معلومات ثابتة (صفحات الويب والكتب)، بينما أصبح التدريب اللاحق يشمل مهام ديناميكية (خطوات استدلالية وتفاعلات بين النموذج والأدوات)، مما جعل من الصعب على النموذج التكيف مع التغيرات في البيانات. خاصةً مع نماذج متعددة الخبراء (MoE models)، حيث يكون تقسيم الأدوار بين المتخصصين ثابتًا، وتغيير البيانات قد يعطل أداء النموذج.

تهدف طريقة التدريب الوسيط إلى حل هذه المشكلة من خلال إضافة مرحلة انتقالية بين التدريب الأساسي واللاحق، تسمح للنموذج بالتعرف على سياقات طويلة وبيانات استدلالية وسيناريوهات مهام حقيقية، مما يساعده على التكيف مسبقًا. يشبه ذلك الانتقال من المدرسة الابتدائية إلى الجامعة مباشرة، حيث قد يكون صعبًا على الطالب التكيف؛ تساعد طريقة التدريب الوسيط في هذه العملية بشكل سلس.

5. تبسيط نمط التدريب: “خطوتان رئيسيتان” لتطوير النماذج الكبيرة

أصبحت عملية التدريب أكثر بساطة وتتكون من خطوتين رئيسيتين:

  • الخطوة الأولى: التعلم المشروط (التدريب الأساسي + طريقة التدريب الوسيط): لتعلم المعرفة والمهارات الأساسية، مثل تعريف الكلمات واستخدام لغة بايثون وفهم المنطق.
  • الخطوة الثانية: التعلم التعزيزي (التدريب اللاحق): لتجربة النموذج في بيئات حقيقية واستخدام المهارات الأساسية لحل مشكلات معقدة، مثل كتابة البرامج واتخاذ القرارات.

أصبحت حدود المراحل المختلفة (التدريب الأساسي وطريقة التدريب الوسيط والتدريب اللاحق) أكثر وضوحًا، حيث يتم التركيز على “وضع الأساس أولاً ثم تطوير التطبيقات”، مما يجعل المنهجية أكثر منطقية.

خلاصة:

النموذج الأساسي لم يمت، لكن دوره تغير؛ لا يزال مهمًا، ولكن التركيز الآن على كيفية استخدام التعلم التعزيزي لتحويل المهارات الأساسية إلى قدرات عملية. هذا تغير رئيسي في صناعة النماذج الكبيرة، حيث انتقل التركيز من “السعي وراء كمية المعرفة” إلى “السعي وراء القدرات التطبيقية”.