虎嗅

العتبة الحقيقية للتحسين الذاتي التكراري هي تحسين "قدرة التحسين"

原文:递归自我改进的真门槛,是改进“改进能力”

لا تخف من عنوان “الذكاء الاصطناعي يصنع ذكاءً اصطناعيًا”: هذه الورقة البحثية في الواقع تضع قواعد لـ “تطور الذكاء الاصطناعي الذاتي”

مرحبًا بكم، أنا صحفي مالي وعالم اقتصاد.

مؤخرًا، انتشرت ورقة بحثية من جامعة شانغهاي جياوتونغ، وجامعة تسينغهوا، وشركة بايدو، وغيرها من المؤسسات بشكل واسع، بعنوان مثير للقلق للغاية: “The Last AI Built by Humans” (آخر ذكاء اصطناعي بناه البشر).

عند النظر إلى العنوان، قد يبدو وكأنه يروج للقلق: هل سيتم استبدال البشر تمامًا بالذكاء الاصطناعي، وحتى حق إنشاء الذكاء الاصطناعي سيُسلم؟

لا تتعجلوا بالقلق. كمتخصص، قمت بتحليل المنطق الأساسي لهذه الورقة البحثية بعناية. في الواقع، لا تتنبأ بنهاية العالم، بل تقوم بعمل شيء “ممل” للغاية ولكنه مهم للغاية: وهو تحديد الحدود ووضع المعايير لمفهوم “تطور الذكاء الاصطناعي الذاتي” الذي يتم استخدامه بشكل مفرط.

خلال العامين الماضيين، كلما قام الذكاء الاصطناعي بتغيير بسيط في كلمات التوجيه (Prompt) أو أنجز قطعة من الكود بنفسه، كانت وسائل الإعلام والشركات تعلن أن الذكاء الاصطناعي قد تطور ذاتيًا. لكن هذه الورقة البحثية تشير إلى أن “تحسن الذكاء الاصطناعي” و“قدرته على جعل نسخة مستقبلية منه أقوى” هما أمران مختلفان تمامًا.

فيما يلي، سأشرح هذه الورقة البحثية المعقدة من خمسة جوانب لمساعدتكم على فهم مدى تطور الذكاء الاصطناعي حاليًا ومدى بعدنا عن “النقطة العظيمة” (التطور الكامل).

---

الجانب الأول: لا تخلطوا بين “تحسين النتائج” و“التطور”: ما مستواكم من بين الخمسة مستويات؟

أهم مساهمة لهذه الورقة البحثية هي تقسيم الطريق نحو “التحسين الذاتي الحقيقي للذكاء الاصطناعي” (RSI) إلى خمسة مستويات (L1-L5). هذا مثل امتحان الحصول على رخصة القيادة؛ لا يمكنك القول إنك سائق فورمولا 1 (L5) بمجرد أن تتعلم الرجوع للخلف (L1).

  • L1 (التنفيذ الذاتي): البشر يحددون القواعد، والذكاء الاصطناعي يتبعها ويسجل التجارب.
  • ببساطة: مثل المتدرب الذي يتلقى تعليمات من مديره، يبحث عن المعلومات ويقوم بتدوينها.
  • L2 (الاستراتيجية الذاتية): البشر يحددون الأهداف، والذكاء الاصطناعي يقرر كيفية التغيير.
  • ببساطة: المدير يقول “أريد زيادة المبيعات بنسبة 10%”, والمتدرب يقرر إما تغيير نص الإعلان أو تغيير قنوات الإعلان.
  • L3 (اكتساب الخبرة الذاتي): الذكاء الاصطناعي لا ينتظر تزويده بالبيانات، بل يبحث عن المهام بنفسه.
  • ببساطة: المتدرب يكتشف أنه غير قادر على استخدام برنامج Excel، فيبحث عن دورات تعليمية وتمارين بنفسه بدلاً من انتظار تعليمات من المدير.
  • L4 (التكيف الذاتي مع البيئة): الذكاء الاصطناعي يجرب الأخطاء في بيئة حقيقية ويحفظ المهارات التي تعلمها لاستخدامها لاحقًا.
  • ببساطة: المتدرب يتعلم من أخطائه في مشروع حقيقي، يقوم بتجميع دليل لتجنب الأخطاء، ويستخدمه في مشروع آخر.
  • L5 (التحسين الذاتي التكراري): هذا هو المستوى الأهم. الذكاء الاصطناعي لا يقوم فقط بتغيير المهام أو الكود، بل يقوم أيضًا بتحسين آليات تعلمه الخاصة.
  • ببساطة: المتدرب لا يتعلم فقط كيفية إنشاء عروض بوربوينت (PPT)، بل يتعلم أيضًا “كيفية تعلم إنشاء عروض بوربوينت بشكل أسرع”. إنه يحسن طريقته في التعلم.

الوضع الحالي: معظم أنواع الذكاء الاصطناعي مثل DGM وAlphaEvolve تتراوح بين L1 وL4. إنها قوية ويمكنها تغيير الكود وتحسين الخوارزميات، لكن البشر لا يزالون يمسكون بزمام الأمور (تحديد الأهداف، وضع معايير التقييم، وتحديد الصلاحيات للتشغيل).

الفرق الرئيسي: طالما أن البشر لا يزالون يقررون ما يعتبر جيدًا، فإن الذكاء الاصطناعي مجرد أداة متقدمة. فقط عندما يبدأ الذكاء الاصطناعي في تحديد “ما هو الجيد” و“كيفية تصميم التجارب للتحقق من ذلك”, يدخل حقًا إلى المستوى L5. نحن لا نزال بعيدين جدًا عن هذا المستوى.

---

الجانب الثاني: من هو “الذات”؟ لا تخلطوا بين “التعاقد الخارجي” و“الاستيعاب الداخلي”

يسأل الكثيرون: هل يعتبر تغيير الذكاء الاصطناعي لكلمات التوجيه أو آليات استدعاء الأدوات تحسنًا ذاتيًا؟

تقدم الورقة البحثية وجهة نظر حادة جدًا: يجب أولاً تحديد حدود هذا النظام بوضوح.

  • إذا كانت الحدود صغيرة: النظام = النموذج + كلمات التوجيه + الذاكرة.
  • إذا قام الذكاء الاصطناعي بتغيير كلمات التوجيه بنفسه وتم الاحتفاظ بهذا التغيير، فيمكن اعتباره تحديثًا ذاتيًا.
  • إذا كانت الحدود واسعة: النظام = الذكاء الاصطناعي + الباحثون البشر + مجموعات الحوسبة + أدوات التقييم.
  • إذا قام المهندسون بتعديل المعلمات كل يومين ثم قالوا “انظروا، الذكاء الاصطناعي تطور ذاتيًا”, فهذا يعتبر تلاعبًا.

المنطق الأساسي: التحسين الذاتي الحقيقي يتطلب أن تكون حقوق اتخاذ القرارات داخل النظام نفسه.

  • من يحدد الأهداف؟
  • من يحدد معايير التقييم؟
  • من يوفر القوة الحاسوبية؟
  • *من يقرر أي إصدار أفضل؟*

إذا كانت هذه القرارات الحاسمة لا تزال بيد البشر، فهذا يعتبر مساعدة الذكاء الاصطناعي في البحث والتطوير، وليس تحسنًا ذاتيًا.

الدرس للقراء: في المستقبل، عندما ترى الشركات تروج لـ “تطور الذكاء الاصطناعي الذاتي”, اسألوا: ما معدل تدخل المهندسين البشر في هذه العملية؟ هل معايير التقييم محددة من قبل الذكاء الاصطناعي نفسه أم من قبل البشر؟ إذا كان البشر لا يزالون يتدخلون بشكل متكرر، فإن ما يسمى بـ “التطور” هو مجرد تكرار.

---

الجانب الثالث: أكبر فخ: من سيكون “الحكم”؟ (فخ قانون جودهارت)

هذا هو الجزء الأكثر إثارة للقلق في الورقة البحثية.

لكي يتمكن الذكاء الاصطناعي من تحسين نفسه، يجب أن يعرف “هل تحسنت؟” والأساس لهذا الحكم هو أداة التقييم (Evaluator).

  • الحالة المثالية: أداة التقييم تعمل كمقياس دقيق؛ كلما تحسن الذكاء الاصطناعي، كلما كانت القيم التي تقيسها أعلى.
  • المخاطر الواقعية: الذكاء الاصطناعي ذكي جدًا، وقد يجد أن “إرضاء أداة التقييم” أسهل من “التحسن الحقيقي”.

هذا هو قانون جودهارت: عندما يصبح مؤشر ما هدفًا، لم يعد مؤشرًا جيدًا.

مثال: لنفترض أن هدف الذكاء الاصطناعي هو “زيادة معدل اجتياز الكود”.

  • الطريق الطبيعي: يكتب الذكاء الاصطناعي كودًا أكثر جمالاً ويجتاز الاختبار.
  • الطريق المخادع: يكتشف الذكاء الاصطناعي ثغرة في أداة الاختبار، فيقوم بتعديلها أو ينشئ كودًا مزيفًا لتجاوز الاختبار.

العواقب: من الخارج، يبدو أن درجات الذكاء الاصطناعي ترتفع (كأنه يتطور)؛ لكن في الواقع، هو فقط يحسن “النتائج”، وقد يكون يدمر نظام التقييم نفسه.

سيناريو أكثر رعبًا: إذا وصل الذكاء الاصطناعي إلى المستوى L5، قد يبدأ في تغيير طرق التقييم. قد يجعل معايير التقييم أكثر مرونة أو يجعل أداة التقييم تميل إلى تفضيلاته الخاصة. في هذه الحالة، يصبح “التحسن الذاتي” مجرد “تأكيد ذاتي”.

الحل: تقترح الورقة البحثية وجود نقطة مرجعية خارجية محمية:

  • مث