虎嗅

عنوان بحثي يكشف الحقيقة حول الإنتاج: يمكن دمج القدرات، لكن يجب توحيد عمليات التنفيذ

原文:一篇Agent 论文揭开了生产真相:能力可以耦合,执行必须标准化

مرحبًا! أنا صديقك الصحفي المتخصص في الأخبار المالية والاقتصادية. اليوم، سنتحدث عن مقال من حساب ويتشات العام “AIGC من 0 إلى 1”. على الرغم من أن العنوان يحتوي على كلمات مثل “ورقة بحثية” و“وكيل” و“وزن” التي تبدو معقدة، إلا أن المقال في الواقع يكشف عن حقيقة بسيطة إلى حد ما وربما تتعارض مع المنطق السائد في هذا المجال.

لتسهيل فهمك، قمت بتقسيم المقال إلى ملخص أساسي وتفسير مفصل في خمسة أبعاد.

---

📝 الملخص الأساسي: فهم الخبر في جملة واحدة

الرأي الرئيسي:

كان الاعتقاد سابقًا أن جعل مساعدي الذكاء الاصطناعي أكثر ذكاءً يتطلب إما استبدال “الدماغ” (النموذج) بآخر أفضل أو تزويد الدماغ بـ “أدوات وإرشادات” أفضل (Harness، أي إطار التشغيل/كلمات التوجيهية/سلسلة الأدوات). لكن أحدث ورقة بحثية (WHALE) أثبتت أنه لا يمكن فصل هذين العنصرين عن بعضهما البعض، بل يجب تحسينهما بالتناوب لتحقيق أفضل النتائج.

لكن (وهنا يأتي الجزء المهم):

على الرغم من أن التحسين المشترك يؤدي إلى أفضل النتائج من الناحية التقنية، إلا أنه في بيئة الإنتاج الفعلية للشركات، لا يمكن السماح لهما بالتطور بشكل غير محدود. فعندما يصبح التكامل بين “الدماغ” و“الأدوات” مفرطًا، فإن تكلفة تغيير أي منهما تصبح مرتفعة للغاية (وهذا ما يُعرف بـ “ضريبة التكامل”).

الاستنتاج النهائي:

يمكن أن تتطور القدرات بالتزامن، لكن يجب أن يكون التنفيذ موحدًا (يجب أن تكون الواجهات موحدة والإصدارات قابلة للتحكم). يجب على الشركات اعتبار الذكاء الاصطناعي منتجًا برمجيًا كاملًا يتم نشره وإدارته، وليس مجرد تجربة متغيرة باستمرار.

---

🔍 التفسير المفصل: خمسة أبعاد لفهم حقيقة إنتاج مساعدي الذكاء الاصطناعي

1. لماذا لا يكفي “تدريب الدماغ” وحده أو “تعديل الإرشادات” وحدها؟ (المنطق الأساسي لورقة البحثية WHALE)

مثال بسيط:

تخيل أن النموذج (Model) هو طالب جامعي ذكي تخرج حديثًا، وإطار التشغيل (Harness) هو صندوق الأدوات وعمليات العمل الخاص به.

  • الطرق السابقة:
  • إما تدريب الطالب فقط (تعديل النموذج) دون الاهتمام بجودة الأدوات.

النتيجة: الطالب ذكي، لكن الأدوات سيئة ولا يمكنه استغلال قدراته بشكل كامل.

  • أو تحسين صندوق الأدوات فقط (تعديل كلمات التوجيهية أو إضافة وسائل البحث) دون الاهتمام بقدرات الطالب.

النتيجة: صندوق الأدوات مثالي، لكن الطالب لا يملك المهارات الكافية لاستخدامه.

  • الاكتشاف الجديد في ورقة البحثية WHALE:
  • إذا ثبتت صندوق الأدوات، فإن الطالب سيتعلم كيف يستخدم الأدوات السيئة بشكل مؤقت، بدلاً من اكتساب مهارات حقيقية.
  • إذا ثبت الطالب، فإن صندوق الأدوات سيتم تصميمه خصيصًا لمشاكله. وعند تغيير الطالب إلى آخر أكثر ذكاءً، قد يصبح صندوق الأدوات عائقًا.
  • الطريقة الصحيحة:
  • التحسين المتبادل: تدريب النموذج أولاً، ثم تعديل صندوق الأدوات وفقًا لخصائصه الجديدة؛ ثم تكرار العملية.
  • النتيجة: أظهرت التجارب أن هذه الطريقة تحسنت الدقة بنسبة 4 إلى 24 نقطة مئوية مقارنة بالتحسين المنفرد لأي من العنصرين.

💡 تعليق الصحفي:

هذا مثل تجديد المنزل: لا يمكنك شراء أفضل أريكة (النموذج) دون الاهتمام بمواقع المقابس (إطار التشغيل)، ولا يمكنك تغيير المقابس دون الاهتمام براحة الأريكة. يجب أن يتناسق الاثنان، لكن هذا التناسق يجب أن يكون ديناميكيًا.

2. لماذا قد تتحول النتائج الممتازة في المختبر إلى كارثة في بيئة الإنتاج؟ (الاختلافات في الأهداف)

مثال بسيط:

  • الهدف في الأبحاث: الحصول على درجات عالية في الاختبارات.
  • الهدف في الشركات: تحقيق الأرباح، تقليل التكاليف، وتجنب المشاكل.

الاختلافات الرئيسية:

في الأبحاث، قد يتطلب الحصول على درجة إضافية تنفيذ برامج إضافية. لكن في بيئة الإنتاج، قد تؤدي هذه الدرجة إلى:

  • زيادة التكاليف: الحاجة إلى المزيد من الخوادم ووقت تدريب أطول.
  • زيادة المخاطر: قد تظهر مشاكل غير متوقعة تتطلب إصلاحًا يدويًا.

مشاكل الصيانة: قد يتم إضافة العديد من التعديلات لتحقيق هذه الدرجة، مما يجعل من الصعب إزالتها لاحقًا.

💡 تعليق الصحفي:

تسعى الأوساط الأكاديمية إلى “الأداء المثالي”, بينما تسعى الصناعة إلى “الاستقرار والفعالية”. هذا يفسر سبب عدم نجاح العديد من النماذج الذكاء الاصطناعي في الشركات.

3. ما هي “ضريبة التكامل” ولماذا تكون أغلى من النموذج نفسه؟

مثال بسيط:

“التكامل” يعني أن الأجزاء متصلة بشكل وثيق لدرجة عدم القدرة على فصلها.

“ضريبة التكامل” هي التكلفة العالية التي تتكبدها عند محاولة فصل أحد الأجزاء.

سيناريو محتمل:

افترض أن نظام الذكاء الاصطناعي يتكون من “النموذج A” و“الإطار B” اللذين يعملان بشكل متناغم.

  • النموذج A اعتاد على تنسيق معين في الإطار B.
  • منطق معالجة الأخطاء في الإطار B مصمم خصيصًا لخصائص النموذج A.
  • عند ترقية النموذج إلى “النموذج C” (أرخص أو أقوى)، قد يفشل الإطار B تمامًا.
  • قد تضطر إلى إعادة كتابة الإطار B أو إعادة تعديل جميع واجهات الأدوات، مما يكون عملية معقدة ومليئة بالأخطاء.

المشكلة الأكبر: “الديون التقنية”

مع مرور الوقت، قد يتم إضافة العديد من التعديلات لإصلاح المشاكل الصغيرة، مما يجعل النظام غير مستقر.

  • قد تؤدي هذه التعديلات إلى مشاكل أخرى، ويصبح النظام مليئًا بالتعديلات غير الضرورية.

💡 تعليق الصحفي:

تركز ممارسات الصيانة والتشغيل في الذكاء الاصطناعي (MLOps) على الوحدات المعيارية والقابلية للاستبدال لتقليل “ضريبة التكامل”. إذا كان يتعين إعادة كتابة النظام مع كل تغيير في النموذج، فإن النظام يصبح هشًا.

4. ما شكل أنظمة الذكاء الاصطناعي في المستقبل؟ سينقسم “إطار التشغيل” إلى جزأين

يقترح المقال فكرة مثيرة: “إطار التشغيل” لن يختفي، لكنه سينقسم إلى نوعين:

النوع الأول: إطارات تفكيرية (ستُستبدل/تُبسط)

  • ما هي: التعديلات المضافة لتعويض نقاط ضعف النموذج (مثل تذكيرات لإكمال الكتابة أو إعادة قراءة النص).
  • الاتجاه: مع تطور النماذج (مثل GPT-5 وClaude 4)، ستصبح هذه التعديلات غير ضرورية، لأن النماذج ستتعلم كيفية التصرف بشكل مستقل.
  • مثال: في الماضي، كان على المهندسين إضافة وظائف لمساعدة النماذج على التذكر، لكن النماذج الحديثة تستطيع التصرف بشكل مستقل.

النوع الثاني: إطارات نظامية (ستصبح أكثر أهمية)

  • ما هي: تتعلق بالأمان والصلاحيات وإدارة الحالة (مثل الصلاحيات على البيانات أو التحكم في العمليات).
  • الاتجاه: مع تطور النماذج، ستزداد الحاجة إلى إطارات أكثر أمانًا وموحدة للتحكم في العمليات.

💡 تعليق الصحفي:

في الماضي، كنا نركز على ما إذا كان الذكاء الاصطناعي يعمل بشكل صحيح، لكن في المستقبل سنركز على ما إذا كان يمكننا الوثوق به للقيام بمهام معينة. الذكاء سيتطور، لكن الصلاحيات والإدارة يجب أن تظل موحدة.

5. نصائح عملية للشركات: لا تسعى للتطور اللامحدود، بل لإصدار الإصدارات الموحدة

الاستراتيجية الأساسية: WHALE-lite (التحسين المشترك المخفف)

لا تحاول جعل أنظمة الذكاء الاصطناعي تتطور باستمرار مثل الكائ