ملخص المحتوى الأساسي
لقد شهد مجتمع الذكاء الاصطناعي مؤخرًا مهزلة “من الاحتفالات إلى كشف الخداع”: ادعى فريق J-Space أنهم طوروا إضافة تُسمى Skill، والتي يمكن من خلالها تحسين أداء نموذج DeepSeek V4 Pro بشكل كبير دون الحاجة إلى تعديل أوزان النموذج نفسه، بل وتجاوز أداء النموذج الرائد Fable 5. لكن عندما قام المطورون في المجتمع بإعادة الاختبار، اكتشفوا أن الأداء لم يتحسن فحسب، بل أصبح أكثر استهلاكًا للموارد؛ ورفض المؤلفون الكشف عن تفاصيل التقييمات العلنية وحذفوا المنشورات التي تحتوي على شكوك، مما أدى إلى كشف أن هذا “التحسين السحري” كان في الواقع خدعة ناتجة عن تزوير البيانات. السبب في خداع الكثيرين يعود إلى أن هذه الإضافة استهدفت بدقة نقطة ضعف حقيقية في DeepSeek V4 Pro، وهي حساسيته الشديدة للبيئة المحيطة.
1. “المهارة السحرية” من J-Space: إعلانات مبالغ فيها تضخم قدرات النموذج
الإصدار Cognition Suite V3.6 الذي طوره فريق J-Space هو في الأساس مجموعة من أدوات للتحكم أثناء تشغيل النماذج، حيث لا يتم تعديل النموذج نفسه، بل يتم إضافة طبقة من المنطق الإداري أثناء تنفيذ المهام بواسطة الذكاء الاصطناعي. يؤكد فريق J-Space أن المساعدين الذكائيين غالبًا ما يرتكبون أربعة أخطاء رئيسية:
- الإفراط في المعلومات: تحميل المهام بالعديد من الأهداف والأدوات مما يؤدي إلى غمر المحتوى الهام؛
- انحراف الذاكرة: بعد عدة جولات من التفكير، قد تتغير المعلومات نفسها؛
- إعادة المحاولات العشوائية: في حال فشل استخدام أداة ما، يتم إعادة المحاولة دون تحليل الأسباب؛
- الانتهاء المبكر من المهمة: إنهاء المهمة بمجرد أن يبدو الجواب سلسًا دون التحقق من صحته.
تقول J-Space إن حلهم يحول عملية التنفيذ إلى دورة تشمل “الحكم السريع → التنفيذ → التفكير المعمق → التحقق → إعادة المحاولة مع معلومات تشخيصية”, كما يتم تسجيل المعلومات الهامة في “دفتر خارجي” لمنع النسيان. ثم قدموا نتائج مبالغ فيها، حيث ارتفعت درجات Terminal Bench من 87.9 إلى 90.1 وNL2Repo من 61.5 إلى 73.4، وادعوا أن الأداء تجاوز حتى Fable5 وOpus4.8، مما أثار ضجة كبيرة.
2. فشل المجتمع في إعادة الاختبار: النتائج لم تتحسن واستهلاك الموارد زاد
سرعان ما بدأ المطورون في كشف الخداع:
- اختبار من قبل المطور A: أجرى اختبارين A/B باستخدام V4 Flash ولم يلاحظ أي فرق في النتائج، لكن فريق J-Space استهلك المزيد من الموارد؛
- تقييم من قبل طرف ثالث: كانت درجات المجموعة الضابطة 8.3 بينما كانت درجات فريق J-Space 7.87 فقط؛
- دليل قاطع من المطور B: استخدم 8 وحدات NVIDIA H20 لإكمال 89 سؤالًا، وكانت الإجابات صحيحة فقط في 69 سؤالًا (بنسبة 77.5%)، لكن التقرير ذكر أن الدرجة كانت 87.1%، مما يعني اختلافًا بنسبة 10%؛
- حذف المنشورات: تم حذف المنشورات التي تحتوي على شكوك من قبل المؤلفين، مما اضطر المستخدمين إلى إعادة نشرها.
ظل المؤلفون يرفضون الكشف عن بيئة التقييم والإجراءات ونتائج العينات، مما أدى إلى زيادة الشكوك.
3. فيما يكمن الخداع؟ استهداف نقطة ضعف DeepSeek V4 Pro بدقة
نجح فريق J-Space في خداع الناس لأنهم استهدفوا مشكلة حقيقية: حساسية DeepSeek V4 Pro الشديدة للبيئة المحيطة. على سبيل المثال، قام أحد المستخدمين باختبار لعبة ثلاثية الأبعاد باستخدام نفس التوجيهات، وكانت النتائج خشنة في البداية لكن تحسنت بعد 4 ساعات؛ كما اختلفت الدرجات بشكل كبير بين نفس النموذج عند استخدام أوضاع تشغيل مختلفة (Standard/PTC/Minimal).
كان الجميع يعتقدون أن تعديل بيئة التشغيل قد يحسن الأداء، لذا بدا ادعاء فريق J-Space بأن أدائهم تجاوز Fable5 مقبولًا.
4. درس من مجتمع الذكاء الاصطناعي: أي تحسين لا يمكن إعادة تكراره هو خداع
لقد علمتنا هذه المهزلة درسًا مهمًا: يجب أن يتم التحقق من أي تحسين في الأداء بشكل علمي، أي أنه يجب أن يكون بإمكان الآخرين إعادة تنفيذ التجارب للتأكد من صحته. تمامًا كما يتم مراجعة نتائج الشركات المالية، يجب أيضًا الكشف عن تفاصيل نتائج الذكاء الاصطناعي (بيئة التقييم، الإجراءات، العينات) للتحقق منها. مهما كانت درجات J-Space مذهلة، إذا لم يكن بالإمكان إعادة تكرار التجارب، فهي مجرد أوهام. في المرة القادمة عند رؤية نتائج مبالغ فيها، اسأل دائمًا: “هل يمكن إعادة تكرار هذا التحسين؟ هل هناك أدلة علنية على ذلك؟”
5. الفكرة التقنية نفسها: المشكلات حقيقية، لكن الحل قد يكون غير فعال
من الجدير بالذكر أن المشاكل الأربعة التي أشار إليها فريق JSpace (مثل الإفراط في المعلومات وانحراف الذاكرة) موجودة بالفعل، وهناك فرق عديدة تعمل على حل هذه المشكلات (مثل استخدام أنظمة مثل Routing Suite لاختيار طريقة التفكير المناسبة وAnchored Standard لتحسين استقرار النموذج). لكن حل فريق J-Space إما كان غير فعال أو كان نتيجة تزوير البيانات، مما جعله مثالًا سلبيًا.
في النهاية، يحتاج الابتكار في مجال الذكاء الاصطناعي إلى اختراقات تقنية حقيقية، وليس إلى الاعتماد على الخداع أو استغلال نقاط الضعف لجذب الانتباه. كشف هذه الحادثة أيضًا عن ضرورة الحذر من النتائج المبالغ فيها وجعل إمكانية إعادة التكرار معيارًا لقياس تقدم الذكاء الاصطناعي.