ملخص المحتوى الرئيسي
تدور هذه المقالة حول “نماذج العالم” في مجال الذكاء الاصطناعي، وتشير إلى أن نماذج اللغة الكبيرة الحالية (مثل ChatGPT) تعاني من عيوب جوهرية في مهام مثل التفكير المادي والتخطيط المكاني بسبب نقص التجربة الواقعية؛ بينما تُعتبر “نماذج العالم”، كأنظمة قادرة على محاكاة العواقب الفعلية، طريقًا رئيسيًا نحو الذكاء الاصطناعي العام (AGI). كما تستعرض المقالة الأصول العلمية لنماذج العالم في علم الإدراك، وتقدم التطبيقات التجارية (تدفق رأس المال، توزيع الشركات الرائدة)، والخلافات في المسارات التقنية (إعادة البناء على مستوى البكسلات مقابل التمثيل المجرد)، بالإضافة إلى الفجوات المتبقية بين هذه النماذج والذكاء الاصطناعي العام (مثل مشاكل التجريد الزمني والوعي الذاتي).
التفسير المفصل
1. عيوب نماذج اللغة الكبيرة: نقص “المعرفة الشائعة” بالعالم الحقيقي
يمكن فهم ذلك من خلال مثال بسيط: عند سؤال الذكاء الاصطناعي “ماذا يحدث إذا سقط كوب على الأرض؟”, قد يستخدم مصطلحات متخصصة مثل “الطاقة الكامنة للجاذبية” و“موجات الإجهاد”, بينما يقول طفل في سن الخامسة أو السادسة ببساطة “الكوب يتحطم”. السبب هو أن نماذج اللغة الكبيرة تركز على “التنبؤ بالكلمة التالية” وتُدرب على كميات هائلة من النصوص، لكنها لم تشهد أبدًا سقوط كوب فعليًا؛ بدون تجربة واقعية، لا يمكنها فهم القوانين الفيزيائية حقًا.
على سبيل المثال، عند التنقل، قد تتمكن هذه النماذج من حفظ مسارات، لكنها تصاب بالحيرة عند طلب تغيير المسار (لأنها تعتمد فقط على وصف نصي ولا تمتلك “خريطة ذهنية” كالإنسان)؛ أما مهام يومية مثل ترتيب الملابس، فهي غير قادرة عليها على القيام بها إطلاقًا لأنها تفهم فقط الوصف ولا تدرك الواقع. هذه هي العيب الجوهري في نماذج اللغة الكبيرة: إنها “خبراء في النصوص”, ليست “خبراء في الواقع”.
2. نماذج العالم: أنظمة تسمح للذكاء الاصطناعي بـ“تخيل” العواقب مثل البشر
جاءت فكرة نماذج العالم من عالم النفس كريك في عام 1943، الذي اقترح أن الدماغ البشري يحتوي على “نموذج صغير” قادر على محاكاة عواقب الأفعال المختلفة (مثل التفكير في أن سقوط كوب سيؤدي إلى تحطمه)، وتطورت لاحقًا نظرية “معالجة التنبؤ” التي تشير إلى أن الإدراك البشري يعتمد على التنبؤ المستمر بالعالم ثم تصحيحه باستخدام معلومات الحواس.
يرغب الباحثون في الذكاء الاصطناعي في منح أنظمتهم هذه القدرة: تجربة العواقب داخليًا قبل التنفيذ لتجنب الأخطاء في الواقع. على سبيل المثال، يقول يانغ ليكون (الحاصل على جائزة تورينغ): “الذكاء الاصطناعي بدون قدرة على التنبؤ ليس ذكاءً حقيقيًا؛ الذكاء يعني استخدام الأفكار لتجربة الحلول نيابة عنا”.
3. تدفق رأس المال نحو نماذج العالم كاتجاه جديد في الذكاء الاصطناعي
في العامين الماضيين، أصبحت نماذج العالم محط اهتمام كبير من قبل رأس المال والشركات الكبرى:
- تم جمع 230 مليون دولار لتأسيس شركة World Labs التابعة للخبير في الذكاء الاصطناعي لي فيفي لتطوير “الذكاء المكاني”؛
- غادر يانغ ليكون شركة Meta وأسس مختبر AMI بتمويل قدره 1 مليار دولار لتطوير نماذج العالم؛
- نظام Dreamer4 التابع لشركة Google DeepMind شاهد العديد من مقاطع فيديو من لعبة “Minecraft” ويستطيع تعلم كيفية استخراج الماس (عملية تتطلب عدة خطوات، مثل جمع الموارد وصنع الأدوات).
لكن هذه مجرد نماذج أولية: فشركة World Labs لديها أداة Marble لإنشاء مشاهد ثلاثية الأبعاد فقط، بينما يُعتبر نظام Genie3 مجرد محاكي للألعاب ولا يزال بعيدًا عن أن يصبح روبوتًا قادرًا على القيام بمهام منزلية.
4. الخلافات في المسارات التقنية: إعادة البناء على مستوى البكسلات مقابل التمثيل المجرد
هناك خطان رئيسيان تقنيين يتنافسان بشدة:
- إعادة البناء على مستوى البكسلات: مثل Dreamer4، التي تحاول إعادة كل بكسل أثناء التدريب لمحاكاة العالم بدقة. الميزة هي التفاصيل الكاملة، لكنها تتطلب كميات كبيرة من البيانات؛
- التمثيل المجرد: مسار JEPA الذي يطوره يانغ ليكون، حيث لا يتم إعادة إنشاء التفاصيل ولكن يتم التركيز فقط على المعلومات الضرورية للتفكير (مثل تحطم الكوب دون الحاجة إلى معرفة مواقع الشظايا). الميزة هي استخدام كميات أقل من البيانات، لكن السؤال هو: هل المعلومات المجردة كافية لدعم التفكير المعقد؟ على سبيل المثال، نظام V-JEPA2 يمكنه تعلم قوانين حركة الأجسام، لكن لم يتم إثبات قدرته على دعم كائنات ذكية في بيئات مفتوحة.
كلا المسارين لهما مبرراتهما: يعتقد هافنا (مطور Dreamer4) أن إعادة البناء على مستوى البكسلات يمكن أن تؤدي إلى التعلم المجرد، بينما يرى يانغ ليكون أن التمثيل المجرد أكثر كفاءة.
5. الفجوات المتبقية نحو الذكاء الاصطناعي العام
حتى مع تحسن نماذج العالم، لا يزال هناك العديد من العقبات قبل الوصول إلى الذكاء الاصطناعي العام:
- التجريد الزمني: الذكاء الاصطناعي حاليًا يمكنه فقط التنبؤ باللحظة التالية، ولا يستطيع التفكير في “العواقب طويلة المدى” (مثل السعي لتحسين مستقبله من خلال الجهد الحالي)؛
- الوعي الذاتي: الذكاء الاصطناعي لا يعرف ما يعرفه أو لا يعرفه، وقد يستجيب بشكل خاطئ دون أن يدرك ذلك؛
- العلاقات السببية المتعددة وفهم تفكير الآخرين: البشر قادرون على فهم العلاقات السببية المعقدة (مثل “الطريق زلق بسبب هطول الأمطار”) وتخمين ما يفكر فيه الآخرون (مثل “تجعيدهم للحزن”).
يقول الخبراء: نماذج العالم ضرورية، لكنها ليست كافية بمفردها؛ الذكاء الاصطناعي العام يحتاج إلى مجموعة من المهارات المختلفة.
خلاصة
تُعد نماذج العالم خطوة مهمة نحو تطوير الذكاء الاصطناعي، لكنها ليست “الحل السحري”؛ لجعل الذكاء الاصطناعي يفكر مثل البشر، ما زال هناك طريق طويل يجب قطعه.