虎嗅

العنوان العربي: جاء GPT-6، وتحدثنا مع العديد من الخبراء حول الحواجز والعقبات المتعلقة بالذكاء الاصطناعي القابل للتطبيق العملي.

原文:GPT-6 来了,我们和多个局内人聊具身智能的护城河与暗礁

GPT-6 وصل… هل ما زالت “الحواجز” الواقية للذكاء الجسدي موجودة؟ – تحليل عميق حول القلق والفرص والأساسيات

مرحبًا بكم، أنا صحفي مالي واقتصادي. مؤخرًا، أثارت تقنيات الذكاء الاصطناعي ضجة كبيرة، حيث أطلقت شركة OpenAI نسخة Astra من GPT-6 وأعلنت عن نيتها تطوير روبوتات بشرية الشكل. هذا كما لو أن عملاقًا يحمل “سيفًا قاتلًا” قال فجأة: “أريد أن أذهب للزراعة”.

بالنسبة للشركات الناشئة في مجال الذكاء الجسدي التي تعمل بجد على تطوير الهاردوير والخوارزميات، هذا ليس فقط ضغطًا، بل أزمة وجودية: إذا أصبح الذكاء الاصطناعي ذكيًا بما فيه الكفاية، هل سيحتاج الناس إلى خبراء متخصصين في الروبوتات؟ هل سيتم سرقة وظائفنا؟

اليوم، سنستعرض وجهات نظر عدد من الخبراء في المجال (مثل زو تشنغ من شركة Jijia Vision، وزو شينغ من شركة Ant Lingbo، ووانغ تشيان من شركة Zibianjiang) لنفسر الأمر بطريقة بسيطة وواضحة: ما الذي جلبه GPT-6 بالضبط؟ أين تكمن “الحواجز” الواقية للذكاء الجسدي؟ هل يجب أن نقلق أم نبقى هادئين؟

---

أولاً: الذئب قد وصل… لماذا بدأ الجميع يشعرون بالقلق فجأة؟

أولاً، يجب أن نعترف بأن هناك أسبابًا حقيقية لهذا القلق، وليس مجرد شائعات.

1. إحساس بالهجوم المباشر

كان الجميع يعتقدون في السابق أن تطوير نماذج اللغة (مثل ChatGPT) والروبوتات (الذكاء الجسدي) أمران مختلفان. لكن الآن، يمكن لـ GPT-6 Astra ليس فقط التحدث، بل أيضًا التحكم المباشر في الأذرع الميكانيكية. في مقاطع الفيديو، رأيناه يمسك العيدان ويضع الكوب بطريقة متقنة.

زو تشنغ من Jijia Vision قال بصراحة: “الذئب قد وصل، تخلوا عن الأوهام.” منطقه هو أن نماذج اللغة قد “استولت” بالفعل على القدرات المتعددة الأشكال (مثل التعرف على الصور والأصوات)، والآن تبدأ في التأثير على الذكاء الجسدي. بالإضافة إلى ذلك، تتمتع شركة OpenAI بميزة كبيرة في المواهب والقوة الحاسوبية ورأس المال مقارنة بالشركات الناشئة. إذا قررت هذه الشركات المشاركة مباشرة في التطوير، سيكون من الصعب على الشركات الناشئة المقاومة.

2. إلحاح الوقت

يعتقد زو تشنغ أن العامين القادمين هما فترة حرجة. الشركات الناشئة في مجال الذكاء الجسدي لم تقم بعد ببناء “حواجز” واقية حقيقية لا يمكن للآخرين اختراقها. إذا دخلت الشركات الكبرى السوق الآن، فقد تتمكن من سد الفجوة التقنية بسرعة، مما يؤدي إلى إقصاء الشركات الناشئة التي لا تزال في مراحل تطوير المنتجات الأولية.

**3. جوهر القلق: الخوف من “تحقيق القيمة مسبقًا”

جوهر القلق هو أن قيمة الذكاء الجسدي كانت تحتاج إلى سنوات من البحث والتطوير من قبل الشركات الناشئة. لكن الآن، قد تقوم الشركات الكبرى بتحقيق هذه القيمة مسبقًا من خلال إطلاق نماذج أقوى، وتحصل على الأرباح بدلاً من الشركات الناشئة.

---

ثانيًا: لا داعي للقلق المفرط: دخول النماذج الكبيرة إلى العالم المادي ليس بهذه السهولة

على الرغم من القلق الحقيقي، كانت هناك أيضًا آراء هادئة في نفس المؤتمر. زو شينغ من شركة Ant Lingbo ووانغ تشيان من شركة Zibianjiang طرحوا سؤالًا حادًا: إذا كانت OpenAI قوية جدًا، لماذا لا تطور روبوتات للقيادة الذاتية وتستولي على شركة Tesla؟

**1. “الفهم” لا يعني “القدرة على التنفيذ”

نماذج اللغة قوية في مجال “المعاني” و“المنطق”، مثل معرفة ما هو “كوب” ومعنى الأمر “ضع الكوب على الطاولة”. لكن العالم المادي معقد وديناميكي ومليء بالعوامل المؤثرة.

  • المستوى المعنوي (الدماغ): معرفة مكان الأشياء وإرسالها إلى المكان المناسب. GPT-6 قوي في هذا الجانب.
  • المستوى المادي (الأذرع والأيدي): معرفة كيفية استخدام القوة بشكل صحيح وتعديل الزوايا والتعامل مع الانزلاقات. هذه هي نقاط ضعف GPT-6 حاليًا.

2. الفجوة بين البيانات والتحقق

يشير وانغ تشيان إلى أن تقدم نماذج اللغة يعتمد على كميات هائلة من البيانات وأنظمة تحقق متطورة. التقدم في توليد الفيديوهات لم يحل مشكلة التحكم في حركات الروبوتات بشكل مباشر.

تحتاج الشركات الكبرى إلى تطوير البنية التحتية لدخول العالم المادي:

  • بيانات حقيقية: بيانات عن سقوط الروبوتات وفشلها في التقاط الأشياء.
  • تكيف الهاردوير: أذرع ميكانيكية مختلفة وأجهزة استشعار مختلفة تتطلب استراتيجيات تحكم مختلفة.
  • أنظمة التحقق: كيفية التأكد من أن الروبوت يقوم بما هو مطلوب بشكل صحيح؟ هذا يتطلب نظام تقييم معقد.

3. الفجوة في القدرات الصناعية

يستخدم زو شينغ مثال القيادة الذاتية: قد تكون النماذج الكبيرة قوية، لكنها لا تمتلك القدرة على فهم السياقات المختلفة أو تجربة التعامل مع التحديات في البيئة الواقعية.

---

ثالثًا: تحليل الحقائق: ماذا يمكن لـ GPT-6 أن يفعل بالضبط؟ وماذا لا يمكنه؟

لفهم مكانة GPT-6 في مجال الذكاء الجسدي بشكل أفضل، قام فريق البحث في RoboDojo بإجراء اختبارات محددة. النتائج كانت مثيرة للاهتمام: GPT-6 ليس “إلهًا” ولا “عديم الفائدة”, بل هو مستشار قوي.

1. نقاط قوة: الفهم المعنوي والإدراك المكاني

أظهرت الاختبارات أن GPT-6 قوي في:

  • التعرف على الأشياء على الطاولة.
  • مسك العيدان الدقيقة ووضعها في الكوب.
  • التخطيط لعمليات غير مباشرة مثل “الدفع” و“التحريك”.

هذا يدل على أن GPT-6 قوي في معرفة ما يجب القيام به وفهم العلاقات المكانية.

2. نقاط ضعف: التفاعلات المعقدة والعمليات الدقيقة

لكن عندما تصبح المهام أكثر تعقيدًا، مثل:

  • استخدام العيدان لتحريك الأشياء.
  • ترتيب الملابس.

*َ تسليم الأشياء باليدين، يكون أداء GPT-6 غير مرضي.

السبب هو وجود العديد من المتغيرات “غير المرئية” في التفاعلات المادية، مثل الاحتكاك ومرونة الأشياء وتغيرات الوزن الدقيقة، والتي لا يمكن تحديدها فقط من خلال المظهر (الرؤية)، بل تحتاج إلى تعديلات في الوقت الفعلي.

3. البنية المختلطة هي الحل الأمثل

أظهرت أبحاث RoboDojo أن البنية المختلطة (GPT-6 + نموذج جسدي متخصص) تحقق نتائج أفضل:

  • التحكم المباشر بواسطة GPT-6: نسبة نجاح 26%.
  • التحكم المشترك بين GPT-6 ونموذج جسدي متخصص (π₀.₅): نسبة نجاح 48%.

هذا يدل على أن الجمع بين التفكير العام والخبرة المحلية هو الحل الأمثل. GPT-6 مسؤول عن التخطيط العام (مثل “أخذ الكوب أولاً، ثم الملعقة”)، بينما يتولى النموذج الجسدي التنفيذ الفعلي.

---

رابعًا: أين تكمن “الحواجز” الواقية؟ إعادة تعريف “البيانات” و”النظام المغلق”

بما أن GPT-6 قوي جدًا، فأين تكمن “الحواجز” الواقية للشركات الناشئة في مجال الذكاء الجسدي؟ كان الجميع يقولون سابقًا “لدينا بيانات”, لكن هذا الادعاء يحتاج إلى إعادة التقييم الآن.

1. “الحواجز البياناتية” تتلاشى

شارك لي تيانيو من شركة Yuance Future إلى اتجاه جديد: بدأوا باستخدام GPT-6 لإنشاء سيناريوهات محاكاة بسرعة وبتكلفة منخفضة.

  • سابقًا: كان بناء سيناريوهات ثلاثية الأبعاد يتطلب الكثير من العمل اليدوي والوقت والمال.
  • الآن: يمكن لـ GPT-6 إنشاء سيناريوهات منطقية ومتكاملة بسرعة.

هذا يعني أن “امتلاك البيانات” لم يعد نادرًا، لأن تكلفة إنتاج البيانات تنخفض. الميزة التي كانت تعتمد على تراكم البيانات تت