虎嗅

العنوان الصيني: "جي بي تي-6 يتعرف على كل شيء، ما الذي يتبقى من نموذج الأساس المادي؟" العنوان المترجم إلى العربية: "جي بي تي-6 يتعرف على كل شيء، ما الذي يتبقى من نموذج الأساس المادي؟" توضيح: تم ترجمة العنوان الصيني إلى العربية مباشرةً مع الحفاظ على معناه الأصلي. تم استخدام تعبير "جي بي تي-6" كاسم للنموذج الذكاء الاصطناعي، بينما تم ترجمة "الأساس المادي" كوصف للنموذج الفيزيائي أو البرمجي الذي يدعم عمل هذا النموذج. العنوان يثير التساؤل حول ما الذي قد يتبقى من هذا النموذج بعد أن أصبح قادر

原文:GPT-6认出了万物,具身基座模型还剩什么

هل هذا ضربة قوية لصناعة الروبوتات؟ كيف يمكن لـ GPT-6 Astra أن يغير قواعد اللعبة في مجال الذكاء الجسدي؟

مرحبًا بكم، أنا صحفي مالي وعالم اقتصاد. اليوم سنتحدث عن مقال مثير للاهتمام حول هذا الموضوع.

ببساطة، خلال العامين الماضيين، كانت صناعة الروبوتات (الذكاء الجسدي) تروي قصة مفادها: "على الرغم من أن النماذج الكبيرة ذكية، إلا أنها لا تفهم العالم الفيزيائي، لذلك نحتاج إلى تدريب روبوتاتنا على 'عقل' خاص (نموذج أساسي)."

لكن مع إطلاق OpenAI لـ GPT-6 Astra مؤخرًا، أصبحت هذه القصة موضع تساؤل كبير. فقد أظهر Astra قدرة مذهلة: يمكنه إعادة إنشاء بيئة افتراضية قابلة للتفاعل بناءً على صورة واحدة فقط، دون الحاجة إلى تدريب خاص.

هذا مثل شخص لم يدخل المطبخ من قبل، ينظر إلى صورة للوصفة، لا يتعرف فقط على جميع المكونات، بل يعرف أيضًا أين يجب وضعها، وحتى يمكنه محاكاة عملية الطهي (على الرغم من أن الطعم قد لا يكون صحيحًا).

هذا يمثل تحذيرًا كبيرًا للشركات الناشئة التي تنفق أموالًا طائلة على تدريب "عقول" الروبوتات. دعوني أشرح هذا المقال من خمسة جوانب لكي تفهموا التغيرات في الصناعة بشكل كامل.

---

1. القصة الأساسية: من "التحدث من خلال الصور" إلى "بناء عوالم"، ماذا فعل Astra؟

أولاً، يجب أن نفهم ما القدرة التي أظهرها Astra ولماذا هذا مثير للقلق.

في الماضي، كان من الصعب على الروبوتات فهم العالم الفيزيائي، وكانت هناك مشكلة تُعرف بـ "Real2Sim" (من العالم الحقيقي إلى العالم الافتراضي). على سبيل المثال، إذا أظهرت لروبوت صورة لطاولة بها كوب وسائل، فإنه عادةً ما يمكنه فقط التعرف على "هذا كوب" و"هذا سائل".

لكن هذه المرة، أعطى المطورون لـ Astra هذه الصورة وطلبوا منه إنشاء بيئة افتراضية قابلة للتفاعل. وقد نجح Astra في القيام بذلك:

  • تحديد الأشياء: يعرف أنها وعاء وسائل.
  • فهم المساحة: يعرف أن السائل داخل الوعاء وأن الوعاء على الطاولة.
  • إعادة إنشاء التفاصيل: حتى أنه أعاد تمثيل لون السائل بدقة.
  • إنشاء كود: حول هذه الصور الثابتة إلى سيناريوهات برمجية قابلة للتشغيل.

النقطة الرئيسية هي: لم يتم تدريب Astra خصيصًا لهذا الموقف. لقد تعلم ذلك فقط من خلال "النظر" إلى الكم الهائل من الصور والفيديوهات والكتيبات على الإنترنت.

النقطة الضعيفة الوحيدة: لم يحاكي التفاعل الكيميائي عندما يختلط السوائل. يعرف ما يبدو عليه الماء، لكنه لا يعرف أن خلط الماء مع الكبريتيك سيؤدي إلى انفجار. هذا يدل على أنه يفهم "الرؤية"، لكنه لا يفهم العلاقات الفيزيائية الأعمق.

باختصار: Astra مثل متدرب لم يعمل من قبل، يعرف 99% من الأشياء الشائعة في العالم ويعرف كيفية استخدامها تقريبًا، لكنه لم يلمسها بنفسه، لذلك لا يعرف مقدار قوة الاحتكاك أو مدى خفة الضغط.

---

2. أزمة المعرفة: "التعرف على التفاح" لم يعد حصنًا واقيًا

يشير المقال إلى أن ظهور GPT-6 قد قلص بشكل كبير من مساحة العمل لشركات الذكاء الجسدي الناشئة، خاصة تلك التي ما زالت تتحدث عن "نموذج أساسي".

في الماضي، إذا استطاعت شركة جعل روبوتها يتعرف على تفاحة على الطاولة، كان ذلك يعتبر ميزة تقنية.

الآن، بفضل حجم بيانات التدريب الضخم لـ GPT-6 (الذي يشمل جميع الصور والفيديوهات والأوراق البحثية على الإنترنت)، أنشأ نموذجًا شاملًا للعالم الفيزيائي.

  • لم يمسك بكوب من قبل، لكنه رأى الكثير من الناس يفعلون ذلك.
  • لم يدخل مصنعًا، لكنه يمكنه التعرف على الأذرع الميكانيكية وخطوط الإنتاج.
  • لم يفتح درجًا من قبل، لكنه يعرف أين يوجد المقبض وكيف يجب سحب الدرج.

هذا يعني أن "تحديد الأشياء" و"فهم المشاهد" أصبحت مهارات شائعة، تمامًا مثل "القراءة"، ولم تعد نادرة.

بالنسبة للشركات الناشئة، إذا كانت الميزة الرئيسية لروبوتك هي "القدرة على فهم الأوامر والتعرف على الأشياء"، فأنت تتنافس مع عمالقة مثل OpenAI. ومن حيث القوة الحاسوبية وحجم البيانات وسرعة التطوير، لا يمكن للشركات الناشئة الفوز. مواصلة تدريب نموذج عام وشامل ليس فقط مكلفًا، ولكنه قد يكون مجرد تكرار لما قام به النموذج العام بالفعل.

باختصار: في الماضي، كان "القدرة على الفهم" ميزة، أما الآن فهي أساسيّة. إذا كنت تعتمد فقط على "الفهم" للحصول على العمل، فإن وظيفتك قد تُستحوذ عليها من قبل النماذج العامة.

---

3. حدود القدرات: لماذا لم يحاكي Astra التفاعل الكيميائي؟

هنا تفصيل دقيق جدًا، وهو الفرق الرئيسي بين "النماذج العامة" و"الذكاء الجسدي":

لقد أعاد Astra تمثيل لون السائل، لكنه لم يحاكي التفاعل الكيميائي عندما يختلط السوائل. لماذا؟

  • اللون هو معلومة بصرية يمكن تعلمها من الكم الهائل من الصور.
  • التفاعل الكيميائي يتطلب معرفة خصائص المواد والقوانين الفيزيائية والتغيرات السببية، وهو يحتاج إلى بيانات ونماذج أكثر دقة.

هذا يكشف عن منطق أساسي: التعرف على الأشياء لا يعني القدرة على التعامل معها بشكل موثوق.

يمكن للروبوت أن يشير بدقة إلى موقع الكوب وينشئ خطوات مثل "مد اليد، الإمساك، رفعه". لكن عند التنفيذ الفعلي:

  • ما مقدار القوة المطلوبة للمخالب؟
  • هل سينزلق الكوب إذا انحرف المقبض بمقدار 2 ملليمتر؟
  • كيف يجب تعديل السرعة بعد تحريك السائل داخل الكوب؟
  • ما مقدار قوة الاحتكاك بين المواد المختلفة؟

كل هذه الأمور تحتاج إلى تغذية راجعة من العالم الحقيقي، أي "الإحساس باللمس" و"القوة" و"تجارب الفشل". النماذج العامة (مثل Astra) تفتقر إلى هذه "التجارب الجسدية"؛ تعرف كيف يبدو الكوب، لكنها لا تعرف مدى وزنه أو مدى انزلاقه أو مدى هشاشته.

باختصار: Astra مثل متدرب نظري، يعرف كيف يجب القيام بالأمور، لكنه لا يعرف كيف تبدو عند التنفيذ الفعلي. القيمة الحقيقية للذكاء الجسدي تكمن في ملء هذا الفراغ.

---

4. تحويل القيمة: من "العقل" إلى "التجربة الجسدية"

بما أن النماذج العامة قد حلت مشكلة "المعرفة"، فأين تكمن فرص شركات الذكاء الجسدي الناشئة؟ يقدم المقال تقييمًا واضحًا: القيمة تتحرك إلى الخلف.

قد تتغير منطق التقسيم الوظيفي في المستقبل إلى ثلاث طبقات:

1. الطبقة العليا (المعرفية): توفرها النماذج العامة مثل GPT-6. مسؤولة عن فهم الأوامر وتحديد الأشياء وتخطيط خطوات المهام.

2. الطبقة الوسطى (تنبؤ الحركة): تقوم بها النماذج الجسدية. مسؤولة عن التنبؤ بكيفية تغير البيئة بعد تنفيذ الحركة.

3. الطبقة السفلية (التحكم): ترتبط بجسم الروبوت الفعلي. تحل مشاكل الدقة والتحكم في القوة والتأخير والأمان.

الحاجز الجديد للشركات الناشئة ليس حجم المعلمات، بل ما إذا كانت البيانات تحتوي على معلومات عن الحركات الفعلية.

  • بيانات الفيديو العادية: تخبر النموذج أن "الإنسان أمسك بالكوب". (لقد تعلم النموذج العام ذلك بالفعل).
  • بيانات التفاعل مع الروبوت: تسجل من أي اتجاه تقترب الذراع الميكانيكية، كيف تتحرك المفاصل، مقدار القوة التي تطبقها المخالب، وما إذا كان الإمساك ناجحًا أو فاشلاً.

هذه البيانات التي تشم