ملخص المحتوى الأساسي
يشهد مجال الذكاء الاصطناعي الجسدي (الروبوتات القادرة على التفاعل مع العالم الفعلي) ازدهارًا كبيرًا، لكن هناك سوء فهم في الصناعة حول اعتقاد أن “مليون ساعة من البيانات ستؤدي إلى تحقيق نقطة التحول مثل GPT”؛ ففعالية البيانات (كثافة المعلومات، تغطية الحالات الصعبة، قابلية النقل) أكثر أهمية من حجمها. تتجه الصناعة حاليًا نحو التركيز على الكفاءة بدلاً من تجميع البيانات، مع إعطاء الأولوية للسيناريوهات الصناعية والخدمية (حيث تكون الروبوتات ذات العجلات أكثر عملية من التلك ذات الشكل البشري). لا حاجة في الوقت الحالي إلى اختيار بين نهجين معينين لتطوير النماذج (VLA أو النماذج العالمية)، والحصانة التنافسية لشركات البيانات تكمن في دورة مغلقة تشمل جمع البيانات، تدريبها، نشرها، واستخلاص الدروس من الفشل، وليس فقط في كمية البيانات. لا يوجد فارق كبير بين الصين والولايات المتحدة، حيث تمتلك الصين مزايا في سلاسل التوريد والهاردوير.
التفصيل:
1. هل مليون ساعة من البيانات مجرد شعار؟ البيانات الفعالة هي ما يحدث فرقًا حقيقيًا
يقول الكثيرون إن الذكاء الاصطناعي الجسدي يحتاج إلى “مليون ساعة من البيانات”, لكن بينغ باي من شركة Kuwa Technology قدم مثالًا يخالف المألوف: قطع رحلة بطول 100 كيلومتر على طريق عادي لن يساعد النموذج في التعلم كثيرًا، بينما قد يكشف استخدام كيس بلاستيكي متطاير في سوق عن اختلافات في أداء أنظمة الرادار والرؤية عند التعامل مع العقبات المرنة… هذا يوضح فرق “زيادة قيمة المعلومات”.
المعايير الرئيسية لتقييم البيانات الفعالة:
- مصدر البيانات غير موثوق به: الكثير من “ملايين الساعات” من البيانات تُحسب بناءً على عدد وحدات النموذج اللغوي، ولا يمكن التحقق من صحتها أو دحضها؛
- يجب أن تستوفي البيانات ثلاثة معايير: ① قابلية التفسير (يمكن تحديد سبب الفشل من حيث الزاوية، القوة، أو الاستراتيجية)؛ ② كثافة الحالات الصعبة (نسبة السيناريوهات النادرة ولكن التي قد تؤدي إلى أخطاء)؛ ③ قابلية إعادة استخدام البيانات بين الروبوتات المختلفة (ليس مجرد تكلفة لمرة واحدة)؛
- يجب التوقف عن جمع البيانات إذا كانت القيمة التجارية للبيانات الجديدة أقل من تكلفة جمعها (نقطة تحول اقتصادية)، مثل عندما يصل معدل النجاح في سيناريو معين إلى 99٪.
2. تغير هيكل البيانات: الفيديوهات البشرية كأساس، والحالات الصعبة من الروبوتات الحقيقية كنقطة محورية
“وصفة” تدريب الذكاء الاصطناعي الجسدي ليست ثابتة، وقد تشكلت الآن هرمية ديناميكية:
- الطبقة الأساسية: فيديوهات من وجهة نظر شخص أول (مثل فيديوهات الطهي أو التنظيف على الإنترنت) – ذات حجم كبير وقدرة عالية على التعامل مع مختلف الروبوتات؛
- الطبقة الوسطى: بيانات محاكاة/مزيفة – تُستخدم لمحاكاة سيناريوهات قاسية (مثل أعطال المحطات النووية) لتعويض الحالات الصعبة في الواقع؛
- الطبقة العليا: حالات صعبة من الروبوتات الحقيقية (مشاكل تحدث أثناء التشغيل) – ذات قيمة عالية لتحسين استقرار النماذج؛
المنطق الأساسي: يجب أن تكون هذه الطبقات الثلاث متكاملة بشكل دوري (مثل إعادة إنتاج مشكلة استخدام كيس بلاستيكي باستخدام المحاكاة، ثم تكملتها بفيديوهات بشرية)، وليس بنسب ثابتة. يضيف جو جونليانغ من شركة Qianxun Intelligence أن الفيديوهات البشرية وحدها تفتقر إلى تفاصيل التفاعل مع الروبوتات، لذا يتم أيضًا استخدام بيانات من أجهزة UMI (التي تحتوي على مخالب قابلة للتحكم).
3. نهجي تطوير النماذج: VLA أو النماذج العالمية، لا حاجة إلى اختيار واحد في الوقت الحالي
هناك رأيان سائدان في الصناعة: VLA (تعلم الحركات مباشرة من الفيديوهات) والنماذج العالمية (تعلم القوانين الفيزيائية أولاً ثم اتخاذ القرارات). يعتقد المشاركون أن:
- عند وجود كمية كافية من البيانات، لا يكون هناك فرق كبير بين النهجين؛
- الأنظمة المتعددة الطبقات أكثر عملية (مثل Google Gemini Robotics) – حيث يتولى النموذج العلوي فهم المهام (مثل التنظيف)، بينما تتولى الروبوتات ذات القدرات المحددة تنفيذ الأوامر (مثل التدوير والكنس)؛
- لا حاجة إلى نموذج واحد شامل في السيناريوهات التجارية؛ العديد من العملاء يرغبون فقط في روبوت قادر على إكمال مهمة بشكل مستقر، دون الحاجة إلى نموذج واحد لكل شيء.
4. التسويق: البدء من السيناريوهات “المتوسطة”, والشكل البشري غير ضروري
كانت الجيل السابق من أنظمة التحكم الآلي يعتمد على تعديل البيئة لتتناسب مع الروبوتات (مثل الروبوتات المستخدمة في المراكز التجارية المغلقة)، أما الذكاء الاصطناعي الجسدي فهو يحتاج إلى تكيف الروبوتات مع المجتمع البشري (مثل الروبوتات المستخدمة في التنظيف على الأرصفة).
أولويات التطبيق:
- استبعاد السيناريوهات القاسية: ① السيناريوهات الصناعية المخصصة بشكل كبير (حيث تكون أنظمة التحكم الآلي متطورة بالفعل وربحيتها منخفضة)؛ ② السيناريوهات المنزلية (معقدة للغاية، خاصة إذا كان هناك كبار في السن أو أطفال أو حيوانات أليفة، مما يجعل التحقيق بالربح صعبًا في الوقت الحالي)؛
- اختيار السيناريوهات “المتوسطة”: السيناريوهات الصناعية أو التجارية (مثل نقل البضائع في المصانع أو تنظيف المراكز التجارية) – هناك حاجة إلى تخصيص، لكن دون الحاجة إلى تفاعل متكرر بين الإنسان والروبوت؛
- الشكل البشري ليس ضروريًا: يقول جو جونليانغ من Qianxun Intelligence أن استخدام هيكل عجلات مع آلية رفع يمكن أن يغطي أكثر من 95% من المهام الحالية، وما يهم العملاء هو قدرة الروبوت على العمل بشكل مستقر، انخفاض تكلفة الصيانة، وجودة العائد على الاستثمار، وليس مظهر الروبوت.
5. كيف يمكن لشركات البيانات الازدهار؟ الدورة المغلقة أكثر أهمية من حجم البيانات
القدرة التنافسية الأساسية لشركات البيانات ليست في كمية البيانات، بل في قدرتها على استخلاص الدروس من الفشل:
- الدورة المغلقة تشكل حصانة تنافسية: جمع البيانات → فحصها → تدريبها → نشرها → استخلاص الدروس من الفشل → إعادة التدريب؛ مثل عندما يتعطل روبوت أثناء التنظيف بسبب كيس بلاستيكي، يجب على شركة البيانات تسجيل هذه الحالة لتجنبها في المرات القادمة؛
- يجب أن تكون البيانات قابلة للنقل بين الروبوتات المختلفة (على سبيل المثال، يمكن استخدام نفس البيانات مع روبوتات ذات أجهزة مختلفة)؛
- يجب على شركات البيانات التواصل مع فرق تطوير النماذج لمعرفة احتياجاتهم وتوفير بيانات ذات قيمة إضافية (مثل البيانات المتكررة من السيناريوهات الشائعة لا تكون مفيدة، بينما الحالات الصعبة هي التي تحتاج إلى اهتمام حقيقي).
الخلاصة
تحولت المنافسة في مجال الذكاء الاصطناعي الجسدي من “من يملك أكبر كمية من البيانات” إلى “من يقدم أفضل كفاءة”. مليون ساعة من البيانات مجرد نقطة بداية، والحدود الحقيقية تكمن في قدرة الشركات على تحويل الحالات الصعبة في العالم الفعلي إلى خبرات يمكن للنماذج استخدامها لتجنب الأخطاء. بالنسبة للمستخدمين العاديين، قد لا تكون الروبوتات ذات الشكل البشري هي الخيار المفضل في المستقبل، لكنها ستكون أذكى وأكثر فائدة – قادرة على تجنب العقبات مثل الأكياس البلاستيكية في الأسواق والتفادي المركبات التي توصل الطلبات، وبالتالي دمجها بشكل أفضل في حياتنا اليومية.