第一财经

البيانات الذكية المجسدة تنمو بسرعة فائقة، لكن لم يتم بعد التحقق الكامل من صحة النماذج المستخدمة

原文:具身智能数据“狂飙”,但还未完全实现模型验证

---

ملخص المحتوى الأساسي للخبر

يشير هذا التقرير مباشرةً إلى أهم نقطة تحول في صناعة الروبوتات البشرية الحالية: حيث كانت الصناعة بأكملها تعاني من نقص حاد في بيانات التدريب، لكن الآن بدأت مجموعة من الشركات المحلية في تطبيق نموذج “مصانع جمع البيانات” لإنتاج بيانات تدريب الروبوتات بشكل صناعي، مما رفع القدرة الإنتاجية للبيانات عالية الجودة إلى مستويات تصل إلى مئات الآلاف من ساعات العمل سنويًا، وحلت المشكلة الأساسية المتمثلة في عدم قدرة الصناعة على جمع البيانات الكافية. لكن الصناعة اكتشفت أيضًا أن البيانات المجمعة في السيناريوهات المحاكاة اليدوية لها حدود واضحة، ولإنتاج روبوتات بشرية قادرة على العمل بفعالية، يجب اتباع دورة إيجابية تتضمن تدريب الروبوتات على أداء مهام معينة (بنسبة 70% من الكفاءة)، ثم إرسالها إلى بيئات عمل حقيقية للعمل، وفي الوقت نفسه جمع بيانات حقيقية لتحسين النماذج. الآن، تقف الصناعة عند مفترق طرق حاسم بين التركيز على حجم البيانات وتطبيق الحلول العملية بشكل فعال.

---

تفسير سهل للنقاط الرئيسية

1. لماذا تتسابق الشركات بشكل جنوني على جمع البيانات الآن؟

السبب الأساسي هو أن “المواد التعليمية المتخصصة” اللازمة لتدريب الروبوتات كانت مفقودة تمامًا في السابق.

النماذج الكبيرة للذكاء الاصطناعي التي نستخدمها تعتمد على بيانات نصية ومرئية موجودة على الإنترنت، وهي تمثل ما تراكمه البشر على مدى آلاف السنين. لكن الروبوتات البشرية بحاجة إلى تعلم كيفية العمل في العالم الحقيقي: مثل كيفية حمل كوب بقوة مناسبة دون أن يسقط، كيفية تجنب الزهور عند مسح الطاولة، وكيفية عبور الأسلاك على الأرض. لا توجد بيانات دقيقة كافية على الإنترنت لتوضيح تفاصيل هذه الحركات وقوتها ومنطق التكيف.

كانت الصناعة تعاني من نقص حاد في البيانات لدرجة أن الروبوتات كانت غير قادرة حتى على أداء مهام بسيطة مثل فتح الأبواب؛ فعدد الأمثلة المتعلقة بأشكال مقابض الأبواب المختلفة وأوزانها ووجود عوائق خلفها كان قليلاً للغاية. الآن، تعمل الشركات بجد لجمع البيانات لبناء “مكتبات تعليمية متخصصة” للروبوتات، وإلا فإن الروبوتات البشرية ستظل مجرد ألعاب لا تفعل شيئًا حقيقيًا.

2. ما هو نموذج “مدارس تدريب الروبوتات” الجديد؟

تم تطبيق نموذج صناعي لجمع بيانات تدريب الروبوتات بنجاح.

كانت كفاءة جمع البيانات في السابق منخفضة للغاية: إما أن يتم ترك الروبوتات تتحرك بشكل عشوائي وتسجيل حركاتها، مما ينتج عنه بيانات غير مفيدة، أو يتم توظيف أشخاص لتصوير الروبوتات أثناء أداء المهام، لكن التفاصيل الدقيقة للحركات كانت غير دقيقة. الآن، أنشأت الشركات الرائدة قواعد متخصصة لجمع البيانات، وهي تشبه مدارس تدريب خاصة للروبوتات، حيث يتم إعادة إنشاء بيئات واقعية مثل المطابخ المنزلية وأرفف المتاجر وخطوط الإنتاج في المصانع وأرفف الصيدليات. يتم توظيف مشغلين للتحكم في الروبوتات أثناء أداء المهام (مثل مسح الأسطح وترتيب البضائع وتصنيف الطرود)، ويتم تسجيل جميع تفاصيل الحركات والقوة والمسارات بدقة. بعد ذلك، يتم فحص البيانات تلقائيًا للتخلص من البيانات غير الصالحة، ويتم معالجتها في السحابة ليلاً لتكون جاهزة لفريق التدريب في اليوم التالي.

هذا النموذج أصبح صناعيًا بالكامل، والقواعد الرائدة قادرة على إنتاج مئات الآلاف من ساعات من البيانات عالية الجودة سنويًا، وبعض الشركات قد جمعت بالفعل ملايين الساعات من البيانات الفعالة، مما يعادل توفير “خبرة تعليمية طويلة الأمد” للروبوتات. المشكلة الرئيسية التي كانت تقلق الصناعة قد حلت إلى حد كبير.

3. ما هي عيوب الروبوتات التي تم تدريبها في مصانع جمع البيانات؟

الروبوتات التي تم تدريبها في مصانع جمع البيانات قد تكون قادرة على أداء المهام الأساسية بشكل جيد، لكنها تعاني من عيوب جوهرية:

أولاً، البيئات المحاكاة غير واقعية؛ فالأدوات في المصانع مرتبة بشكل مثالي، بينما في البيئات الحقيقية قد تكون هناك عوائق غير متوقعة (مثل زجاجات صلصة على جانب الموقد أو أرضية زلقة).

ثانيًا، معايير جمع البيانات غير موحدة، مما قد يؤدي إلى أخطاء في تعلم الروبوتات.

ثالثًا، وتيرة العمل في المصانع بطيئة، بينما في البيئات الحقيقية يجب على الروبوتات العمل بسرعة.

لذلك، توصلت الصناعة إلى استنتاج مفاده أن البيانات المجمعة وحدها لا تكفي لتدريب روبوتات قادرة على العمل بفعالية.

4. الحل النهائي: السماح للروبوتات بالعمل أولاً ثم ترقيتها

الطريقة المثلى التي تم اكتشافها الآن هي استخدام بيانات عالية الجودة لتدريب الروبوتات على أداء مهام معينة (بنسبة 70% من الكفاءة)، ثم إرسالها إلى بيئات عمل حقيقية لجمع بيانات حقيقية. هذه الدورة تساعد الروبوتات على التحسن بسرعة؛ فالروبوتات التي تبدأ بأداء مهام بشكل غير مثالي تصبح أفضل بعد جمع البيانات وتحسين النماذج.

على سبيل المثال، قد تكون دقة الروبوتات في محطات توزيع الطرود منخفضة في البداية، لكن بعد جمع البيانات وتحسين النماذج، تصبح أكثر كفاءة.

الشركة التي تنجح في تطبيق هذه الدورة أولاً ستكون الأولى في إنتاج روبوتات بشرية قادرة على العمل بفعالية.

5. ما معنى “ملايين الساعات من البيانات” المعروضة حاليًا؟

البيانات المجمعة حتى الآن مجرد تذكرة دخول للمنافسة؛ لم تصل الصناعة بعد إلى مرحلة تحديد الفائز النهائي.

الشركات تعرض كميات كبيرة من البيانات، لكن لا توجد شركة واحدة تستطيع الادعاء بأنها قادرة على إنتاج روبوتات بشرية مثالية بناءً على هذه البيانات، ولا يزال الجميع يجربون ويبحثون عن الطرق الأفضل لتحسين النماذج.

البيانات المجمعة حتى الآن مجرد أداة للمنافسة، والفائز الحقيقي سيكون من يتمكن من جمع البيانات الكافية من بيئات عمل حقيقية. في العامين القادمين، سنرى المزيد من الروبوتات تعمل في محطات توزيع الطرود والمطاعم والمصانع، وهذه البيئات هي في الواقع الميدان الحقيقي لاختبار قدرات الروبوتات البشرية.

---

هذا هو الترجمة العربية للتحليل الصيني المذكور أعلاه.