虎嗅

عنوان الخبر باللغة العربية: "أطلس يفتح الطريق باستخدام التصميم ثلاثي الأبعاد، ونماذج العالم تدخل مرحلة جديدة قابلة للقياس"

原文:Atlas用3D重建开路,世界模型进入可测量的新阶段

تحليل عميق: هل النماذج العالمية مجرد أوهام أم أساس للتطور الحقيقي؟ – على سبيل المثال، نموذج Atlas من شركة World Labs

مرحبًا بكم، أنا صحفي مالي وعالم اقتصاد. اليوم سنتحدث عن موضوع أثار ضجة كبيرة في عوالم التكنولوجيا ورأس المال: النماذج العالمية (World Models).

إذا كنتم متابعين لتقنيات الذكاء الاصطناعي، ربما سمعتم عن Sora (النموذج القادر على إنتاج فيديوهات واقعية)، بالإضافة إلى أخبار عن الروبوتات. لكن مؤخرًا، أطلقت شركة World Labs نموذجًا يُدعى Atlas، وهو يشبه Sora إلى حد ما، لكن وظيفته مختلفة تمامًا.

الفكرة الرئيسية في هذا المقال حادة للغاية: مسار النماذج العالمية الحالي يتحول من منافسة من يرسم أجمل الصور إلى منافسة من يحسب بدقة ويستخدم النتائج بشكل فعال. العديد من الشركات لا تزال تركز على جودة الصور، لكن التطبيق الصناعي الحقيقي يتطلب وجود روبوتات يمكنها العمل مباشرة في البيئات الرقمية.

فيما يلي، سأشرح هذا الخبر المعقد بلغة بسيطة، مقسمًا إلى 5 نقاط رئيسية لفهم المنطق والفرص وراء هذا التغيير التكنولوجي.

---

الفرق الأساسي: Sora تصنع فيديوهات، بينما Atlas يبني بيئات رقمية

أولاً، علينا توضيح أكبر سوء فهم: Atlas ليس مجرد أداة لإنتاج الفيديوهات، بل هو أداة لإعادة بناء المشاهد ثلاثية الأبعاد.

  • Sora (إنتاج الفيديوهات): تعطيه نصًا مثل “قطة تركض على العشب”, وهو ينتج فيديوًا. ما يهمه هو ما إذا كانت البكسلات متسقة وما إذا كانت الصورة واقعية. المنتج النهائي هو ملف فيديو يُشاهد من قبل الناس.
  • Atlas (النماذج العالمية): تعطيه بعض الصور الملتقطة من زوايا مختلفة، وهو يعيد إنشاء بيئة ثلاثية الأبعاد بشكل مباشر. ما يهمه هو دقة الإحداثيات والهياكل الهندسية. المنتج النهائي ليس صورة، بل مجموعة من النقاط ذات الإحداثيات أو كائنات ثلاثية الأبعاد مع أشكال وألوان.

مثال بسيط:

  • Sora كأنه يرسم لوحة زيتية واقعية؛ مهما كانت اللوحة جميلة، لا يمكنك الدخول إليها.
  • Atlas كأنه يبني غرفة باستخدام كتل ليغو؛ هذه الغرفة لها أبعاد محددة، ويمكن للروبوتات الدخول إليها ويمكن للبرامج قراءة البيانات مباشرة.

لماذا هذا مهم؟

لأن الروبوتات لا تحتاج إلى “مشاهدة” الفيديوهات، بل تحتاج إلى معرفة مواقع الأشياء وأبعادها وما إذا كان بإمكانها التحرك بأمان. ما يقدمه Atlas هو بيانات يمكن للروبوتات حسابها بشكل مباشر، وهو ما يُعد الأساس الحقيقي للذكاء الجسدي (القدرة على التفاعل مع العالم الحقيقي).

---

الاختراق التكنولوجي: من “المسح الاحترافي” إلى “التصوير بالهاتف المحمول”

في الماضي، كان بناء بيئات ثلاثية الأبعاد لتدريب الروبوتات مكلفًا للغاية؛ كنت بحاجة إلى أجهزة ليدار ليزرية متخصصة وعشرات الكاميرات لالتقاط الصور، ثم يقضي المهندسون أيامًا في بناء النماذج يدويًا. هذا كان مثل طلب فريق مسح لقياس أرضية المنزل قبل البناء، وكان بطيئًا ومكلفًا.

أكبر تغيير أحدثه Atlas هو انخفاض الحواجز بشكل كبير وزيادة الكفاءة:

  • مدخلات بسيطة: تحتاج فقط إلى صورتين عاديتين من هاتف محمول، أو عدد أقصى 25 صورة، لإعادة بناء بيئة ثلاثية الأبعاد قابلة للاستخدام.
  • التخمين الذكي: تظهر العروض الرسمية أن Atlas يمكنه تخمين مواقع الأشياء في الغرفة من صورة لطاولة، وإضافة صورة بانورامية تصحح مواقع الكراسي، وصورة جانبية تكمل الصورة. إنه ليس مجرد تجميع صور، بل يفهم العلاقات المكانية بين الأشياء من خلال السياق المكاني.
  • النتائج المذهلة: يمكن لـ Atlas إنشاء فيديوهات طيران عالية الدقة من صور للأرضية في ساحة جامعة ستانفورد.

الأهمية التجارية:

هذا يعني أن بناء البيئات الثلاثية الأبعاد أصبح متاحًا للجميع، حتى للمهندسين العاديين أو غير المتخصصين؛ يمكنهم التقاط بعض الصور بالهاتف المحمول وإنشاء بيئات افتراضية يمكن للروبوتات التدريب عليها في دقائق قليلة. انخفاض تكلفة جمع البيانات بشكل كبير، وهو شرط أساسي لانفجار الصناعة.

---

القدرة الأساسية: السماح للروبوتات بـ “رؤية” و”تخطيط المستقبل”

لا يقتصر Atlas على تحويل الصور إلى نماذج ثلاثية الأبعاد، بل يمكنه أيضًا التحكم في الزوايا والوقت، وهو ما يميزه عن برامج النمذجة الثلاثية الأبعاد العادية:

  • التحكم في الكاميرات: يمكنك أن تطلب من Atlas أن “ينظر إلى المشهد من زاوية 45 درجة يسارًا ثم يبدأ بالتقريب تدريجيًا”، وسينتج فيديو بدقة 1440p ومدة دقيقة واحدة.
  • ميزة تنافسية: تعتمد النماذج الأخرى على وصفات نصية للحركة (مثل “التحرك إلى اليسار”)، مما يؤدي إلى أخطاء. Atlas يستخدم الإحداثيات مباشرة، مما يوفر دقة عالية. في اختبارات عشوائية، كانت نسبة نجاح Atlas أعلى من 75% إلى 94% مقارنة بالنماذج الأخرى، خاصة في الحركات المعقدة.
  • محاكاة الزمان والمكان: هذه الميزة رائعة؛ يمكن لـ Atlas استخدام عدة هواتف محمولة لتسجيل فيديو متزامن، ثم “تجميد” الزمن لمشاهدة نفس اللحظة من زوايا مختلفة.
  • في الماضي: كان هذا ممكنًا فقط باستخدام عشرات الكاميرات المتزامنة بتكلفة عالية.
  • الآن: هاتف محمول واحد مع Atlas يكفي.

القيمة بالنسبة للروبوتات:

هذا ليس مجرد تسلية؛ في تدريب الروبوتات، نحتاج إلى معرفة ما ستراه الكاميرات إذا تحركنا إلى اليسار. يمكن لـ Atlas إنتاج صور وبيانات عمق في الوقت الفعلي. بالإضافة إلى ذلك، يمكن إنشاء آلاف النسخ المختلفة لنفس المشهد (تغيير الإضاءة، نقل العوائق، تغيير المسارات) دون الحاجة إلى إعادة بناء البيئة.

باختصار: يمكن استخدام البيئة الفعلية مرة واحدة، لكن يمكن استخدام النسخ الرقمية عدة مرات. الجهة المسؤولة عن جمع البيانات تحولت من “الروبوتات الحقيقية” إلى “الروبوتات الافتراضية”.

---

النقطة الضعيفة القاتلة: Atlas يرسم الصور فقط، لا يحسب الخصائص الفيزيائية

على الرغم من قوة Atlas، إلا أن المقال يشير بصراحة إلى نقطته الضعيفة الأساسية: هو يفهم فقط الهندسة، ولا يفهم الفيزياء:

  • ما هو Atlas: أداة لتجسيد المشاهد بدقة عالية؛ يمكنه رسم الأشياء ومعرفة مواقعها وأشكالها.
  • ما ليس Atlas: ليس محركًا فيزيائيًا؛ لا يعرف ما إذا كانت الأشياء مرنة أو صلبة، أو كم ستتحرك عند الضغط، أو ما إذا كانت ستتحطم. هذه المعلومات غير موجودة في الصور، ولا يمكن لـ Atlas حسابها.
  • العقبة التقنية: تم تحسين دالة الخسارة في Atlas لتحسين دقة الصور، وليس للدقة الفيزيائية. في عملية المحاكاة، يقوم فقط بتوفير المدخلات البصرية، بينما يتم حساب الخصائص الفيزيائية باستخدام محركات خارجية مثل MuJoCo وPhysX.

مثال بسيط:

Atlas كمخرج فني متميز يمكنه رسم صور واقعية، لكنه لا يفهم قوانين الفيزياء؛ يعرف أن الجدار أحمر، لكنه لا يعرف ما إذا كان يمكنه تحمل الوزن. إذا اصطدم الروبوت بالجدار، يمكن لـ Atlas أن يرسم الصورة، لكنه لا يحسب قوة الاصطدام أو ما إذا كان الروبوت سيتضرر.

لماذا اشترت شركة World Labs شركة SceniX؟

SceniX متخصصة في إضافة خصائص فيزيائية (الوزن، الاحتكاك، المرونة) إلى الكائنات الافتراضية. World Labs (الهندسة) + SceniX (الفيزياء) = دورة كاملة من “الواقع إلى المحاكاة إلى الواقع”.

---

التوقعات للصناعة: من “الإدراك” إلى “الفهم”