مرحبًا! أنا صحفي مالي وعالم اقتصادي. اليوم سنتحدث عن نموذج GPT-Image 2.5 الذي أطلقته شركة OpenAI مؤخرًا.
تكشف هذه المقالة التقييمية من مصدر “زهي وي” (Zhi Wei) عن ظاهرة تجارية وتقنية مثيرة للاهتمام: غالبًا ما يكون هناك فجوة كبيرة بين “القدرة التقنية المذهلة” و“الاستقرار”.
لكي أسهل عليك فهم هذا التقييم المعقد، سألخص النتائج الرئيسية أولاً، ثم أشرح المنطق وراءها من خمسة أبعاد.
📌 ملخص المحتوى الرئيسي: فهم سريع
حقق نموذج GPT-Image 2.5 الجديد من OpenAI اختراقًا كبيرًا في “التناسق البصري”, ويمكن استخدامه نظريًا لإنشاء ملفات GIF. حتى أن المستخدمين ابتكروا طريقة لاستغلاله لإنشاء فيديوهات من خلال إنتاج عدة صور دفعة واحدة. على الرغم من أن النتائج مذهلة في بعض السيناريوهات البسيطة، إلا أن الاختبارات العملية أظهرت أن النموذج غير مستقر للغاية: أي حركة معقدة أو وجود عدة أشخاص أو زوايا تصوير خاصة قد تؤدي إلى مشاكل (اهتزازات أو أخطاء في الحركات). في الوقت الحالي، يبدو النموذج أكثر كـ “منتج نصف مكتمل ذو إمكانات كبيرة”, ولا يزال بعيدًا عن أن يحل محل البرامج المتخصصة في الرسوم المتحركة، لكن ظهوره يشير إلى دخول عصر جديد في توليد الصور يركز على الاستقرار.
---
🔍 تحليل مفصل: شرح سهل لخمسة أبعاد
1. النقاط التقنية المميزة: من “العشوائية” إلى “الاستقرار”, التناسق هو السمة الرئيسية
تفسير بسيط:
في الماضي، كانت رسومات الذكاء الاصطناعي عشوائية؛ قد ترسم شخصًا بشكل جيد، لكن إذا طلبت تغيير لون الملابس، قد تتشوه الوجه أو الخلفية. هذا ما يُعرف بـ “التشوه البصري” أو “الاهتزاز”.
أكبر ميزة لنموذج GPT-Image 2.5 هي أنه “يستجيب بدقة دون أخطاء”. عندما تطلب تغييرًا معينًا، يقوم به فقط دون التأثير على باقي الجزء. هذا التناسق العالي هو أكثر ما يميزه.
- لماذا هذا مهم؟ في الماضي، كان إنشاء الرسوم المتحركة يتطلب برامج متخصصة مثل After Effects، مما كان يكلف الكثير من الوقت والمال. إذا استطاع الذكاء الاصطناعي إنشاء الرسوم المتحركة بشكل مستقر، فسيقلل ذلك بشكل كبير من التكاليف.
2. كيف يستغل المستخدمون النموذج لإنشاء فيديوهات مجانًا؟
تفسير بسيط:
لم تطلق شركة OpenAI برنامجًا رسميًا لإنشاء الفيديوهات باستخدام الذكاء الاصطناعي، لكن المستخدمين اكتشفوا طريقة:
1. يطلبون من النموذج إنتاج صورة كبيرة مقسمة إلى 16 مربعًا (4x4)، كل مربع يمثل لحظة معينة من الحركة.
2. يستخدمون برنامج آخر (ChatGPT Work) لتقسيم هذه الصورة إلى 16 صورة صغيرة.
3. يجمعون هذه الصور لإنشاء ملف GIF.
هذا يشبه طلب رسم لوحة متسلسلة من رسام، ثم قصها وعرضها بسرعة لتصبح فيديوًا.
- مثال: فريق Higgsfield أظهر كيف يمكن استخدام هذه الطريقة لإنشاء فيديو متقن لتحول ترانسفورمرات بشكل سلس، مما يثير التوقعات لقدرات GPT-Image 2.5.
3. الواقع العملي: نتائج الاختبارات
تفسير بسيط:
لم يكن فريق التقييم متفائلاً بشكل أعمى، بل أجرى اختبارات دقيقة. ووجدوا أن النموذج يعمل بشكل جيد مع الحركات البسيطة، لكنه يفشل مع الحركات المعقدة:
- حركات بسيطة مثل الركل: تعمل بسلاسة ويمكن تكرارها بدون مشاكل.
- حركات معقدة (مثل سحب السيف والضرب): تبدأ بالاهتزازات، وقد تحدث أخطاء في الحركات (مثل تغيير موقع الأطراف). على سبيل المثال، الطرف الأيمن في الإطار السادس قد يتحول إلى الطرف الأيسر في الإطار السابع ثم يعود إلى مكانه في الإطار الثالث عشر. هذا يشبه مشاهدة فيلم رسوم متحركة حيث تتحرك أطراف الشخصية فجأة، مما يجعل الصورة غير واقعية.
- تفاعل بين شخصين: عندما يقوم شخصان بحركات مختلفة في نفس الوقت، تبدأ الصورة بالتشوه.
- زوايا تصوير خاصة (مثل الدوران العمودي): عندما يتم تغيير زاوية التصوير، يفشل النموذج في التعامل معها بشكل صحيح، مما يؤدي إلى تغييرات مفاجئة في الصورة.
الخلاصة: النموذج جيد للصور ذات الخلفيات الشفافة والشخصيات الواحدة والحركات البسيطة، لكن استقراره ينخفض بشكل كبير مع تعقيد المهمة.
4. التحديات الكبيرة: لماذا حتى تحول ترانسفورمرات يصعب إنشاؤه؟
تفسير بسيط:
حاول فريق التقييم إنشاء فيديو متقن لتحول ترانسفورمرات باستخدام 30-72 صورة مستقلة.
- الوقت الطويل: المهمة البسيطة استغرقت 5 دقائق، بينما استغرقت هذه المهمة 30 دقيقة.
- النتائج غير مرضية: حتى باستخدام أحدث نماذج (Sunburst Max)، النتائج لم تكن مثالية مثل تلك التي أظهرها فريق Higgsfield.
- عدم اتباع القوانين الفيزيائية: يتعامل النموذج مع التحولات الميكانيكية بشكل غير دقيق، حيث يستخدم تقنيات تشبه تدفق الماء بدلاً من الحركات الميكانيكية الحقيقية.
- الاعتماد على برامج مساعدة: تمكن النموذج من إنتاج الصور فقط بسبب مساعدة برنامج ChatGPT Work في التحقق وتصحيح الأخطاء. هذا يدل على أن النموذج وحده غير كافٍ، ونحتاج إلى مزيج من النماذج اللغوية والبصرية.
5. القيمة التجارية والمستقبل: انخفاض التكاليف، تغيير محور المنافسة
تفسير بسيط:
على الرغم من أن نتائج التقييم كانت مخيبة للآمال، إلا أن أهمية GPT-2.5 كبيرة من الناحية الاقتصادية:
- زيادة معدل النجاح = انخفاض التكاليف: في الماضي، كان يتطلب إنشاء صورة تسويقية مثالية عدة محاولات، لكن الآن يمكن الحصول على نتيجة جيدة بعد محاولتين أو ثلاث. هذا يقلل من تكاليف الحوسبة والمراجعة اليدوية.
- تقليل الاعتماد على البرامج المتخصصة: كان يتطلب تعديل الصور باستخدام برامج مثل Photoshop، لكن الآن يمكن للذكاء الاصطناعي إنجاز معظم هذه المهام.
- تغيير محور المنافسة: لن تكون المنافسة في ما إذا كانت الرسومات أجمل، بل في ما إذا كان النموذج أكثر استقرارًا وأقل تكلفة وأكثر قدرة على التصحيح التلقائي في المهام المعقدة والمتعددة الخطوات.
نصيحة للجمهور:
- لا تتوقعوا منه إنشاء أفلام كاملة: النموذج غير مستقر بعد، وقد يفشل في إنشاء رسوم متحركة معقدة.
- مناسب لإنشاء تأثيرات بصرية بسيطة: مثل رسومات الشعارات، الرموز التعبيرية البسيطة، والبوسترات التسويقية المتحركة، حيث تكون القيمة مرتفعة مقارنة بالتكلفة.
- ركزوا على “سير العمليات: المنتجون الناجحون في المستقبل لن يكونوا النماذج الفردية، بل الأنظمة الذكية التي يمكنها التحقق وتصحيح الأخطاء تلقائيًا ودمج عدة نماذج معًا مثل ChatGPT Work.
---
💡 ملاحظة الصحفي
إطلاق GPT-Image 2.5 يشبه وجود “متدرب موهوب لكنه عصبي”. قدراته قوية (مثل التناسق العالي)، لكنه يفشل عند التعامل مع المهام المعقدة.
بالنسبة للشركات والمستخدمين الأفراد، ليس الوقت المناسب بعد للاعتماد عليه بشكل كامل لإنشاء رسوم متحركة متقنة، لكن استخدامه لتقليل تكاليف إنشاء الصور البسيطة يعتبر فائدة حقيقية. في المستقبل، لن تكون المنافسة في ما إذا كانت الرسومات أجمل، بل في ما إذا كان النموذج أكثر استقرارًا وأقل تكلفة وأكثر قدرة على التصحيح التلقائي.
خلاصة: التقنية مذهلة، لكن يجب التعامل معها بحذر. التكاليف انخفضت، لذا يجب تقليل التوقعات.