ملخص المحتوى الرئيسي
تدور هذه الأخبار حول التناقض الأساسي المتمثل في نقص المواد التدريبية عالية الجودة للنماذج الكبيرة للذكاء الاصطناعي: مع تزايد حجم معاملات هذه النماذج (من مئات المليارات إلى التريليونات) وتطورها لتشمل أنماطًا متعددة (الصور/الفيديوهات/البيانات التفاعلية)، بدأت المواد الأصلية عالية الجودة من الإنترنت في النفاد تدريجيًا، وقد يؤدي إنتاج المحتوى بواسطة الذكاء الاصطناعي أيضًا إلى تلوث مجموعات البيانات، مما يزيد من خطر “انهيار النموذج”. ونتيجة لذلك، يتجه رأس المال نحو قطاع بيانات الذكاء الاصطناعي في سوق الأسهم الصينية (مثل شركات “دوكي وينهوا” و“تشونغشين للنشر”). لكن على الشركات المنتجة للمحتوى التقليدي (الناشرين) أن تتحول من بيع الكتب إلى بيع البيانات، وهم يواجهون عقبات عديدة مثل تعقيدات حقوق الملكية وغياب نظام التسعير. الخلاصة هي أن ندرة المواد التدريبية متفاوتة حسب النوع (المواد المتخصصة/الحصرية/المتعددة الأشكال هي الأكثر ندرة)، ولم تتحقق بعد إيرادات الذكاء الاصطناعي لدى الناشرين، وستعتمد قدرتهم التنافسية على المدى الطويل على قدرتهم على الإبداع المستمر وتحويل بياناتهم إلى أصول قابلة للتجارة.
تفسير مفصل
1. لماذا تعاني النماذج الكبيرة للذكاء الاصطناعي من نقص في المواد التدريبية؟
النماذج الكبيرة للذكاء الاصطناعي تشبه “مصانع تكرير البيانات”، حيث يمثل القوة الحسابية الفرن والبيانات المادة الخام، وجودة هذه المواد أكثر أهمية من حجم الفرن. لكن البيانات تختلف عن القوة الحسابية: فالقوة الحسابية تتضاعف كل 18 شهرًا وفقًا لقانون مور، بينما البيانات تنفد مع الاستخدام المتزايد:
- الاستهلاك المتفجر: استخدمت عملية تدريب GPT-2 عشرات الجيجابايت من النصوص، بينما استخدمت GPT-3 مئات الجيجابايت؛ والنماذج المتعددة الأشكال الحالية (القادرة على فهم الصور والنصوص والتفاعلات مع الروبوتات) تحتاج إلى كميات أكبر بكثير من البيانات: حيث تحتاج الذكاءات المتجسدة إلى أكثر من عشرة ملايين ساعة من البيانات المتعددة الأشكال، بينما لا تتوفر في الصين سوى 500,000 ساعة من البيانات التفاعلية الفعلية، مما يشكل نقصًا كبيرًا.
- نضوب المصادر: تم استنفاد المحتوى الأصلي المجاني على الإنترنت (مثل المدونات والمنتديات والكتب) بسرعة؛ والأسوأ من ذلك أن المحتوى الذي يتم إنتاجه بواسطة الذكاء الاصطناعي (مثل المقالات التي يكتبها الذكاء الاصطناعي) قد يختلط بمجموعات البيانات، مما يؤدي إلى تلوث مواد التدريب للجيل القادم من النماذج.
ببساطة، سرعة استهلاك الذكاء الاصطناعي للبيانات أسرع بكثير من قدرة البشر على إنتاج محتوى عالي الجودة.
2. “الرمح المرتد” للمحتوى الذي ينتجه الذكاء الاصطناعي: تلوثه لنفسه
ماذا يحدث إذا تم استخدام المقالات التي كتبها الذكاء الاصطناعي لتدريب نماذج أخرى؟ يشبه ذلك “نسخ النسخ”: كل جيل من النماذج يفقد بعض المعلومات، مما يجعل النموذج أقل كفاءة (مثل عدم فهم الأحداث النادرة أو إصدار محتوى خاطئ).
- الحلول: ليس كل المحتوى الذي ينتجه الذكاء الاصطناعي سيءًا؛ يمكن التغلب على هذه المشكلة من خلال تصفية المحتوى بدقة (مثل إزالة المحتوى الواضح أنه من إنتاج الذكاء الاصطناعي) وخلطه ببيانات بشرية أصلية وتنظيفه لإزالة التكرار.
- المحاولات المجنونة في وادي السيليكون: من أجل الحصول على بيانات أصلية نقية، قامت شركة Anthropic بمسح الكتب في جميع أنحاء العالم سرًا (تحت اسم “مشروع بنما”)، وواجهت دعوى قضائية بسبب تنزيل 7 ملايين كتاب من مكتبات غير قانونية، ودفعت تعويضًا قدره 1.5 مليار دولار (أكبر تسوية في تاريخ حقوق الملكية الأمريكية). هذا يظهر مدى قيمة البيانات النقية وصعوبة الحصول عليها.
3. التحول من بيع الكتب إلى بيع البيانات لدى الناشرين التقليديين
كان الناشرون يكسبون أموالهم من بيع الكتب في الماضي، والآن تحتاج الشركات المطورة للذكاء الاصطناعي إلى بيانات عالية الجودة، لذا يمكن للناشرين بيع حقوق الملكية لهذه البيانات للشركات. لكن هناك تفاصيل مهمة:
- الفروق الكبيرة في الأسعار: أسعار بيع البيانات للذكاء الاصطناعي تختلف حسب الغرض (تدريب النماذج مقابل الاستعلامات الفورية)، ولا يمكن افتراض أن جميع حقوق الملكية تحقق أسعارًا عالية. على سبيل المثال، تتفق شركة هاربر كولينز مع مايكروسوفت على رسوم ترخيص للكتب القديمة بـ 5000 دولار لكل كتاب كل ثلاث سنوات (يتم تقاسم المبلغ بين الناشر والمؤلف)، وهذا يقتصر فقط على أغراض التدريب.
- ليست جميع أنواع المحتوى ذات قيمة: الروايات العادية والكتب القديمة (مثل “أنالكتس”) متوفرة بكميات كبيرة ولا تحقق أسعارًا عالية؛ المحتوى المتخصص أو الحصري أو ذو الصلة بمجالات محددة (مثل الكتب التعليمية الطبية والأحكام القضائية والتقارير المتعمقة) هو الأكثر ندرة وبالتالي أغلى.
- الوضع في الصين: بدأت بعض الشركات المطورة للذكاء الاصطناعي بشراء البيانات من الناشرين، لكن على الناشرين أولاً تحويل هذه البيانات إلى صيغة رقمية وتنظيفها وتصنيفها، بالإضافة إلى حل مشكلات حقوق المؤلفين (العديد من المؤلفين القدامى غير متوفرين، مما يعيق عملية الترخيص).
4. خطط بديلة لشركات الذكاء الاصطناعي
لا تنتظر شركات الذكاء الاصطناعي من الناشرين توفير المواد التدريبية؛ فلديها خيارات أخرى:
- إنشاء بيانات مصطنعة: يمكن للذكاء الاصطناعي إنتاج بيانات عالية الجودة بنفسه (مثل المسائل الرياضية والكود)، مما يمكن أن يحل جزءًا من احتياجات البيانات الحقيقية.
- تحسين كفاءة استخدام البيانات: تطوير هياكل النماذج (مثل تقنية MoE التي تنشط أجزاء معينة فقط من النموذج) وتحسين طرق التدريب لتعلم المزيد باستخدام كميات أقل من البيانات.
- تقنية RAG: تسمح هذه التقنية للنماذج بالوصول إلى المعلومات المطلوبة في الوقت الفعلي دون الحاجة إلى تخزين كل شيء مسبقًا (مثل طلب “الناتج المحلي الإجمالي لعام 2026” من الذكاء الاصطناعي، وسيبحث مباشرة في قواعد البيانات).
- مصادر أخرى: شراء بيانات من خدمات متخصصة (مثل Haitian Ruisheng)، جمع بيانات عامة وقانونية، التواصل المباشر مع المؤلفين لتجنب الاعتماد على الناشرين، استخدام بيانات بلغات أجنبية.
لذلك، حقوق نشر الكتب التقليدية مجرد واحدة من مصادر البيانات، وليست ضرورية لشركات الذكاء الاصطناعي.
5. من حقوق الملكية إلى سلطة التسعير: عقبات تحول دون كسب الناشرين لأرباح
حتى لو كان لدى الناشرين حقوق الملكية، فلا يمكنهم بالضرورة الحصول على سلطة التسعير بسبب ثلاث عقبات رئيسية:
- تعقيدات حقوق الملكية: يمتلك الناشرون فقط حقوق النشر، بينما تظل حقوق النصوص مع المؤلفين. للحصول على إذن من المؤلفين لتدريب النماذج، يجب التفاوض معهم واحدًا تلو الآخر؛ العديد من المؤلفين القدامى غير متوفرين، والعقود لا تتضمن بنودًا خاصة بإذن استخدام حقوق الذكاء الاصطناعي، مما يجعل من الصعب التوصل إلى اتفاقيات.
- غياب نظام تسعير متماسك: كيفية حساب كمية البيانات المستخدمة من قبل الذكاء الاصطناعي؟ كيفية منع سرقة البيانات؟ كيفية توزيع الأرباح مع المؤلفين؟ لا توجد قواعد موحدة في هذه المجالات. حاليًا، يتم شراء مجموعات البيانات بشكل كامل في الخارج، ولم يتم تطبيق نظام التسعير الدقيق بعد.
- وجود بدائل للذكاء الاصطناعي: إنشاء البيانات المصطنعة، خدمات متخصصة، البيانات المفتوحة المصدر، التواصل المباشر مع المؤلفين... كل هذه الخيارات تقلل من قدرة الناشرين على التفاوض. بالإضافة إلى ذلك، فإن الكتب القديمة المتاحة مجانًا تخفض أسعار الكتب العادية.
الخلاصة: لكي يحقق الناشرون سلطة التسعير، يجب عليهم إنتاج محتوى أصلي عالي الجودة بشكل مستمر وتحويل حقوق الملكية إلى أصول قابلة للتجارة وموثوقة وقابلة للتتبع، بالإضافة إلى إنشاء آليات توزيع الأرباح مستقرة بين شركات الذكاء الاصطناعي والناشرين والمؤلفين. لا يمكن الاعتماد فقط على المحتوى الحالي لضمان نجاحهم في عصر الذكاء الاصطناعي.
ملاحظة أخيرة: سبب ارتفاع أسهم قطاع بيانات الذكاء الاصطناعي في السوق
ارتفعت أسهم هذا القطاع بشكل جماعي في أغسطس ليس بسبب كسب الناشرين أرباحًا حقيقية من شركات الذكاء الاصطناعي، ولكن بسبب الترويج لفكرة ندرة المواد التدريبية كقصة جديدة. حتى الآن، لم تتطور أنظمة تأكيد حقوق الملكية والتسعير وتوزيع الأرباح بشكل كامل، ومعظم إيرادات الناشرين من الذكاء الاصطناعي لا تزال في مرحلة المفاوضات. على المدى الطويل، ستزداد الطلبات على البيانات المتعددة الأشكال (الصور/الفيديوهات/التفاعلات)، بينما ستنخفض أهمية المحتوى النصي فقط. الندرة الحقيقية تكمن في المواد المتخصصة والحصرية والمتوافقة مع القوانين، بالإضافة إلى القدرة على الإبداع البشري المستمر. إذا لم يتمكن المؤلفون من الاستفادة من حقوق الذكاء الاصطناعي، فسوف تضعف الحافز على إنتاج محتوى عالي الجودة، وفي النهاية قد يواجه الذكاء الاصطناعي نقصًا في المواد الضرورية للعمل. لذلك، يحتاج تطور هذه الصناعة إلى تحقيق التوازن بين مصالح شركات الذكاء الاصطناعي والناشرين والمؤلفين.