虎嗅

العنوان العربي: نقص بيانات التدريب يدفع شركات الذكاء الاصطناعي إلى اتخاذ إجراءات صارمة الترجمة: نقص بيانات التدريب يدفع شركات الذكاء الاصطناعي إلى اتخاذ إجراءات صارمة

原文:训练数据不够用,AI大厂开始下“毒手”

ملخص المحتوى الأساسي

لقد استنفدت تقنيات الذكاء الاصطناعي بالفعل معظم البيانات المتاحة على الإنترنت، ومن أجل أن تصبح أكثر ذكاءً (من روبوتات المحادثة إلى “موظفين رقميين” قادرين على العمل)، بدأت شركات الذكاء الاصطناعي في التركيز على البيانات الداخلية للشركات الناشئة التي أغلقت أو تم الاستحواذ عليها، مثل الأكواد وسجلات المحادثات والبريد الإلكتروني وتسجيلات الاجتماعات. شهدت هذه التجارة في البيانات نموًا كبيرًا هذا العام، لكنها تخفي مشاكل كبيرة مثل انتهاكات الخصوصية والثغرات القانونية والتناقضات الأخلاقية. الأمر الأكثر سخرية هو أن شركات عملاقة مثل جوجل وميتا كانت تستخدم بيانات المستخدمين “بشكل قانوني” لتدريب الذكاء الاصطناعي من خلال تعديل سياسات الخصوصية الخاصة بها، بينما جعلت شركة ميركور (Mercor) هذه الممارسة أكثر غموضًا. في الواقع، تعتمد تطورات الذكاء الاصطناعي على استهلاك خصوصية البشر الرقمية، ومن الصعب حل هذا التناقض في الأجل القريب.

أولاً: لماذا يستهدف الذكاء الاصطناعي “سجلات عمل” الشركات المغلقة؟ البيانات المتاحة لم تعد كافية

لا يأتي ذكاء الذكاء الاصطناعي من فراغ؛ بل يحتاج إلى بيانات للتدريب. في السابق، جمعت المختبرات الكبرى صفحات الويب والأوراق البحثية والأكواد ومشاركات المنتديات من الإنترنت، وهذا ما كان يُعرف بـ “وليمة البيانات المتاحة”. لكن هذه الوليمة انتهت الآن؛ فالذكاء الاصطناعي يحتاج الآن إلى “العمليات” وليس مجرد “الإجابات”, مثل كيفية اكتشاف المهام من قبل المهندسين ومناقشة الحلول وتعديل الأكواد وحل الأخطاء. هذه المعلومات موجودة في السجلات الداخلية للشركات المغلقة (مثل محادثات سلاك وتسجيلات زووم وتاريخ تعديلات الأكواد)، وهي ما يفتقده الذكاء الاصطناعي بشدة. على سبيل المثال، سمح لغوتهاب (GitHub) لقدرات الذكاء الاصطناعي في التطور بسرعة كبيرة بفضل سجلات التغييرات في الأكواد (commit logs) التي تحتوي على سلسلة كاملة من “المشكلة → المناقشة → التعديل → التحقق”. لا تمتلك الصناعات الأخرى مصادر بيانات جاهزة مثل هذه، لذلك فإن البيانات الداخلية للشركات المغلقة تملأ هذا الفراغ، ولهذا السبب كانت شركة ميركور على استعداد لدفع 300 ألف دولار مقابل الاستحواذ عليها، مما جعل هذه التجارة شائعة.

ثانيًا: مخاطر شراء هذه البيانات: انتهاكات الخصوصية ليست سوى جزء من المشكلة

تحتوي هذه البيانات الداخلية على معلومات حساسة، واستخدامها بشكل غير صحيح قد يؤدي إلى مشاكل كبيرة:

1. صعوبة حماية الخصوصية: تقول شركة ميركور إنها يمكن أن تخفي المعلومات الحساسة، لكن الجميع في الصناعة يعلم أن الأهم هو “من قال ماذا ومتى وما الإجراءات التي تبعت ذلك”. على سبيل المثال، قد يتم استبدال أسماء الموظفين بـ “المهندس أ”, لكن من الصعب حذف المعلومات المرتبطة مثل الأدوار والمشاريع وعلاقات العملاء، مما يؤدي إلى انتهاك الخصوصية.

2. عدم موافقة الموظفين: عندما تبيع الشركات بياناتها، غالبًا ما لا يعلم الموظفون أن سجلات المحادثات وخطابات الاجتماعات الخاصة بهم تم بيعها. حتى إذا وقعوا على اتفاقيات حقوق الملكية، فإن ذلك لا يعني موافقتهم على استخدام “محادثات العمل” في تدريب الذكاء الاصطناعي.

3. الأسرار التجارية والتحيزات: قد تحتوي البيانات على معلومات عن العملاء وأسرار الشركة؛ والأسوأ من ذلك، قد يتم نسخ التحيزات الموجودة في عمل البشر (مثل التمييز ضد بعض العملاء أو الأخطاء في اتخاذ القرارات) وتكبيرها من قبل الذكاء الاصطناعي، مما يؤدي إلى “تحيزات الخوارزمية”.

4. غياب التشريعات الواضحة: لا توجد قوانين عالمية واضحة تحدد ما إذا كان يمكن للشركات بيع بياناتها الداخلية لشركات الذكاء الاصطناعي، مما يخلق فراغًا قانونيًا. قد يسمح هذا للذكاء الاصطناعي بالتطور بسرعة، ولكنه قد يفتح أيضًا صندوق باندورا لانتهاكات الخصوصية.

ثالثًا: الشركات العملاقة تفعل ذلك منذ فترة طويلة: مجرد تعديل سياسات الخصوصية يجعل بياناتك وقودًا للذكاء الاصطناعي

لا تعتقد أن شركة ميركور هي الوحيدة التي تقوم بهذه المعاملات غير الشرعية؛ فقد بدأت شركات عملاقة مثل جوجل وميتا في استخدام بيانات المستخدمين “بشكل قانوني” لتدريب الذكاء الاصطناعي:

  • قامت جوجل بتحديث سياسة الخصوصية في عيد استقلالها لعام 2023، مشيرة إلى أنها تستخدم “المعلومات المتاحة” لتدريب الذكاء الاصطناعي (بما في ذلك بريد جيميل ومستندات جوجل وسجلات البحث). في عام 2026، أدرجت جميع المستخدمين تلقائيًا في خطة تدريب الذكاء الاصطناعي، ويجب على المستخدمين الموافقة صراحةً.
  • قامت ميتا أيضًا بتعديل سياساتها في عام 2023 لاستخدام منشورات وصور فيسبوك وإنستغرام في تدريب الذكاء الاصطناعي. توقفت في عام 2024 عن استخدام بيانات المستخدمين في الاتحاد الأوروبي، لكنها استؤنفت ذلك في عام 2026، مما يعطي المستخدمين الحق في الرفض فقط وليس الموافقة.

باختصار، شركة ميركور فقط جعلت ما كان تفعله الشركات العملاقة سرًا علنيًا؛ الفرق هو أن الشركات العملاقة تستخدم وسائل قانونية مثل تعديل شروط الخدمة، بينما تتبع شركة ميركور طرقًا أكثر غموضًا.

رابعًا: كيف نحل هذه المشكلة؟ يجب أن تتقدم القوانين والتكنولوجيا والانضباط الذاتي، لكن الطريق طويل

لا يوجد حل سحري لهذه المشكلة، لكن يحتاج الأمر إلى جهود مشتركة من جميع الأطراف:

1. تعديل القوانين: يجب توضيح “من يمتلك هذه البيانات” (الشركات؟ الموظفون؟ العملاء؟) وكذلك “من يجب الحصول على موافقته قبل بيع البيانات”.

2. الحماية التقنية للخصوصية: تقنيات مثل “التعلم الفيدرالي” (تدريب الذكاء الاصطناعي في المكان الذي توجد فيه البيانات دون الحاجة إلى نقل البيانات الأصلية) و “الخصوصية التفاضلية” (إضافة ضوضاء إلى البيانات لمنع معرفة هوية المستخدمين دون التأثير على تعلم الذكاء الاصطناعي) يمكن أن تقلل من مخاطر انتهاكات الخصوصية.

3. الانضباط الذاتي في الصناعة والشركات: يجب على شركات البيانات إنشاء آليات لتتبع المصادر، ويجب على الشركات إبلاغ الموظفين قبل بيع البيانات والحصول على موافقتهم.

لكن هذه الحلول تحتاج إلى وقت؛ فشركات الذكاء الاصطناعي بحاجة إلى التطور، والمستخدمين يريدون حماية خصوصيتهم، والشركات العملاقة تبحث عن الأرباح، والتنافس بين الأطراف سيستمر. في الأجل القريب، سيستمر تطور الذكاء الاصطناعي على حساب خصوصية البشر الرقمية، والسباق لم يصل بعد إلى نهايته.

خاتمة

كل ترقية في ذكاء الاصطناعي تستهلك الآثار الرقمية التي تركناها وراءنا – من صفحات الويب المتاحة إلى سجلات العمل، من جمع البيانات “القانوني” من قبل الشركات العملاقة إلى المعاملات غير الشرعية. نحن نتفاجأ بقدرات الذكاء الاصطناعي، لكن يجب أن نقبل أن أساس ذكائه هو “الإرث الرقمي” الذي لم يتم التعامل معه بشكل صحيح من قبل الكثيرين. ستضع الرقابة حدودًا في المستقبل، لكن في الوقت الحالي، لا يزال هذا “اللعب” بالخصوصية مستمرًا.