الخلاصة الرئيسية: “دواء الندم” لأمان الذكاء الاصطناعي لم يعد فعالًا، والحل الوحيد يكمن “قبل الإطلاق”
الرأي الرئيسي في هذا المقال حاد ومخالف للحدس السائد: في مجال الذكاء الاصطناعي، بمجرد أن تُطلق القدرات (خاصة الأوزان المفتوحة المصدر أو تسرب البيانات)، فإن التدابير التصحيحية اللاحقة (مثل حظر الحسابات أو إصلاح الثغرات) تشبه حاولة سكب الماء من سفينة تسرب الماء، ولن تتمكن أبدًا من مواكبة سرعة تدفق الماء. لذلك، يجب أن تكون أكثر الوسائل فعالية واقتصادية للتحكم موجودة “قبل الإطلاق”.
يستخدم المقال حادثة “الهجوم المتكرر عبر الجلسات” التي كشفت عنها شركة Anthropic كمثال للإشارة إلى العيوب الهيكلية الخطيرة في نظام أمان الذكاء الاصطناعي الحالي:
1. الدفاع اللاحق هو معركة استنزافية: يحتاج المهاجمون فقط إلى إيجاد طريقة للتجاوز، بينما يجب على المدافعين الحذر من جميع الاحتمالات؛ تكاليف المهاجمين تنخفض مع زيادة الحجم، بينما تزداد تكاليف المدافعين بشكل خطي مع زيادة الحجم.
2. الوعود الطوعية غير موثوقة: مثل آلية “التقييم قبل الإطلاق” في الولايات المتحدة الحالية، فهي في جوهرها تعاون طوعي من قبل الشركات وتفتقر إلى الإلزام. تحت ضغوط المنافسة التجارية، يمكن أن تتحول الوعود الأمنية إلى “امتثال شكلي”.
3. عدم القابلية للعكس هو المشكلة الأساسية: يمكن سحب استدعاءات الواجهات البرمجية (APIs)، لكن بمجرد نشر الأوزان المفتوحة المصدر، فإنها كالماء المسكوب ولا يمكن استرجاعه. لذلك، يجب أن تكون معايير تقييم الأوزان المفتوحة المصدر أكثر صرامة من تلك المطبقة على الواجهات البرمجية، لكن تصميم النظام الحالي يعكس ذلك تمامًا.
4. الاقتراحات العلاجية: إنشاء نظام يجمع بين “الرقابة الصارمة قبل الإطلاق والمساءلة الشديدة بعد الإطلاق”. يشمل ذلك الموافقة الإلزامية قبل الإطلاق، و“مفتاح التوقف” للسيطرة على السلوكيات غير المتحكم بها أثناء التشغيل، بالإضافة إلى جعل المخالفين يدفعون الثمن الحقيقي من خلال التأمين والقوانين.
باختصار، **لا يمكن الاعتماد على “مسح الفوضى بعد الحدوث” في أمان الذكاء الاصطناعي، بل يجب الاعتماد على “وضع الصمامات مسبقًا”.
---
التحليل المفصل: تفسير بسيط لخمسة أبعاد
1. لماذا “التدابير التصحيحية اللاحقة” محكوم عليها بالفشل؟
مثال بسيط: تخيل أنك أنشأت خزانة، ومن أجل الأمان، قررت أن العملاء لا يمكنهم أخذ النقود مباشرة، بل يجب أن يحصلوا على “مذكرة استلام”. كنت تعتقد أن هذا سيسمح لك بالتحكم في تدفق النقود. لكن القراصنة اكتشفوا ثغرة: يمكنهم استخدام “مذكرة الاستلام” للذهاب إلى منصة أخرى وخداع الموظف لإعادة طباعة المعلومات فيها لتصبح سجل استلام كامل.
التفسير المفصل:
- طبيعة الثغرة: المشكلة ليست في ضعف التقنية، بل في افتراض خاطئ. يفترض النظام أن هناك فرقًا واضحًا بين “الاستخدام القانوني” و“إعادة التشغيل الخبيث”, لكن في الواقع، طالما يسمح النظام بـ “استعادة الحالة السابقة”, يمكن للمهاجمين استغلال ذلك.
- عدم التكافؤ في التكاليف:
- المهاجمون: يحتاجون فقط إلى إيجاد طريقة واحدة فعالة للتجاوز، بينما يجب على المدافعين مراقبة كل احتمال.
- تكاليف المهاجمين: تنخفض مع زيادة الحجم، بينما تزداد تكاليف المدافعين بشكل خطي.
- النتيجة: في بيئة مفتوحة، بمجرد تسرب القدرات، يقع المدافعون في لعبة “الجرذ”. إذا حظرت عنوان IP واحد، يستبدلونه بعشرة؛ إذا غيرت واجهة واحدة، يجدون واجهة أخرى. هذا العيب الهيكلي يعني أن “الدفاع اللاحق يمكن أن يؤخر الضرر فقط، ولا يمكنه إزالة المخاطر”.
2. لماذا “التقييم قبل الإطلاق” هو الحل الوحيد حاليًا؟
مثال بسيط: هذا مثل فحص السلامة في محطة الطاقة النووية. لا يمكنك الانتظار حتى تنفجر المحطة ثم تصلحها؛ يجب التأكد من أن جميع صمامات الأمان فعالة قبل تشغيل المفاعل. السياسة الحالية في الولايات المتحدة تشبه “الفحص الطوعي”: الحكومة تقول “يمكنك الخضوع للفحص، لكن يمكنك أيضًا القيادة دونه”. في سباقات السيارات الشرسة، يختار السائقون غالبًا “القيادة وهم مرضى” أو التلاعب بنتائج الفحص للفوز.
التفسير المفصل:
- عيوب الوضع الحالي: الاتفاقية بين CAISI (مركز معايير وابتكار الذكاء الاصطناعي) وخمسة مختبرات رئيسية في الولايات المتحدة طوعية. الأوامر الإدارية تنص على أن هذا لا يمكن أن يكون إلزاميًا. هذا يعني أن الشركات التي تعتبر التقييم معقدًا أو بطيئًا أو قد يعيق إطلاق منتجاتها التجارية يمكنها اختيار عدم التعاون أو الالتزام فقط بالإجراءات السطحية.
- الغرض الحقيقي من التقييم: التقييم ليس لإثبات أن النموذج “آمن تمامًا” (وهو أمر مستحيل)، بل للحفاظ على “حق الاختيار”.
- قبل الإطلاق: إذا لم يتم الموافقة على التقييم، يمكن للحكومة قول “لا” وعدم إطلاق النموذج. هذا هو “حق الاختيار”.
- بعد الإطلاق: إذا تم إطلاق النموذج وتسبب في ضرر، يمكن للحكومة فقط التحكم في الخسائر، مثل فرض الغرامات أو الإغلاق. هذا هو “حق التصحيح”.
- التغيير الضروري: نحن بحاجة إلى الانتقال من “اختبارات النجاح” (هل النموذج آمن؟) إلى “اختبارات القابلية للتحمل” (هل يمكن للمجتمع تحمل العواقب إذا تم استخدام النموذج على نطاق واسع؟). مثل صناعة الطاقة النووية التي لا تسعى لعدم وقوع حوادث، لكنها تسعى للسيطرة على الحوادث؛ يجب على صناعة الذكاء الاصطناعي أن تسعى لضمان أن المخاطر قابلة للتحكم بعد الإطلاق. إذا كانت المخاطر غير قابلة للتحكم، الإجابة هي “عدم الإطلاق”.
3. الأوزان المفتوحة المصدر: طريق لا رجوع فيه
مثال بسيط: الواجهات البرمجية المغلقة المصدر مثل الطعام في المطعم؛ يمكنك فقط تناول الطعام ولا يمكنك سرقة وصفة الطبق. الأوزان المفتوحة المصدر مثل نسخ الوصفة وتوزيعها مجانًا؛ بمجرد نشر الكتاب، إذا قام شخص ما بنسخ الوصفة أو تعديلها أو حتى استخدامها بشكل خبيث، لا يمكنك استرجاع الكتاب من أيدي الجميع.
التفسير المفصل:
- عدم القابلية للعكس: أكبر مخاطر النماذج المفتوحة المصدر هي “الانتشار غير القابل للعكس”. بمجرد تنزيل ملفات الأوزان، يمكن تعديلها وتعديلها وإعادة توزيعها بحرية.
- هشاشة الحماية: العديد من آليات الأمان في النماذج المفتوحة المصدر مجرد طبقة سطحية. أثبت الباحثون أنه يمكن إزالة هذه الطبقة بتعديلات خبيثة صغيرة، مما يعرض النموذج للمخاطر.
- ضرورة النشر التدريجي:
- التوزيع المشفر: على الرغم من أنه لا يمكن منع التشفير بشكل فعال (لأنه يجب تشفيره على أجهزة المستخدمين)، إلا أنه يزيد من تكاليف الهجوم.
- النشر التدريجي: يجب أولاً توفيرها للمدافعين الموثوق بهم (مثل الوكالات الأمنية) لمراقبة ردود فعل النظام، ثم توسيع النطاق تدريجيًا.
- التناقض الأساسي: التوزيع المشفر يحول “الانفتاح” إلى “انفتاح مُحكم”, مما يضحي ببعض خصائص السلع العامة، لكنه يوفر ميزة أكبر في التحكم.
4. “مفتاح التوقف”: فرامل طارئة للسيطرة على السلوكيات غير المتحكم بها أثناء التشغيل
مثال بسيط: هذا مثل تركيب “زر توقف طارئ” في سيارة ذات