هذا موقع رسمي تابع لـ ODERSA. إليكم كيف تتأكّدون

النطاق الرسمي

عنوان هذا الموقع ينتهي بـ odersa.org. كل خدمة من خدمات الجمعية توجد على نطاق فرعي من odersa.org، ولا في أي مكان آخر. وإذا كان العنوان الظاهر في شريط متصفّحكم لا ينتهي بـ odersa.org، فهذا الموقع ليس موقعنا.

مجاني، وبلا حساب

كل شيء متاح من اللحظة الأولى: لا تسجيل، ولا حساب، ولا كلمة مرور، ولا اشتراك، ولا إعلانات. ولا شيء محجوز لمن يدفع، لأن لا شيء هنا يُدفع.

لا جمع لأي بيانات

هذا الموقع لا يتعقّبكم: لا أدوات تتبّع، ولا ملفات تعريف ارتباط للتتبّع، ولا أي أداة قياس مدمجة في هذه الصفحات، ولا شيء يُقاس على جهازكم. مُضيفنا يَعُدّ الطلبات بشكل إجمالي، كما يفعل أي خادم يستجيب: مجموع، لا ملف شخصي. ولا حاجة أن تصدّقونا: افتحوا أدوات المطوّر في متصفّحكم، تبويب الشبكة، وأعيدوا تحميل الصفحة. سترون القائمة الكاملة لما يطلبه الموقع. كل شيء يأتي من odersa.org، ولا شيء يذهب إلى مكان آخر.

محتوى حر

المحتوى منشور برخصة CC BY 4.0. يمكنكم نسخه وترجمته وطبعه وإعادة توزيعه، في دروسكم كما بين من حولكم، بشرط واحد: ذكر ODERSA.

ما يصير إليه ملفّ مودَع

قبل إيداع ملفّ في خدمة تستخدم الذكاء الاصطناعي، يُطرَح سؤال دقيق: هل يمكن أن يخرج هذا المحتوى، لاحقًا، أمام شخص آخر؟

إيداع ملفّ في خدمة تستخدم الذكاء الاصطناعي لا يُطلِق في الغالب أي شرح واضح لما يحدث لهذا الملفّ بعد ذلك. والسؤال الذي يجب طرحه ليس «هل سيتجسّس عليّ الذكاء الاصطناعي»، فهذه صيغة أوسع من أن يُتحقَّق منها. والسؤال الذي وثّقه البحث العلمي أدقّ: هل يمكن أن يخرج هذا المحتوى، لاحقًا، أمام شخص آخر؟ فواجبٌ مدرسي، أو صورة عائلية، أو ملفّ مهني: صارت خطوة إيداع الملفّ عادية، أما مسألة ما يصير إليه بعد ذلك فليست كذلك.

النموذج قد يحتفظ بمقاطع كاملة

في 2021، نشر Nicholas Carlini وفريقه عرضًا مباشرًا. فباستجواب GPT-2 ببساطة، وهو نموذج لغوي سابق للمساعدات المحادثية الحالية، استخرجوا منه مئات متتاليات النصّ المُعادة حرفًا بحرف من بيانات تدريبه: أسماء، وأرقام هاتف، وعناوين بريد إلكتروني، ومقاطع محادثات، وشيفرة حاسوبية. وبعض هذه المتتاليات لم يكن يرد إلا مرة واحدة في البيانات الأصلية. وملاحظة أخرى في الدراسة: النماذج الأكبر تحفظ أكثر من الأصغر. ولم يُبحَث عن أي من هذه المعلومات بطريق ملتوٍ: بل خرجت ببساطة جوابًا عن أسئلة عادية، مطروحة كأي استخدام جارٍ للنموذج.

ما يُضخِّم هذا الخطر

ودراسة ثانية، نشرها جزءٌ من الفريق نفسه في 2023، تقيس بدقة ما يزيد الحفظ. ثلاثة عوامل، كل واحد مقيس على حدة: حجم النموذج، وتكرار المثال نفسه في بيانات التدريب، وطول النصّ المُعطى في السياق قبل طلب المتابعة. فكلّما كبر النموذج، وكلّما تكرّر المثال، وكلّما طال السياق المُقدَّم، زاد احتمال العثور على شُذرة محفوظة. ويصف أصحابها حفظًا أوسع انتشارًا مما كان يُعتقَد، ومُرشَّحًا للتفاقم مع نماذج أكبر فأكبر، ما لم يُتَّخذ تدبير لكبحه.

الخطر ليس نظريًا فقط

ويبقى اعتراض ممكنًا: هل تستهدف هذه العروض نماذج مختبرية، لا علاقة لها بخدمة مستخدَمة فعلًا؟ دراسة من 2023، بقيادة Milad Nasr، تجيب باستهداف نماذج منشورة سلفًا: نماذج مفتوحة مثل Pythia أو GPT-Neo، وشبه مفتوحة مثل LLaMA أو Falcon، ونموذج مغلق لا يُتاح إلا عبر خدمة على الشبكة، وهو ChatGPT. وتستخرج منها غيغابايتات من بيانات التدريب. وبالنسبة إلى ChatGPT، وهو نموذج أجوبته مؤطَّرة عادةً، طوّر أصحاب الدراسة تقنية تدفع النموذج إلى الانحراف عن سلوكه المعتاد: وهذه التقنية تُخرِج بيانات تدريب بمعدّل يزيد 150 مرة على المعدّل الملحوظ حين يجيب النموذج عادةً. وتأطير النموذج يقلّل هذا الخطر، لكنه لا يلغيه. واستخراج غيغابايتات لا يفترض أي وصول متميّز إلى النموذج: فالدراسة تمضي بمجرّد الاستجواب، في الشروط نفسها التي يمضي فيها أي استخدام جارٍ للخدمة.

السؤال الذي يُطرَح قبل إيداع ملفّ

وما تقيسه هذه الدراسات مجتمعةً يزيح السؤال الأول. فليست المسألة معرفة إن كان النموذج يقرأ ملفًّا في لحظة تلقّيه، فهذا ما يفترضه الاستخدام العادي أصلًا. المسألة هي معرفة إن كان هذا المحتوى قد يخدم بعد ذلك في تدريب نموذج أو إعادة تدريبه، فينضمّ إذن إلى الخزّان الذي قد تخرج منه شُذرة يومًا، في الشروط المقيسة أعلاه. وقبل إيداع ملفّ في خدمة تستخدم الذكاء الاصطناعي، يُطرَح سؤالان: هل تقول هذه الخدمة، بوضوح، فيمَ تُستخدَم البيانات المودَعة؟ وهل تقترح اختيارًا حقيقيًا لرفض أن تخدم في تدريب أي شيء؟ فغياب الجواب عن أحدهما معلومة بذاته.

وما يصير إليه محتوى يُسلَّم إلى خدمة، وما تقوله هذه الخدمة عنه فعلًا، مفصّل في فصل الدورة المخصَّص له.

ما قاسه البحث العلمي، وما لا يقوله:

  • استخراج بيانات تدريب محفوظة، ومنها معلومات شخصية، باستجواب نموذج منشور فعلًا.
  • حفظٌ يزيد بحجم النموذج، وبتكرار المثال، وبطول السياق المُقدَّم.
  • مراقبةٌ في الزمن الحقيقي لما يُكتَب: فهذه الدراسات توثّق خروجًا لاحقًا ممكنًا، لا قراءةً لحظية تُنقَل إلى طرف ثالث.

المصادر

هذا المقال منشور برخصة CC BY 4.0: انسخه، وترجمه، وأعد نشره مع ذكر ODERSA.

العودة إلى المدوّنة