ما يصير إليه ملفّ مودَع
قبل إيداع ملفّ في خدمة تستخدم الذكاء الاصطناعي، يُطرَح سؤال دقيق: هل يمكن أن يخرج هذا المحتوى، لاحقًا، أمام شخص آخر؟
إيداع ملفّ في خدمة تستخدم الذكاء الاصطناعي لا يُطلِق في الغالب أي شرح واضح لما يحدث لهذا الملفّ بعد ذلك. والسؤال الذي يجب طرحه ليس «هل سيتجسّس عليّ الذكاء الاصطناعي»، فهذه صيغة أوسع من أن يُتحقَّق منها. والسؤال الذي وثّقه البحث العلمي أدقّ: هل يمكن أن يخرج هذا المحتوى، لاحقًا، أمام شخص آخر؟ فواجبٌ مدرسي، أو صورة عائلية، أو ملفّ مهني: صارت خطوة إيداع الملفّ عادية، أما مسألة ما يصير إليه بعد ذلك فليست كذلك.
النموذج قد يحتفظ بمقاطع كاملة
في 2021، نشر Nicholas Carlini وفريقه عرضًا مباشرًا. فباستجواب GPT-2 ببساطة، وهو نموذج لغوي سابق للمساعدات المحادثية الحالية، استخرجوا منه مئات متتاليات النصّ المُعادة حرفًا بحرف من بيانات تدريبه: أسماء، وأرقام هاتف، وعناوين بريد إلكتروني، ومقاطع محادثات، وشيفرة حاسوبية. وبعض هذه المتتاليات لم يكن يرد إلا مرة واحدة في البيانات الأصلية. وملاحظة أخرى في الدراسة: النماذج الأكبر تحفظ أكثر من الأصغر. ولم يُبحَث عن أي من هذه المعلومات بطريق ملتوٍ: بل خرجت ببساطة جوابًا عن أسئلة عادية، مطروحة كأي استخدام جارٍ للنموذج.
ما يُضخِّم هذا الخطر
ودراسة ثانية، نشرها جزءٌ من الفريق نفسه في 2023، تقيس بدقة ما يزيد الحفظ. ثلاثة عوامل، كل واحد مقيس على حدة: حجم النموذج، وتكرار المثال نفسه في بيانات التدريب، وطول النصّ المُعطى في السياق قبل طلب المتابعة. فكلّما كبر النموذج، وكلّما تكرّر المثال، وكلّما طال السياق المُقدَّم، زاد احتمال العثور على شُذرة محفوظة. ويصف أصحابها حفظًا أوسع انتشارًا مما كان يُعتقَد، ومُرشَّحًا للتفاقم مع نماذج أكبر فأكبر، ما لم يُتَّخذ تدبير لكبحه.
الخطر ليس نظريًا فقط
ويبقى اعتراض ممكنًا: هل تستهدف هذه العروض نماذج مختبرية، لا علاقة لها بخدمة مستخدَمة فعلًا؟ دراسة من 2023، بقيادة Milad Nasr، تجيب باستهداف نماذج منشورة سلفًا: نماذج مفتوحة مثل Pythia أو GPT-Neo، وشبه مفتوحة مثل LLaMA أو Falcon، ونموذج مغلق لا يُتاح إلا عبر خدمة على الشبكة، وهو ChatGPT. وتستخرج منها غيغابايتات من بيانات التدريب. وبالنسبة إلى ChatGPT، وهو نموذج أجوبته مؤطَّرة عادةً، طوّر أصحاب الدراسة تقنية تدفع النموذج إلى الانحراف عن سلوكه المعتاد: وهذه التقنية تُخرِج بيانات تدريب بمعدّل يزيد 150 مرة على المعدّل الملحوظ حين يجيب النموذج عادةً. وتأطير النموذج يقلّل هذا الخطر، لكنه لا يلغيه. واستخراج غيغابايتات لا يفترض أي وصول متميّز إلى النموذج: فالدراسة تمضي بمجرّد الاستجواب، في الشروط نفسها التي يمضي فيها أي استخدام جارٍ للخدمة.
السؤال الذي يُطرَح قبل إيداع ملفّ
وما تقيسه هذه الدراسات مجتمعةً يزيح السؤال الأول. فليست المسألة معرفة إن كان النموذج يقرأ ملفًّا في لحظة تلقّيه، فهذا ما يفترضه الاستخدام العادي أصلًا. المسألة هي معرفة إن كان هذا المحتوى قد يخدم بعد ذلك في تدريب نموذج أو إعادة تدريبه، فينضمّ إذن إلى الخزّان الذي قد تخرج منه شُذرة يومًا، في الشروط المقيسة أعلاه. وقبل إيداع ملفّ في خدمة تستخدم الذكاء الاصطناعي، يُطرَح سؤالان: هل تقول هذه الخدمة، بوضوح، فيمَ تُستخدَم البيانات المودَعة؟ وهل تقترح اختيارًا حقيقيًا لرفض أن تخدم في تدريب أي شيء؟ فغياب الجواب عن أحدهما معلومة بذاته.
وما يصير إليه محتوى يُسلَّم إلى خدمة، وما تقوله هذه الخدمة عنه فعلًا، مفصّل في فصل الدورة المخصَّص له.
ما قاسه البحث العلمي، وما لا يقوله:
- استخراج بيانات تدريب محفوظة، ومنها معلومات شخصية، باستجواب نموذج منشور فعلًا.
- حفظٌ يزيد بحجم النموذج، وبتكرار المثال، وبطول السياق المُقدَّم.
- مراقبةٌ في الزمن الحقيقي لما يُكتَب: فهذه الدراسات توثّق خروجًا لاحقًا ممكنًا، لا قراءةً لحظية تُنقَل إلى طرف ثالث.
المصادر
- Extracting Training Data from Large Language Models Nicholas Carlini وآخرون، 2021.
- Quantifying Memorization Across Neural Language Models Nicholas Carlini وآخرون، 2023.
- Scalable Extraction of Training Data from (Production) Language Models Milad Nasr وآخرون، 2023.
هذا المقال منشور برخصة CC BY 4.0: انسخه، وترجمه، وأعد نشره مع ذكر ODERSA.