ما نسلّمه إليه، وما يمكن أن يعيده
إيداع نصّ أو صورة أو ملفّ في خدمة ذكاء اصطناعي يُطلِق أربعة أمور مختلفة، تجمعها شروط الاستخدام غالبًا في جملة واحدة. وهذا الفصل يفصلها، لأن الخطر ليس واحدًا في كل منها.
سؤال «هل يتجسّس عليّ الذكاء الاصطناعي؟» لا يقبل التحقّق: فهو أوسع من أن يكون له جواب صحيح أو خاطئ. والسؤال الذي يقبل التحقّق أضيق. هل يمكن أن يخرج ما أودعته للتوّ يومًا ما، أمام شخص آخر؟ لهذا السؤال جواب مقيس، وهو يقوم على أربع خطوات يجب التمييز بينها أولًا.
الأمور الأربعة التي يجمعها فعل «التسليم»
إيداع ملفّ واحد يُطلِق حتى أربع عمليات. وهي لا تتساوى في طابعها الحتمي، ولا في نتائجها.
- القراءة، للإجابة الآن
- يُقطَّع المحتوى إلى وحدات ويُوضَع في سياق النموذج، الذي يحسب جوابه من هناك. وهذه العملية حتمية: فهي بالضبط ما نطلبه من الخدمة. وهي تتوقّف مع الجواب.
- الحفظ، على خوادم الخدمة
- يُسجَّل المحتوى والجواب، لأجل سجلّ المحادثة، ولمعالجة الإبلاغات، وللإشراف على المحتوى. ومدة الحفظ قرارٌ من الخدمة، لا خصيصةٌ في النموذج.
- إعادة التدريب، بهذا المحتوى بين غيره
- ينضمّ المحتوى إلى خزّان البيانات الذي سيخدم في تدريب نسخة تالية من النموذج. وهنا يتوقّف الإيداع عن كونه تبادلًا ويصير مساهمة دائمة، غالبًا دون أن يكون الشخص قد أرادها.
- الإعادة، لاحقًا، إلى شخص آخر
- النموذج المدرَّب على محتوى يمكن أن يعيده حرفًا بحرف جوابًا عن سؤال عادي يطرحه شخص آخر. وهذه ليست فرضية: إنها نتيجة قاستها الأعمال المذكورة أدناه.
العمليتان الأوليان تخضعان لسياسة الخدمة، وهي سياسة تُقرأ وتُقارَن. والعمليتان الأخيرتان تخضعان لآلية عمل النموذج، وهذا ما يشرحه هذا الفصل.
النموذج يحتفظ، وهذا يُقاس
النموذج ليس لديه قاعدة بيانات نجد فيها النصوص التي قرأها. فبيانات تدريبه ليست مرتّبة في مكان ما داخله: بل عدّلت معاملاته. ولهذا فإن كلمة «الذاكرة» تُضلِّل. ومع ذلك تخرج منه مقاطع كاملة، والبحث العلمي يعرف في أي شروط.
في 2021، استخرج فريق بقيادة Nicholas Carlini من نموذج لغوي مئات المتتاليات المُعادة حرفًا بحرف من بيانات تدريبه، ومنها معلومات شخصية قابلة للتعريف. والطريقة ليست تحايلًا: إنها أسئلة عادية. وبعض المتتاليات المُستخرَجة لم تكن ترد إلا مرة واحدة في البيانات الأصلية.
ودراسة ثانية، في 2023، تقيس ما يُضخِّم هذه الظاهرة. ثلاثة عوامل، كل واحد مُثبَت على حدة.
- حجم النموذج. فكلّما زادت معاملاته زاد حفظه.
- تكرار مثال في البيانات. فالمحتوى الموجود عدة مرات يخرج أسهل من محتوى موجود مرة واحدة.
- طول النصّ المُعطى في السياق قبل طلب المتابعة. فكلّما طالت البداية زاد احتمال الإعادة.
ويبقى اعتراض قائمًا في هذه المرحلة: فهذه العروض تستهدف ربما نماذج مختبرية، لا علاقة لها بخدمة مستخدَمة فعلًا. ودراسة ثالثة، في السنة نفسها، تجيب باستهداف نماذج منشورة بالفعل في الإنتاج، منها نموذج للجمهور العريض أجوبته مؤطَّرة، وتستخرج منها غيغابايتات من بيانات التدريب باستجواب بسيط. وتأطير النموذج يقلّل هذا الخطر. لكنه لا يلغيه.
هذه الأعمال تقيس إعادةً ممكنة لاحقًا، إلى طرف ثالث. وهي لا توثّق قراءةً لحظية تُنقَل إلى أحد وأنت تكتب. والخلط بينهما يُفقِد الشيء الوحيد المفيد هنا، وهو معرفة أي خطر يُؤخَذ في أي لحظة.
قراءة ما تقوله خدمةٌ فعلًا
سياسة الاستخدام تُقرأ بالبحث عن ثلاث صياغات بعينها، لا عن انطباع عام بالجدّية.
ما تغطّيه العبارة
«تحسين خدماتنا» هي العبارة التي تغطّي في الأغلب إعادة التدريب، دون تسميتها. وهي ليست كاذبة ولا مُخبِرة. والنصّ المفيد يقول بدلًا من ذلك ما يُفعَل بالمحتوى، ومن يفعله.
الاختيار، وحالته الافتراضية
يوجد أحيانًا رفضٌ لإعادة التدريب، وشكل هذا الرفض يهمّ أكثر من وجوده. فالرفض الذي يسري افتراضيًا يحمي الجميع. والرفض الذي يجب البحث عنه في إعداد لا يحمي إلا من يعرف أنه هناك، أي لا أحد تقريبًا. والسياسة تُقاس بحالتها الافتراضية، لا بخياراتها.
المدة، وما يبقى بعدها
مدة الحفظ لا تقول شيئًا عن النموذج المدرَّب سلفًا. فحذف محادثة يسحب سجلًا من خادم؛ ولا يسحب من النموذج ما عدّله فيه هذا المحتوى بالفعل. والنموذج المدرَّب لا يتراجع عن تدريبه على محتوى بحذف حساب.
قبل إيداع ملفّ
ثلاثة أسئلة، بهذا الترتيب. وغياب الجواب عن أحدها هو نفسه جواب.
- هل تقول هذه الخدمة، بوضوح وبلا عبارة ملتفّة، فيمَ تُستخدَم المحتويات المودَعة؟
- هل رفض إعادة التدريب هو السلوك الافتراضي، أم إعداد يجب البحث عنه؟
- هل هذا المحتوى ملك لشخص آخر؟ فملفّ مهني، أو واجب تلميذ، أو مستند طبي، أو صورة عائلية تمسّ أشخاصًا لم يقبلوا شيئًا.
وهذه النقطة الأخيرة هي الأكثر نسيانًا، وهي الوحيدة التي لا تُصلَح. فقبول الشروط عن نفسك اختيار. وقبولها عن طرف ثالث غائب ليس اختيارًا.
ما يُودَع، وما لا يُودَع
لا توجد قائمة كونية، لأن الخطر يتوقّف على ما هو على المحكّ. وهذا التوزيع يصحّ لخدمة لم تُحدَّد سياسة إعادة التدريب لديها.
- نصّ عامّ أصلًا، أو مُعَدّ ليصير كذلك.
- محتوى لا يخصّ غيرك ولا يكلّفك إفشاؤه شيئًا.
- مثال مُعاد بناؤه، استُبدلت فيه الأسماء والتواريخ والمبالغ قبل الإيداع.
- معرّف، أو كلمة مرور، أو مفتاح، أو رمز وصول.
- بيانات صحية، أو وثيقة هوية، أو بيانات مصرفية.
- مستند مشمول بسرّ مهني، أو عقد تحت شرط السرّية، أو ملفّ موارد بشرية.
- عمل شخص قاصر، مُسلَّم في إطار مدرسي.
- محتوى يُلزِم إيداعه شخصًا لم يطلب منك شيئًا.
الخطوة التي تُحفَظ
الاستبدال قبل الإرسال. فمعظم الاستخدامات المهنية للنموذج لا تطلب الأسماء الحقيقية ولا التواريخ الحقيقية ولا المبالغ الحقيقية: إنها تطلب شكل المسألة. والملفّ المُعاد كتابته ببيانات بديلة يحصل على المساعدة نفسها ولا يصبّ شيئًا في الخزّان. وهي الخطوة الوحيدة في هذا الفصل التي لا تتوقّف على سياسة أي خدمة.
للمضيّ أبعد
الآلية التي تجعل النموذج يجيب حتى دون أن يعرف شيئًا مُعالَجة في فصل لماذا يختلق. وتركيبة البيانات وآثارها مُعالَجة في فصل من أين تأتي التحيّزات. والأوضاع التي تُغلَق فيها الأداة مجتمعة في متى لا تستخدمه. وقراءة أقصر للموضوع نفسه منشورة في المدوّنة: ما يصير إليه ملفّ مودَع. وفهرس الدورة في صفحة الفهم.
المصادر
- Extracting Training Data from Large Language Models Nicholas Carlini، Florian Tramer، Eric Wallace، Matthew Jagielski، Ariel Herbert-Voss، Katherine Lee، Adam Roberts، Tom Brown، Dawn Song، Ulfar Erlingsson، Alina Oprea، Colin Raffel، 2021. يُثبِت أن مئات متتاليات النصّ الموجودة في بيانات التدريب، ومنها معلومات شخصية قابلة للتعريف، استُخرجت حرفًا بحرف باستجواب النموذج ببساطة.
- Quantifying Memorization Across Neural Language Models Nicholas Carlini، Daphne Ippolito، Matthew Jagielski، Katherine Lee، Florian Tramer، Chiyuan Zhang، 2023. يُثبِت أن الحفظ يزيد بحجم النموذج، وبعدد مرات تكرار المثال في البيانات، وبطول النصّ المُعطى في السياق.
- Scalable Extraction of Training Data from (Production) Language Models Milad Nasr، Nicholas Carlini، Jonathan Hayase، Matthew Jagielski، A. Feder Cooper، Daphne Ippolito، Christopher A. Choquette-Choo، Eric Wallace، Florian Tramer، Katherine Lee، 2023. يُثبِت أن غيغابايتات من بيانات التدريب استُخرجت من نماذج منشورة فعلًا في الإنتاج، منها نموذج للجمهور العريض مُوائَم، بهجوم بسيط.
- Datasheets for Datasets Timnit Gebru، Jamie Morgenstern، Briana Vecchione، Jennifer Wortman Vaughan، Hanna Wallach، Hal Daumé III، Kate Crawford، 2018. يُثبِت وجود مقترح موحَّد لتوثيق منشأ مجموعة بيانات وتركيبتها وطريقة جمعها، بغية التمكّن من تعقّب أصل مشكلة ملحوظة بدل اكتشافها بعد نشر النموذج.