জমা দেওয়া একটি ফাইলের কী হয়
কৃত্রিম বুদ্ধিমত্তা ব্যবহার করে এমন কোনো পরিষেবায় ফাইল জমা দেওয়ার আগে একটি নির্দিষ্ট প্রশ্ন ওঠে: এই বিষয়বস্তু কি পরে, অন্য কারও সামনে, আবার বেরিয়ে আসতে পারে?
কৃত্রিম বুদ্ধিমত্তা ব্যবহার করে এমন কোনো পরিষেবায় একটি ফাইল জমা দিলে, তার পর সেই ফাইলটির কী হয়, তার স্পষ্ট ব্যাখ্যা কমই পাওয়া যায়। নিজেকে যে প্রশ্নটি করতে হবে, তা “AI কি আমার উপরে নজর রাখবে” নয়, একটি বাক্য যা যাচাই করার পক্ষে বড় বেশি অস্পষ্ট। গবেষণা যে প্রশ্নটি নথিবদ্ধ করেছে, তা আরও নির্দিষ্ট: এই বিষয়বস্তু কি পরে, অন্য কারও সামনে, আবার বেরিয়ে আসতে পারে? একটি স্কুলের বাড়ির কাজ, পরিবারের একটি আলোকচিত্র, একটি পেশাগত ফাইল: একটি ফাইল জমা দেওয়ার কাজটি সাধারণ হয়ে গেছে, তার পর তার কী হয় সেই প্রশ্নটি হয়নি।
একটি মডেল গোটা অংশ ধরে রাখতে পারে
2021 সালে Nicholas Carlini আর তাঁর দল একটি সোজা প্রদর্শন প্রকাশ করেন। GPT-2-কে, এখনকার আলাপচারী সহায়কদের আগের একটি ভাষা-মডেলকে, কেবল প্রশ্ন করেই তাঁরা তার থেকে শত শত লেখার ধারা টেনে বের করেন, যা তার প্রশিক্ষণের তথ্য থেকে হুবহু ফিরিয়ে দেওয়া: নাম, ফোন নম্বর, ইমেল ঠিকানা, আলাপের অংশ, কম্পিউটারের কোড। এই ধারাগুলির কয়েকটি মূল তথ্যে একবারের বেশি ছিলই না। গবেষণাটির আরেকটি পর্যবেক্ষণ: সবচেয়ে বড় মডেলগুলি সবচেয়ে ছোটগুলির চেয়ে বেশি মুখস্থ রাখে। এই তথ্যগুলির একটিও কোনো ঘুরপথে খোঁজা হয়নি: সেগুলি কেবল সাধারণ প্রশ্নের উত্তরেই বেরিয়ে এসেছে, মডেলটির যে কোনো চলতি ব্যবহারের মতোই করা প্রশ্নে।
যা এই ঝুঁকিটি বাড়িয়ে তোলে
একই দলের একটি অংশের 2023 সালে প্রকাশিত একটি দ্বিতীয় গবেষণা ঠিকভাবে মেপে দেখায়, কী মুখস্থ রাখা বাড়িয়ে তোলে। তিনটি কারণ, প্রতিটি আলাদা করে মাপা: মডেলের আকার, প্রশিক্ষণের তথ্যে একই উদাহরণের পুনরাবৃত্তি, আর ধারাবাহিকতা চাওয়ার আগে প্রসঙ্গ হিসেবে দেওয়া লেখার দৈর্ঘ্য। একটি মডেল যত বড়, একটি উদাহরণ যতবার ফিরে এসেছে, দেওয়া প্রসঙ্গ যত লম্বা, একটি মুখস্থ রাখা টুকরো আবার পাওয়ার সম্ভাবনা তত বাড়ে। লেখকরা এমন একটি মুখস্থ রাখার বর্ণনা দেন, যা আমরা যা ভাবতাম তার চেয়ে বেশি ছড়ানো, আর ক্রমশ আরও বড় মডেলের সঙ্গে যা আরও গুরুতর হয়ে উঠবে, তাকে ধরে রাখার কোনো ব্যবস্থা না নিলে।
ঝুঁকিটি কেবল তত্ত্বগত নয়
একটি আপত্তি এখনও সম্ভব: এই প্রদর্শনগুলি কি গবেষণাগারের মডেল নিয়ে, সত্যিই ব্যবহার হওয়া কোনো পরিষেবার সঙ্গে যার সম্পর্ক নেই? Milad Nasr-এর নেতৃত্বে 2023 সালের একটি গবেষণা তার উত্তর দেয় আগেই নেমে যাওয়া মডেলগুলিকেই নিশানা করে: Pythia বা GPT-Neo-র মতো খোলা মডেল, LLaMA বা Falcon-এর মতো আধা-খোলা, আর কেবল একটি অনলাইন পরিষেবার ভেতর দিয়েই পৌঁছানো যায় এমন একটি বন্ধ মডেল, ChatGPT। সে তার থেকে গিগাবাইট পরিমাণ প্রশিক্ষণের তথ্য টেনে বের করে। ChatGPT-র জন্য, যার উত্তর সাধারণত নিয়ন্ত্রিত, লেখকরা এমন একটি কৌশল তৈরি করেন যা মডেলটিকে তার চেনা আচরণ থেকে সরে যেতে বাধ্য করে: এই কৌশলটি মডেল স্বাভাবিকভাবে উত্তর দেওয়ার সময় দেখা হারের চেয়ে 150 গুণ বেশি হারে প্রশিক্ষণের তথ্য বের করে আনে। একটি মডেলের নিয়ন্ত্রণ এই ঝুঁকি কমায়, সে তা মুছে দেয় না। গিগাবাইট বের করতে মডেলে কোনো বিশেষ সুবিধার দরকার হয় না: গবেষণাটি কেবল প্রশ্ন করেই এগোয়, পরিষেবাটির যে কোনো চলতি ব্যবহারের মতোই অবস্থায়।
একটি ফাইল জমা দেওয়ার আগে নিজেকে যে প্রশ্নটি করতে হবে
এই গবেষণাগুলি একসঙ্গে যা মাপে, তা শুরুর প্রশ্নটি সরিয়ে দেয়। কথাটি এই নয় যে একটি মডেল একটি ফাইল পাওয়ার মুহূর্তে তা পড়ে কি না, যা একটি স্বাভাবিক ব্যবহার আগেই ধরে নেয়। কথাটি এই যে এই বিষয়বস্তু তার পর কোনো মডেলকে প্রশিক্ষণ দিতে বা আবার প্রশিক্ষণ দিতে কাজে লাগতে পারে কি না, আর তাই সেই ভাণ্ডারে ঢুকে যেতে পারে কি না, যার একটি টুকরো, উপরে মাপা অবস্থায়, একদিন বেরিয়ে আসতে পারে। AI ব্যবহার করে এমন কোনো পরিষেবায় একটি ফাইল জমা দেওয়ার আগে দুটি প্রশ্ন ওঠে: এই পরিষেবা কি স্পষ্ট করে বলে, জমা দেওয়া তথ্য কী কাজে লাগে? আর সে কি সত্যিই বেছে নেওয়ার সুযোগ দেয়, যাতে সেগুলি কিছুকেই প্রশিক্ষণ দিতে না লাগে? এই দুটির কোনো একটির উত্তর না থাকাই, নিজেই, একটি তথ্য।
কোনো পরিষেবার হাতে তুলে দেওয়া একটি বিষয়বস্তুর কী হয়, আর সেই পরিষেবা সে নিয়ে সত্যিই কী বলে, তার বিস্তারিত আছে পাঠক্রমের সেই অধ্যায়ে, যা তার জন্যই।
গবেষণা যা মেপেছে, আর যা সে বলে না:
- সত্যিই নেমে যাওয়া একটি মডেলকে প্রশ্ন করে মুখস্থ রাখা প্রশিক্ষণের তথ্য, তার মধ্যে ব্যক্তিগত তথ্যও, টেনে বের করা।
- এমন একটি মুখস্থ রাখা, যা মডেলের আকারের সঙ্গে, একটি উদাহরণের পুনরাবৃত্তির সঙ্গে আর দেওয়া প্রসঙ্গের দৈর্ঘ্যের সঙ্গে বাড়ে।
- যা লেখা হচ্ছে তার উপরে সরাসরি নজরদারি: এই গবেষণাগুলি পরে সম্ভাব্য একটি ফিরে আসা নথিবদ্ধ করে, কোনো তৃতীয় পক্ষকে পাঠানো তাৎক্ষণিক কোনো পাঠ নয়।
উৎস
- Extracting Training Data from Large Language Models Nicholas Carlini et al., 2021।
- Quantifying Memorization Across Neural Language Models Nicholas Carlini et al., 2023।
- Scalable Extraction of Training Data from (Production) Language Models Milad Nasr et al., 2023।
এই লেখাটি প্রকাশিত CC BY 4.0 লাইসেন্সে: ODERSA-র নাম উল্লেখ করে তা কপি করুন, অনুবাদ করুন, আবার প্রকাশ করুন।