আমরা তাকে যা দিই, আর সে তার কী ফিরিয়ে দিতে পারে
কৃত্রিম বুদ্ধিমত্তার কোনো পরিষেবায় একটি লেখা, একটি ছবি বা একটি ফাইল জমা দিলে চারটি আলাদা ঘটনা শুরু হয়, যেগুলিকে ব্যবহারের শর্তাবলি প্রায়ই একটি বাক্যে গুলিয়ে দেয়। এই অধ্যায় সেগুলিকে আলাদা করে, কারণ প্রতিটির ঝুঁকি এক নয়।
“কৃত্রিম বুদ্ধিমত্তা কি আমার উপরে নজর রাখছে?” প্রশ্নটি যাচাই করা যায় না: উত্তর সত্য বা মিথ্যা হওয়ার জন্য তা বড় বেশি অস্পষ্ট। যে প্রশ্নটি যাচাই করা যায়, তা আরও সংকীর্ণ। আমি এইমাত্র যা জমা দিলাম, তা কি একদিন অন্য কারও সামনে বেরিয়ে আসতে পারে? এই প্রশ্নের একটি মাপা উত্তর আছে, আর তা দাঁড়িয়ে আছে চারটি কাজের উপরে, যেগুলি আগে আলাদা করে নিতে হয়।
“দেওয়া” শব্দটি যে চারটি জিনিস এক করে দেয়
একই একটি ফাইল জমা দেওয়া চারটি পর্যন্ত কাজ শুরু করে দেয়। তাদের অনিবার্যতাও এক নয়, পরিণামও এক নয়।
- পড়া, এখনই উত্তর দিতে
- বিষয়বস্তুটি এককে ভাগ হয় আর মডেলের প্রসঙ্গে বসে যায়, আর সেখান থেকেই সে তার উত্তর হিসাব করে। এই কাজটি অনিবার্য: পরিষেবার কাছে আমরা ঠিক এটিই চাই। উত্তরের সঙ্গেই তা শেষ হয়।
- রেখে দেওয়া, পরিষেবার সার্ভারে
- বিষয়বস্তু আর উত্তর জমা রাখা হয়, আলাপের ইতিহাসের জন্য, জানানো অভিযোগ সামলানোর জন্য, নিয়ন্ত্রণের জন্য। কত দিন রাখা হবে, তা পরিষেবার একটি সিদ্ধান্ত, মডেলের কোনো ধর্ম নয়।
- আবার প্রশিক্ষণ, এই বিষয়বস্তুকে অন্যদের সঙ্গে নিয়ে
- বিষয়বস্তুটি সেই তথ্যের ভাণ্ডারে ঢুকে যায়, যা দিয়ে মডেলের পরের সংস্করণকে প্রশিক্ষণ দেওয়া হবে। এখানেই জমা দেওয়াটি আর একটি লেনদেন থাকে না, হয়ে যায় একটি স্থায়ী অবদান, প্রায়ই মানুষটি তা না চাইতেই।
- ফিরিয়ে দেওয়া, পরে, অন্য কারও কাছে
- যে মডেল একটি বিষয়বস্তুর উপরে প্রশিক্ষিত, সে অন্য কোনো মানুষের করা একটি সাধারণ প্রশ্নের উত্তরে তা হুবহু আবার তৈরি করে দিতে পারে। এটি কোনো অনুমান নয়: এটি নিচে উদ্ধৃত কাজগুলির মাপা ফল।
প্রথম দুটি কাজ একটি পরিষেবার নীতির বিষয়, যা পড়া যায় আর মিলিয়ে দেখা যায়। শেষ দুটি একটি মডেলের কার্যপ্রণালীর বিষয়, আর এই অধ্যায় সেটিই ব্যাখ্যা করে।
একটি মডেল ধরে রাখে, আর তা মাপা যায়
একটি মডেলের এমন কোনো ডেটাবেস নেই, যেখানে সে যে লেখাগুলি পড়েছে সেগুলি খুঁজে পাওয়া যাবে। তার প্রশিক্ষণের তথ্য তার ভেতরে কোথাও সাজিয়ে রাখা নেই: সেগুলি তার প্যারামিটার বদলে দিয়েছে। সেই জন্যই “স্মৃতি” শব্দটি ভুল পথে নিয়ে যায়। তবু গোটা অংশ বেরিয়ে আসে, আর গবেষণা জানে ঠিক কোন কোন শর্তে।
2021 সালে Nicholas Carlini-র নেতৃত্বে একটি দল একটি ভাষা-মডেল থেকে শত শত এমন ধারা টেনে বের করে, যা তার প্রশিক্ষণের তথ্য থেকে হুবহু ফিরিয়ে দেওয়া, আর তার মধ্যে শনাক্ত করা যায় এমন ব্যক্তিগত তথ্যও ছিল। পদ্ধতিটিতে ফাঁকি দেওয়ার কিছুই ছিল না: প্রশ্নগুলি ছিল সাধারণ প্রশ্ন। যে ধারাগুলি ফিরে পাওয়া গেছে, তার কয়েকটি মূল তথ্যে একবারের বেশি ছিলই না।
2023 সালের একটি দ্বিতীয় গবেষণা মাপে, কী কী এই ঘটনাটিকে বাড়িয়ে তোলে। তিনটি কারণ, প্রতিটি আলাদা করে প্রমাণিত।
- মডেলের আকার। তার প্যারামিটার যত বেশি, সে তত বেশি মুখস্থ রাখে।
- তথ্যের ভেতরে একটি উদাহরণের পুনরাবৃত্তি। কয়েকবার থাকা একটি বিষয়বস্তু একবার থাকা বিষয়বস্তুর চেয়ে সহজে বেরিয়ে আসে।
- ধারাবাহিকতা চাওয়ার আগে প্রসঙ্গ হিসেবে দেওয়া লেখার দৈর্ঘ্য। শুরুর অংশ যত লম্বা, ফিরিয়ে দেওয়ার সম্ভাবনা তত বেশি।
এই জায়গায় একটি আপত্তি খোলা থাকে: এই প্রদর্শনগুলি হয়তো গবেষণাগারের মডেল নিয়ে, সত্যিই ব্যবহার হওয়া কোনো পরিষেবার সঙ্গে যার সম্পর্ক নেই। একই বছরের একটি তৃতীয় গবেষণা তার উত্তর দেয় সেই মডেলগুলিকেই নিশানা করে, যেগুলি আগেই উৎপাদনে নেমে গেছে, তার মধ্যে এমন একটি সর্বসাধারণের মডেলও আছে যার উত্তর নিয়ন্ত্রিত, আর সাধারণ প্রশ্ন করেই তার থেকে গিগাবাইট পরিমাণ প্রশিক্ষণের তথ্য টেনে বের করে। একটি মডেলের নিয়ন্ত্রণ এই ঝুঁকি কমায়। সে তা মুছে দেয় না।
এই কাজগুলি মাপে পরে, তৃতীয় কারও কাছে সম্ভাব্য একটি ফিরে আসা। আপনি যখন লিখছেন, তখনই কাউকে পাঠিয়ে দেওয়া তাৎক্ষণিক কোনো পাঠের নথি তারা দেয় না। দুটিকে গুলিয়ে ফেললে এখানে একমাত্র কাজের জিনিসটিই হারিয়ে যায়, অর্থাৎ কোন মুহূর্তে কোন ঝুঁকিটি নেওয়া হচ্ছে তা জানা।
একটি পরিষেবা সত্যিই যা বলে, তা পড়া
ব্যবহারের নীতি পড়তে হয় তিনটি নির্দিষ্ট বাক্যগঠন খুঁজে, গাম্ভীর্যের কোনো সাধারণ ছাপ খুঁজে নয়।
বাক্যটি যা ঢেকে রাখে
“আমাদের পরিষেবা আরও ভালো করতে” হলো সেই বাক্য, যা সবচেয়ে বেশি বার আবার প্রশিক্ষণকে ঢেকে রাখে, তার নাম না করেই। সেটি মিথ্যাও নয়, তথ্যপূর্ণও নয়। যে লেখা কাজে লাগে, সে তার বদলে বলে দেয় বিষয়বস্তু নিয়ে কী করা হয়, আর কে করে।
বেছে নেওয়ার সুযোগ, আর তার ডিফল্ট অবস্থা
আবার প্রশিক্ষণে না বলার সুযোগ মাঝেমধ্যে থাকে, আর তার চেহারাটি তার থাকার চেয়েও বেশি জরুরি। যে অস্বীকৃতি ডিফল্টেই খাটে, সে সবাইকে রক্ষা করে। যে অস্বীকৃতি কোনো সেটিংয়ের ভেতরে খুঁজে নিতে হয়, সে কেবল তাঁদেরই রক্ষা করে যাঁরা জানেন সেটি ওখানে আছে, অর্থাৎ প্রায় কাউকেই নয়। একটি নীতির বিচার হয় তার ডিফল্ট অবস্থা দিয়ে, তার বিকল্পগুলি দিয়ে নয়।
সময়সীমা, আর তার পরে যা থেকে যায়
রেখে দেওয়ার সময়সীমা আগেই প্রশিক্ষিত হয়ে যাওয়া মডেল নিয়ে কিছুই বলে না। একটি আলাপ মুছে দিলে একটি সার্ভার থেকে একটি নথি সরে যায়; তাতে একটি মডেলের ভেতর থেকে সেই বিষয়বস্তু যা বদলে দিয়েছে তা সরে যায় না। প্রশিক্ষিত একটি মডেল অ্যাকাউন্ট মুছে দিলে কোনো বিষয়বস্তু থেকে অ-প্রশিক্ষিত হয়ে যায় না।
একটি ফাইল জমা দেওয়ার আগে
তিনটি প্রশ্ন, এই ক্রমে। এর কোনো একটির উত্তর না থাকাই নিজেই একটি উত্তর।
- এই পরিষেবা কি স্পষ্ট করে, কোনো মোড়ক-বাক্য ছাড়া বলে, জমা দেওয়া বিষয়বস্তু কী কাজে লাগে?
- আবার প্রশিক্ষণে না বলাটি কি ডিফল্ট আচরণ, নাকি খুঁজে নেওয়ার মতো একটি সেটিং?
- এই বিষয়বস্তু কি অন্য কারও? একটি পেশাগত নথি, একজন শিক্ষার্থীর বাড়ির কাজ, একটি চিকিৎসার কাগজ, পরিবারের একটি আলোকচিত্র এমন মানুষদের জড়ায়, যাঁরা কিছুতেই রাজি হননি।
এই শেষ কথাটিই সবচেয়ে বেশি বার ভুলে যাওয়া হয়, আর এটিই একমাত্র, যা শোধরানো যায় না। নিজের জন্য শর্ত মেনে নেওয়া একটি বাছাই। যিনি সেখানে নেই এমন কারও জন্য সেগুলি মেনে নেওয়া কোনো বাছাই নয়।
যা জমা দেওয়া যায়, যা জমা দেওয়া যায় না
বিশ্বজনীন কোনো তালিকা নেই, কারণ ঝুঁকি নির্ভর করে কী বাজি রাখা হচ্ছে তার উপরে। এই ভাগটি খাটে এমন একটি পরিষেবার জন্য, যার আবার-প্রশিক্ষণের নীতি জানা নেই।
- এমন একটি লেখা, যা আগেই প্রকাশ্য, বা প্রকাশ্য হওয়ারই কথা।
- এমন একটি বিষয়বস্তু, যাতে কেবল আপনিই জড়িত আর যা ফাঁস হলে আপনার কিছুই ক্ষতি হবে না।
- নতুন করে গড়া একটি উদাহরণ, যেখানে নাম, তারিখ আর টাকার অঙ্ক জমা দেওয়ার আগেই বদলে দেওয়া হয়েছে।
- একটি পরিচয়, একটি পাসওয়ার্ড, একটি চাবি, একটি অ্যাক্সেস টোকেন।
- স্বাস্থ্যের কোনো তথ্য, একটি পরিচয়পত্র, ব্যাংকের কোনো তথ্য।
- পেশাগত গোপনীয়তায় ঢাকা কোনো নথি, গোপনীয়তার শর্তে বাঁধা একটি চুক্তি, মানবসম্পদের কোনো ফাইল।
- স্কুলের কাজে জমা দেওয়া কোনো অপ্রাপ্তবয়স্ক মানুষের কাজ।
- এমন একটি বিষয়বস্তু, যা জমা দেওয়া আপনার কাছে কিছুই চাননি এমন কাউকে জড়ায়।
যে অভ্যাসটি রেখে দিতে হবে
পাঠানোর আগে বদলে দেওয়া। একটি মডেলের পেশাগত ব্যবহারের বড় অংশেই সত্যিকারের নাম, সত্যিকারের তারিখ বা সত্যিকারের অঙ্ক লাগে না: লাগে সমস্যাটির চেহারা। বদলি তথ্য দিয়ে আবার লেখা একটি ফাইল একই সহায়তাই পায়, আর ভাণ্ডারে কিছুই জমা করে না। এই অধ্যায়ের এটিই একমাত্র অভ্যাস, যা কোনো পরিষেবার নীতির উপরে নির্ভর করে না।
আরও দূর যেতে
কিছুই না জেনেও একটি মডেল কেন উত্তর দেয়, সেই কলকৌশলটি সামলানো হয় কেন সে বানিয়ে বলে অধ্যায়ে। তথ্যের গড়ন আর তার প্রভাব সামলানো হয় পক্ষপাত কোথা থেকে আসে অধ্যায়ে। যে পরিস্থিতিতে যন্ত্রটি বন্ধ হয়ে যায়, সেগুলি এক জায়গায় আছে কখন এটি ব্যবহার করবেন না-তে। একই বিষয়ের একটি ছোট পাঠ প্রকাশিত হয়েছে ব্লগে: জমা দেওয়া একটি ফাইলের কী হয়। পাঠক্রমের সূচি আছে বোঝা পাতায়।
উৎস
- Extracting Training Data from Large Language Models Nicholas Carlini, Florian Tramer, Eric Wallace, Matthew Jagielski, Ariel Herbert-Voss, Katherine Lee, Adam Roberts, Tom Brown, Dawn Song, Ulfar Erlingsson, Alina Oprea, Colin Raffel, 2021। প্রমাণ করে যে প্রশিক্ষণের তথ্যে থাকা শত শত লেখার ধারা, তার মধ্যে শনাক্ত করা যায় এমন ব্যক্তিগত তথ্যও, কেবল মডেলকে প্রশ্ন করেই হুবহু টেনে বের করা গেছে।
- Quantifying Memorization Across Neural Language Models Nicholas Carlini, Daphne Ippolito, Matthew Jagielski, Katherine Lee, Florian Tramer, Chiyuan Zhang, 2023। প্রমাণ করে যে মুখস্থ রাখা বাড়ে মডেলের আকারের সঙ্গে, তথ্যের ভেতরে একটি উদাহরণ যতবার নকল হয়েছে তার সঙ্গে, আর প্রসঙ্গ হিসেবে দেওয়া লেখার দৈর্ঘ্যের সঙ্গে।
- Scalable Extraction of Training Data from (Production) Language Models Milad Nasr, Nicholas Carlini, Jonathan Hayase, Matthew Jagielski, A. Feder Cooper, Daphne Ippolito, Christopher A. Choquette-Choo, Eric Wallace, Florian Tramer, Katherine Lee, 2023। প্রমাণ করে যে সত্যিই উৎপাদনে নামা মডেল থেকে, তার মধ্যে সারিবদ্ধ করা একটি সর্বসাধারণের মডেল থেকেও, একটি সহজ আক্রমণে গিগাবাইট পরিমাণ প্রশিক্ষণের তথ্য টেনে বের করা গেছে।
- Datasheets for Datasets Timnit Gebru, Jamie Morgenstern, Briana Vecchione, Jennifer Wortman Vaughan, Hanna Wallach, Hal Daumé III, Kate Crawford, 2018। প্রমাণ করে যে একটি ডেটাসেটের উৎস, গড়ন আর সংগ্রহের ধরন নথিবদ্ধ করার একটি মানসম্মত প্রস্তাব আছে, যাতে চোখে পড়া কোনো সমস্যার উৎসে ফিরে যাওয়া যায়, মডেল নেমে যাওয়ার পরে তা আবিষ্কার করার বদলে।