এটি ODERSA-র একটি অফিসিয়াল সাইট। কীভাবে বুঝবেন

অফিসিয়াল ডোমেইন

এই সাইটের ঠিকানা odersa.org দিয়ে শেষ হয়। সংস্থার প্রতিটি সেবা odersa.org-এর কোনো সাবডোমেইনেই থাকে, আর কোথাও নয়। আপনার ব্রাউজারের ঠিকানার ঘরে দেখানো ঠিকানা যদি odersa.org দিয়ে শেষ না হয়, তবে এই সাইট আমাদের নয়।

বিনামূল্যে, অ্যাকাউন্ট ছাড়াই

সবকিছু প্রথম মুহূর্ত থেকেই খোলা: কোনো নিবন্ধন নেই, কোনো অ্যাকাউন্ট নেই, কোনো পাসওয়ার্ড নেই, কোনো সাবস্ক্রিপশন নেই, কোনো বিজ্ঞাপন নেই। যাঁরা টাকা দেন তাঁদের জন্য আলাদা কিছু রাখা নেই, কারণ এখানে কিছুই টাকার বিনিময়ে নয়।

কোনো তথ্য সংগ্রহ নয়

এই সাইট আপনার পিছু নেয় না: কোনো ট্র্যাকার নেই, ট্র্যাকিং কুকি নেই, এই পাতাগুলোতে বসানো কোনো মাপার সরঞ্জামও নেই, আর আপনার যন্ত্রে কিছুই মাপা হয় না। আমাদের হোস্ট সমষ্টিগতভাবে অনুরোধ গোনে, উত্তর দেওয়া যেকোনো সার্ভার যেমন গোনে: একটি মোট সংখ্যা, কখনও কোনো প্রোফাইল নয়। আমাদের কথা বিশ্বাস করার দরকার নেই: আপনার ব্রাউজারের ডেভেলপার টুল খুলুন, নেটওয়ার্ক ট্যাবে যান, আর পাতাটি আবার লোড করুন। সাইট যা যা চায়, তার পুরো তালিকা আপনি দেখতে পাবেন। সবই odersa.org থেকে আসে, কিছুই অন্য কোথাও যায় না।

মুক্ত কনটেন্ট

কনটেন্ট CC BY 4.0 লাইসেন্সে প্রকাশিত। আপনি তা কপি করতে, অনুবাদ করতে, ছাপতে ও আবার বিতরণ করতে পারেন, আপনার ক্লাসের জন্যও, আপনার আপনজনের জন্যও, একটিমাত্র শর্তে: ODERSA-র নাম উল্লেখ করুন।

জমা দেওয়া একটি ফাইলের কী হয়

কৃত্রিম বুদ্ধিমত্তা ব্যবহার করে এমন কোনো পরিষেবায় ফাইল জমা দেওয়ার আগে একটি নির্দিষ্ট প্রশ্ন ওঠে: এই বিষয়বস্তু কি পরে, অন্য কারও সামনে, আবার বেরিয়ে আসতে পারে?

কৃত্রিম বুদ্ধিমত্তা ব্যবহার করে এমন কোনো পরিষেবায় একটি ফাইল জমা দিলে, তার পর সেই ফাইলটির কী হয়, তার স্পষ্ট ব্যাখ্যা কমই পাওয়া যায়। নিজেকে যে প্রশ্নটি করতে হবে, তা “AI কি আমার উপরে নজর রাখবে” নয়, একটি বাক্য যা যাচাই করার পক্ষে বড় বেশি অস্পষ্ট। গবেষণা যে প্রশ্নটি নথিবদ্ধ করেছে, তা আরও নির্দিষ্ট: এই বিষয়বস্তু কি পরে, অন্য কারও সামনে, আবার বেরিয়ে আসতে পারে? একটি স্কুলের বাড়ির কাজ, পরিবারের একটি আলোকচিত্র, একটি পেশাগত ফাইল: একটি ফাইল জমা দেওয়ার কাজটি সাধারণ হয়ে গেছে, তার পর তার কী হয় সেই প্রশ্নটি হয়নি।

একটি মডেল গোটা অংশ ধরে রাখতে পারে

2021 সালে Nicholas Carlini আর তাঁর দল একটি সোজা প্রদর্শন প্রকাশ করেন। GPT-2-কে, এখনকার আলাপচারী সহায়কদের আগের একটি ভাষা-মডেলকে, কেবল প্রশ্ন করেই তাঁরা তার থেকে শত শত লেখার ধারা টেনে বের করেন, যা তার প্রশিক্ষণের তথ্য থেকে হুবহু ফিরিয়ে দেওয়া: নাম, ফোন নম্বর, ইমেল ঠিকানা, আলাপের অংশ, কম্পিউটারের কোড। এই ধারাগুলির কয়েকটি মূল তথ্যে একবারের বেশি ছিলই না। গবেষণাটির আরেকটি পর্যবেক্ষণ: সবচেয়ে বড় মডেলগুলি সবচেয়ে ছোটগুলির চেয়ে বেশি মুখস্থ রাখে। এই তথ্যগুলির একটিও কোনো ঘুরপথে খোঁজা হয়নি: সেগুলি কেবল সাধারণ প্রশ্নের উত্তরেই বেরিয়ে এসেছে, মডেলটির যে কোনো চলতি ব্যবহারের মতোই করা প্রশ্নে।

যা এই ঝুঁকিটি বাড়িয়ে তোলে

একই দলের একটি অংশের 2023 সালে প্রকাশিত একটি দ্বিতীয় গবেষণা ঠিকভাবে মেপে দেখায়, কী মুখস্থ রাখা বাড়িয়ে তোলে। তিনটি কারণ, প্রতিটি আলাদা করে মাপা: মডেলের আকার, প্রশিক্ষণের তথ্যে একই উদাহরণের পুনরাবৃত্তি, আর ধারাবাহিকতা চাওয়ার আগে প্রসঙ্গ হিসেবে দেওয়া লেখার দৈর্ঘ্য। একটি মডেল যত বড়, একটি উদাহরণ যতবার ফিরে এসেছে, দেওয়া প্রসঙ্গ যত লম্বা, একটি মুখস্থ রাখা টুকরো আবার পাওয়ার সম্ভাবনা তত বাড়ে। লেখকরা এমন একটি মুখস্থ রাখার বর্ণনা দেন, যা আমরা যা ভাবতাম তার চেয়ে বেশি ছড়ানো, আর ক্রমশ আরও বড় মডেলের সঙ্গে যা আরও গুরুতর হয়ে উঠবে, তাকে ধরে রাখার কোনো ব্যবস্থা না নিলে।

ঝুঁকিটি কেবল তত্ত্বগত নয়

একটি আপত্তি এখনও সম্ভব: এই প্রদর্শনগুলি কি গবেষণাগারের মডেল নিয়ে, সত্যিই ব্যবহার হওয়া কোনো পরিষেবার সঙ্গে যার সম্পর্ক নেই? Milad Nasr-এর নেতৃত্বে 2023 সালের একটি গবেষণা তার উত্তর দেয় আগেই নেমে যাওয়া মডেলগুলিকেই নিশানা করে: Pythia বা GPT-Neo-র মতো খোলা মডেল, LLaMA বা Falcon-এর মতো আধা-খোলা, আর কেবল একটি অনলাইন পরিষেবার ভেতর দিয়েই পৌঁছানো যায় এমন একটি বন্ধ মডেল, ChatGPT। সে তার থেকে গিগাবাইট পরিমাণ প্রশিক্ষণের তথ্য টেনে বের করে। ChatGPT-র জন্য, যার উত্তর সাধারণত নিয়ন্ত্রিত, লেখকরা এমন একটি কৌশল তৈরি করেন যা মডেলটিকে তার চেনা আচরণ থেকে সরে যেতে বাধ্য করে: এই কৌশলটি মডেল স্বাভাবিকভাবে উত্তর দেওয়ার সময় দেখা হারের চেয়ে 150 গুণ বেশি হারে প্রশিক্ষণের তথ্য বের করে আনে। একটি মডেলের নিয়ন্ত্রণ এই ঝুঁকি কমায়, সে তা মুছে দেয় না। গিগাবাইট বের করতে মডেলে কোনো বিশেষ সুবিধার দরকার হয় না: গবেষণাটি কেবল প্রশ্ন করেই এগোয়, পরিষেবাটির যে কোনো চলতি ব্যবহারের মতোই অবস্থায়।

একটি ফাইল জমা দেওয়ার আগে নিজেকে যে প্রশ্নটি করতে হবে

এই গবেষণাগুলি একসঙ্গে যা মাপে, তা শুরুর প্রশ্নটি সরিয়ে দেয়। কথাটি এই নয় যে একটি মডেল একটি ফাইল পাওয়ার মুহূর্তে তা পড়ে কি না, যা একটি স্বাভাবিক ব্যবহার আগেই ধরে নেয়। কথাটি এই যে এই বিষয়বস্তু তার পর কোনো মডেলকে প্রশিক্ষণ দিতে বা আবার প্রশিক্ষণ দিতে কাজে লাগতে পারে কি না, আর তাই সেই ভাণ্ডারে ঢুকে যেতে পারে কি না, যার একটি টুকরো, উপরে মাপা অবস্থায়, একদিন বেরিয়ে আসতে পারে। AI ব্যবহার করে এমন কোনো পরিষেবায় একটি ফাইল জমা দেওয়ার আগে দুটি প্রশ্ন ওঠে: এই পরিষেবা কি স্পষ্ট করে বলে, জমা দেওয়া তথ্য কী কাজে লাগে? আর সে কি সত্যিই বেছে নেওয়ার সুযোগ দেয়, যাতে সেগুলি কিছুকেই প্রশিক্ষণ দিতে না লাগে? এই দুটির কোনো একটির উত্তর না থাকাই, নিজেই, একটি তথ্য।

কোনো পরিষেবার হাতে তুলে দেওয়া একটি বিষয়বস্তুর কী হয়, আর সেই পরিষেবা সে নিয়ে সত্যিই কী বলে, তার বিস্তারিত আছে পাঠক্রমের সেই অধ্যায়ে, যা তার জন্যই।

গবেষণা যা মেপেছে, আর যা সে বলে না:

  • সত্যিই নেমে যাওয়া একটি মডেলকে প্রশ্ন করে মুখস্থ রাখা প্রশিক্ষণের তথ্য, তার মধ্যে ব্যক্তিগত তথ্যও, টেনে বের করা।
  • এমন একটি মুখস্থ রাখা, যা মডেলের আকারের সঙ্গে, একটি উদাহরণের পুনরাবৃত্তির সঙ্গে আর দেওয়া প্রসঙ্গের দৈর্ঘ্যের সঙ্গে বাড়ে।
  • যা লেখা হচ্ছে তার উপরে সরাসরি নজরদারি: এই গবেষণাগুলি পরে সম্ভাব্য একটি ফিরে আসা নথিবদ্ধ করে, কোনো তৃতীয় পক্ষকে পাঠানো তাৎক্ষণিক কোনো পাঠ নয়।

উৎস

এই লেখাটি প্রকাশিত CC BY 4.0 লাইসেন্সে: ODERSA-র নাম উল্লেখ করে তা কপি করুন, অনুবাদ করুন, আবার প্রকাশ করুন।

ব্লগে ফিরে যান