জলছাপ
দুটি আলাদা কৌশল “জলছাপ” নামটি বহন করে, আর আমরা অবিরত সেগুলি গুলিয়ে ফেলি। এই অধ্যায় আপনার চোখের সামনে দুই ধরনের একটি করে জলছাপ বানায়, প্রথমে একটি লেখায়, তার পর একটি ছবিতে, আর দ্বিতীয়টিকে আপনার সামনেই ধ্বংস করে তার আসল সীমাটি দেখাতে।
সবই আপনার ব্রাউজারে হিসাব হয়। লেখাটি এই ডিভাইসে শেখা একটি খেলনা-মডেল তৈরি করে, ছবিটি একটি স্থানীয় ক্যানভাসে আঁকা হয়, আর সে যে বার্তাটি লুকিয়ে রাখে তা কখনও কোথাও পাঠানো হয় না। আপনার ব্রাউজারের নেটওয়ার্ক ট্যাব খুলুন আর প্রদর্শনটি নাড়াচাড়া করুন: কোনো অনুরোধই বাইরে যায় না।
দুটি কলকৌশল, যা আমরা গুলিয়ে ফেলি
“জলছাপ” বলা হয় দুটি খুব আলাদা কলকৌশলকে, আর এই গোলমালের দাম অনেক। প্রথমটি একটি ফাইলের উৎস তার মেটাডেটায় ঘোষণা করে, যেন তার উপরে সাঁটা একটি নামফলক। দ্বিতীয়টি বিষয়বস্তুটিকে নিজেই চুপচাপ বদলে দেয়, যেন কাপড়ের ভেতরে বোনা একটি বুনন। একটি ফাইল একটি বহন করতে পারে, অন্যটি, দুটিই, বা দুটির একটিও নয়।
এই অধ্যায় আপনার চোখের সামনেই দ্বিতীয় কলকৌশলটি বানায়, প্রথমে একটি লেখায়, তার পর একটি ছবিতে, কারণ তা হিসাব করা যায়। প্রথমটি হিসাব করা যায় না: সে ঘোষিত হয়, নয়তো হয় না। তার পর আসে দুটির তুলনা, প্রতিটি কী কী সহ্য করে আর দুটির একটিও কী বদলে দিতে পারে না, তার সঙ্গে।
একটি লেখার উপরে বসানো সবুজ-তালিকার জলছাপ
সে যে প্রতিটি শব্দ তৈরি করে, তার জন্য এই সাইটের খেলনা-মডেল সম্ভাব্য প্রার্থীদের একটি তালিকা হিসাব করে। একটি গোপন চাবি, আগের শব্দটির সঙ্গে মিলিয়ে, এই তালিকার অর্ধেককে “সবুজ” বলে ঠিক করে দেয়। তার পর তোলাটিকে একটুখানি সেই অর্ধেকের দিকে ঠেলে দেওয়া হয়। চাবি আর এই ঠেলার জোর সেট করুন, তার পর একটি লেখা তৈরি করুন: তৈরি হওয়া প্রতিটি শব্দ সেই মুহূর্তে চাবিটি তাকে যে নামফলক দেয়, তার সঙ্গেই দেখা যায়।
তৈরি হওয়া লেখাটি এখানে দেখা যাবে, শব্দে শব্দে, চাবিটি তাকে যে রং দেয় তার সঙ্গে।
উপরের লেখাটি একই চাবি দিয়ে মাপা যায়, আর অন্য যে কোনো লেখাও: একটি বসিয়ে দিন, বা এইমাত্র যেটি ফুটে উঠল সেটি বদলে দিন, তার পর মাপুন। ফলটি কখনও “জলছাপ দেওয়া” বা “জলছাপ ছাড়া” হয় না: এটি একটি অনুপাত, যা জলছাপ ছাড়া কত হতো তার সঙ্গে মিলিয়ে দেখতে হয়।
সবুজ তালিকায় থাকা শব্দের অনুপাত, আর তার পাঠ, এখানে দেখা যাবে।
একটি ছবির সবচেয়ে কম ভারের বিটে একটি জলছাপ
একটি ডিজিটাল ছবি হলো সংখ্যার একটি জাল, রঙের প্রতিটি চ্যানেল আর প্রতিটি পিক্সেলের জন্য একটি, শূন্য থেকে দুইশো পঞ্চান্ন পর্যন্ত। এই সংখ্যাগুলির একটিরও সবচেয়ে কম ভারের বিট বদলে দিলে তার মান বেশির বেশি এক বদলায়: চোখে পড়ার মতো কিছুই নয়। এই প্রদর্শন একটি ছবি আঁকে, ঠিক সেই বিটগুলিতেই একটি বার্তা লুকিয়ে রাখে, তা আবার খুঁজে বের করে, তার পর আপনাকে সেটি ধ্বংস করতে দেয়।
বানানো ছবিটি, আর তাতে আবার পাওয়া বার্তাটি, এখানে দেখা যাবে।
এখন একটি সাধারণ কাজ বেছে নিন, যেগুলির একটি মেসেজিং অ্যাপে পাঠানো বা কোনো নেটওয়ার্কে ভাগ করা নিজে থেকেই খাটিয়ে দেয়, আর দেখুন বার্তাটি টেকে কি না।
বেছে নেওয়া কাজটির পরে ছবিটি, আর বার্তাটির যা বাকি আছে, এখানে দেখা যাবে।
পদ্ধতি
সবুজ-তালিকার জলছাপ, ধাপে ধাপে
- চলতি শব্দটির জন্য সম্ভাব্য প্রার্থীদের তালিকা আর তাদের সম্ভাবনা পাওয়া, হুবহু যেমন পরের শব্দ অধ্যায়ে।
- গোপন চাবি আর ঠিক আগের শব্দটি মিলিয়ে দেওয়া, তার পর একটি হ্যাশ ফাংশন দিয়ে তার থেকে শূন্য আর একের মধ্যে একটি সংখ্যা তোলা। অর্ধেকের নিচে হলে প্রার্থী সবুজ; উপরে হলে সে লাল। প্রতিটি ধাপে শব্দভাণ্ডারের অর্ধেকটাই সবুজ, তবে কখনও একই অর্ধেক নয়: সে আগের শব্দটির সঙ্গে বদলে যায়।
- প্রতিটি সবুজ প্রার্থীর লজিটের সঙ্গে বেছে নেওয়া জোরটি যোগ করা, তাপমাত্রা আর তোলার আগে: এটিই সেই ঝোঁক, যা খেলনা-মডেল ঠিক এই ধাপে মেনে নেয়।
- এই শোধরানো বিন্যাসে স্বাভাবিকভাবেই তোলা। একটি সবুজ শব্দের এখন বেছে নেওয়ার সুযোগ বেশি, আর কোনো শব্দই অসম্ভব হয়ে যায় না; আর যখন এই ধাপের সব প্রার্থীর রং একই, তখন ঝোঁকটি কিছুই বদলায় না, কারণ আলাদা করার মতো বাছাইই নেই।
- পরের শব্দের জন্য আবার করা: আগের শব্দটি বদলে গেছে, তাই সবুজ তালিকাটিও।
- একটি লেখা মাপতে, তার প্রতিটি শব্দের উপরে দুই নম্বর ধাপের হিসাবটি আবার করা, একই চাবি দিয়ে, আর সবুজ শব্দের অংশটি গোনা। যে চাবি দিয়ে লেখাটি তৈরি হয়েছে, তার অধীনে এই অংশ স্পষ্টভাবেই অর্ধেক ছাড়িয়ে যায়; যে কোনো একটি লেখায়, বা অন্য একটি চাবির অধীনে, সে অর্ধেকের কাছেই থাকে।
- মাপা এই অংশটিকে প্রত্যাশিত অর্ধেকের সঙ্গে মিলিয়ে দেখা, একটি সংক্ষিপ্ত ফারাকের হিসাবে: ফারাক যত বড়, এই জলছাপ না পাওয়া একটি লেখায় দেখা এই অনুপাতটি তত বিরল হতো। এই সংখ্যাটি কখনও একটি রায় হয়ে ওঠে না।
সবচেয়ে কম ভারের বিটে একটি বার্তা লুকিয়ে রাখা, ধাপে ধাপে
- ছবিটি আঁকা আর তার পিক্সেল পড়া: প্রতিটির জন্য শূন্য থেকে দুইশো পঞ্চান্ন পর্যন্ত তিনটি সংখ্যা, রঙের প্রতিটি চ্যানেলের জন্য একটি।
- বার্তার দৈর্ঘ্য, বাইটের সংখ্যায়, প্রথম বত্রিশটি পাওয়া বিটে লেখা।
- বার্তার প্রতিটি বাইট একের পর এক লেখা, প্রতিটি আটটি বিটে।
- লেখার মতো প্রতিটি বিটের জন্য, রঙের চ্যানেলের জালে পরের সংখ্যাটি নেওয়া, তার সবচেয়ে কম ভারের বিট মুছে দেওয়া আর সেখানে বার্তার বিটটি বসানো। সংখ্যাটি বেশির বেশি এক বদলায়, দুইশো পঞ্চান্নের একটি মাপে: কোনো চোখই তফাতটি দেখে না।
- বার্তাটি আবার পেতে, একই বিটগুলিই একই ক্রমে আবার পড়া, দৈর্ঘ্যটি তার পর বাইটগুলি আবার গড়ে তোলা, আর সেগুলি লেখায় বদলে নেওয়া।
- যে কাজ পিক্সেলগুলি আবার হিসাব করে, একটি পুনঃসংকোচন বা একটি আকার বদল, সে তাদের সবচেয়ে কম ভারের বিটটিও আবার হিসাব করে, সেটি কী বহন করছিল তার কোনো পরোয়া না করেই। বার্তাটি কেবল তখনই টেকে, যখন এই মান হুবহু একই থাকে, বিট ধরে।
একটি বিষয়বস্তুতে চিহ্ন বসানোর দুটি উপায়
উপরের দুটি পরীক্ষা এই অধ্যায় যে দুটি কলকৌশল আলাদা করে, তাদের ঠিক জায়গাটিই দিয়ে দেয়।
ঘোষিত উৎস: পড়ার মতো, আর ভঙ্গুর
একটি প্রকাশ্য কৌশলগত মান, C2PA, বলে দেয় কীভাবে একটি ফাইলের সঙ্গে তার উৎস আর তার ইতিহাস নিয়ে সই করা তথ্য জুড়ে দেওয়া যায়: কোন যন্ত্র বা কোন সফটওয়্যার তাকে তৈরি করেছে, সে কী কী বদল সহ্য করেছে। যে অ্যাপ এই মানটি পড়ে, সে এই তথ্য স্পষ্ট করেই দেখায়, Content Credentials নামে। এটি একটি নামফলক, শব্দের ঠিক অর্থেই: সে বলে ফাইলটি কোথা থেকে এসেছে, সে ফাইলটির ভেতরে কিছুই ছোঁয় না।
একটি নামফলক খুলে যায়। মানটি নিজেই তা মেনে নেয়: তার উৎসের তথ্য ফাইল থেকে আলাদা হয়ে যেতে পারে, আর তাতে সে একটি সাধারণ স্ক্রিনশটে বা ফাইলটি আবার সংরক্ষণেই হারিয়ে যায়। একটি ছবিকে পুনঃসংকুচিত করা মেসেজিংয়ে পাঠানো, কেবল পর্দায় দেখা পিক্সেলগুলি নকল করা একটি স্ক্রিনশট, এই মেটাডেটার ব্লকটি গ্রাহ্য করে না এমন একটি ফরম্যাটে সংরক্ষণ: এই কাজগুলির একটিও কোনো আক্রমণ নয়, আর প্রত্যেকটিই উৎসটি মুছে দিতে যথেষ্ট, মুছে যাওয়ার কোনো দাগ না রেখেই।
এখানেই সবচেয়ে বেশি ছড়ানো ভুল বোঝাটি: ঘোষিত উৎস ছাড়া একটি ছবি এমন একটি ছবি নয়, যে কিছু লুকিয়ে রাখছে। হতে পারে এটি এমন একটি ছবি, যার নামফলকটি পথেই কেবল খুলে পড়েছে, আর যা ঘুরে বেড়ানো প্রায় সব ছবিরই হয়।
পরিসংখ্যানের জলছাপ: চুপচাপ, আর বেশি টেকে, তবু অজেয় নয়
পরিসংখ্যানের জলছাপ বিষয়বস্তুর পাশে যোগ হয় না: সে বিষয়বস্তুটিকেই বদলে দেয়, সামান্য আর ছড়িয়ে দিয়ে। একটি লেখায়, তোলাটিকে একটি চাবি বেছে নেওয়া শব্দের তালিকার দিকে ঠেলে দিয়ে, যেমনটি উপরের প্রদর্শন এইমাত্র করল। একটি ছবিতে, পিক্সেল এমনভাবে বদলে দিয়ে, যা এখানে ব্যাখ্যাযোগ্য থাকার জন্য ব্যবহার করা সবচেয়ে কম ভারের বিটের চেয়ে অনেক বেশি চুপচাপ হতে পারে।
প্রকৃতির এই তফাতটিই টিকে থাকার ব্যাপারে সবকিছু বদলে দেয়। মেটাডেটার একটি নামফলক একটিমাত্র কাজেই মিলিয়ে যায়, কারণ সে তথ্যের পাশে বসানো কিছু তথ্য ছাড়া আর কিছুই নয়। একটি পরিসংখ্যানের জলছাপকে বিষয়বস্তুর ভেতরেই ভেঙে ফেলতে হয়: একটি লেখা হাতে নকল করলে তার সবুজ তালিকার কিছুই বদলায় না, আর একটি ছবি মাঝেমধ্যে এমন কাজের ভেতর দিয়েও একটি জলছাপ ধরে রাখে, যেগুলি তার উৎসকে বিনা পরিশ্রমেই মুছে দিত।
এই টিকে থাকার দুটি সীমা আছে, আর দুটিই এইমাত্র উপরে দেখা গেল। প্রথমটি: একটি জলছাপ ধরে নেয় যে তৈরিকারক তা তৈরির মুহূর্তেই বসিয়েছে। কোনো পরিষেবাকে তা করতে কিছুই বাধ্য করে না, আর বিষয়বস্তুটি যদি তা ছাড়াই ঘুরে থাকে, তবে পরে কিছুই তা প্রমাণ করে না। দ্বিতীয়টি: একটি জলছাপও অজেয় নয়। একটি বানানো ছবি অধ্যায়ে উদ্ধৃত একটি কাজ দেখায় যে একটি পুনর্গঠনের আক্রমণ, যা একটি ছবিতে নয়েজ যোগ করে তার পর তাকে আবার গড়ে তোলে, পিক্সেল স্তরের অদৃশ্য জলছাপ সরিয়ে দেয় আর দৃশ্যগত গুণ রেখে দেয়। উপরে আপনি এইমাত্র যে পুনঃসংকোচন বা আকার বদলটি বেছে নিলেন, তা এরই প্রাথমিক সংস্করণ, একটি আলাদা কলকৌশলে খাটানো তবে একই ভাবনায়: পিক্সেল আবার হিসাব করলে তাতে যা লুকিয়ে ছিল, তা মুছে যায়।
- একটি পরিসংখ্যানের জলছাপ বিষয়বস্তুটিকেই বদলে দেয়, তাই সে এমন নকলের সঙ্গেও যায়, যার পিছু মেটাডেটার একটি নামফলক নেয় না।
- তার শনাক্তকরণ একটি অনুপাত আর একটি মাপা ফারাক দেয়, কখনও রায় দেওয়ার মতো একটি শব্দ নয়।
- এই পরিবারের জলছাপ সত্যিই নেমেছে আর প্রকাশিত হয়েছে, সমকক্ষ-পর্যালোচিত হয়ে।
- সে নিজে থেকে বসে না: যে তৈরিকারক তা খাটাতে বেছে নেয়, সে না থাকলে শনাক্ত করার কিছুই নেই।
- সে সবকিছু সহ্য করে না: যথেষ্ট জোরালো একটি কাজ, সাধারণ হলেও, তার শেষ করে দেয়।
- সে কখনও বলে না একটি বিষয়বস্তু সত্য নাকি মিথ্যা, কেবল বলে সে একটি নির্দিষ্ট তৈরির চিহ্ন বহন করে কি না।
গবেষণা যা মেপেছে
একটি প্রকাশ্য কৌশলগত মান ঠিক করে দেয় কীভাবে একটি ফাইলের সঙ্গে তার উৎস আর তার বদলের ইতিহাস নিয়ে যাচাইযোগ্য আর সই করা তথ্য জুড়ে দেওয়া যায়, আর সে নিজেই মেনে নেয় যে এই তথ্য ফাইল থেকে আলাদা করা যায়, তাই একটি স্ক্রিনশটে বা আবার সংরক্ষণেই তা হারিয়ে যেতে পারে, আর কিছুই এই হারানোটি জানায় না।
একটি তৈরি করা লেখায় চোখে অদৃশ্য একটি পরিসংখ্যানের জলছাপ বসানো, প্রতিটি ধাপে কিছু শব্দকে একটুখানি এগিয়ে দিয়ে, তার পর একটি পরিসংখ্যানের পরীক্ষায় তা শনাক্ত করা: উপরের প্রদর্শনটি এইমাত্র ঠিক এই কলকৌশলটিই চালিয়ে দেখাল। এই পরিবারের একটি কলকৌশল, একটি সত্যিকারের পরিষেবার নমুনায়নের সঙ্গে জোড়া, Nature পত্রিকায় প্রকাশিত আর সমকক্ষ-পর্যালোচিত হয়েছে: এই পাতা শিক্ষার উদ্দেশে যা সরল করে দেখায়, তা অন্য কোথাও একেবারে অন্য মাপে নেমে গেছে।
যে অভ্যাসটি রেখে দিতে হবে
যে ফাইলের উৎস গুরুত্বপূর্ণ, তার সামনে দুটি প্রতিক্রিয়া বড় বেশি বার একটি বিচারের জায়গা নিয়ে নেয়। প্রথমটি: একটি ঘোষিত উৎস খোঁজা আর তা না পেয়ে উপসংহারে আসা যে ফাইলটি কিছু লুকিয়ে রাখছে। মানটি নিজেই উলটোটি বলে: উৎস না থাকা ঘুরে বেড়ানো প্রায় সব ফাইলেরই স্বাভাবিক দশা, কোনো প্রমাণ নয়। দ্বিতীয়টি: একটি লেখা বা একটি ছবির উপরে একটি শনাক্তকারী যন্ত্রের কাছে একটি রায় চাওয়া। চোদ্দটি পাঠ-শনাক্তকারী যন্ত্রের একটি স্বতন্ত্র মূল্যায়ন, যার মধ্যে শিক্ষাক্ষেত্রে ব্যবহৃত যন্ত্রও আছে, উপসংহারে বলে যে একটিও একই সঙ্গে নির্ভরযোগ্য আর নির্ভুল নয়; আর সবচেয়ে বহুল ব্যবহৃতগুলির একটির তৈরিকারক নিজেই তার যন্ত্রটি চালুর ছয় মাস পরেই তুলে নিয়েছে, বলে যে তার নির্ভরযোগ্যতার হার কাজে লাগার মতো নয়।
উপরের সবুজ-তালিকার জলছাপের প্রদর্শনটি এই একই সতর্কতা নিজের উপরেই খাটায়: তার ফল একটি অনুপাত আর একটি সংক্ষিপ্ত ফারাক, কখনও রায় দেওয়ার মতো একটি শব্দ নয়। যে বিষয়বস্তুর উৎস সত্যিই গুরুত্বপূর্ণ, তার সামনে কাজের প্রশ্নটি সব সময় একই থাকে: কে তা প্রথমে প্রকাশ করেছে, কোন তারিখে, আর অন্য কোথাও তা মিলিয়ে দেখা যায় কি না। একটি কৌশলগত সংকেত একটি সন্দেহ নথিবদ্ধ করে, সে কখনও তার জায়গা নেয় না।
আরও দূর যেতে
এই অধ্যায় যে কলকৌশলটি সরিয়ে রাখে, অর্থাৎ ইচ্ছে করে বসানো একটি জলছাপের বদলে তৈরির অনিচ্ছাকৃত দাগটি যে ধরে, তা সামলানো হয়েছে একটি বানানো ছবি আর একটি বানানো কণ্ঠ অধ্যায়ে। লেখার জলছাপ যে তোলাটিতে ঝোঁক বসায়, তা বিস্তারিত ব্যাখ্যা করা আছে পরের শব্দ অধ্যায়ে। যে পরিস্থিতিতে এই যন্ত্রগুলির একটিও যথেষ্ট নয়, সেগুলি এক জায়গায় আছে কখন এটি ব্যবহার করবেন না-তে। সাইটের সব প্রদর্শন এক জায়গায় আছে প্রদর্শন পাতায়, আর পাঠক্রমের সূচি আছে বোঝা পাতায়।
উৎস
- Content Credentials: C2PA Technical Specification (version 2.4) Coalition for Content Provenance and Authenticity (C2PA), 2026। প্রমাণ করে যে এমন একটি প্রকাশ্য কৌশলগত মান আছে, যা ঠিক করে দেয় কীভাবে একটি ফাইলের সঙ্গে তার উৎস আর তার বদলের ইতিহাস নিয়ে যাচাইযোগ্য আর সই করা তথ্য জুড়ে দেওয়া যায়।
- C2PA Frequently Asked Questions Coalition for Content Provenance and Authenticity (C2PA), 2026। প্রমাণ করে যে C2PA মানটি নিজেই মেনে নেয়, তার উৎসের ম্যানিফেস্ট ফাইল থেকে আলাদা করা যায়, আর তাতে এই তথ্য একটি সাধারণ স্ক্রিনশটে বা ফাইলটি আবার সংরক্ষণেই হারিয়ে যেতে পারে।
- A Watermark for Large Language Models John Kirchenbauer, Jonas Geiping, Yuxin Wen, Jonathan Katz, Ian Miers, Tom Goldstein, 2023। প্রমাণ করে যে একটি তৈরি করা লেখায় মানুষের চোখে অদৃশ্য একটি পরিসংখ্যানের জলছাপ বসানো সম্ভব, প্রতিটি ধাপে কিছু শব্দকে একটুখানি এগিয়ে দিয়ে, আর তার পর একটি পরিসংখ্যানের পরীক্ষায় তা শনাক্ত করা সম্ভব।
- Scalable watermarking for identifying large language model outputs Sumanth Dathathri, Abigail See, Sumedh Ghaisas, Po-Sen Huang, Rob McAdam, Johannes Welbl, et al., 2024। প্রমাণ করে যে SynthID-Text, উৎপাদনে ব্যবহৃত স্পেকুলেটিভ নমুনায়নের সঙ্গে জোড়া একটি পরিসংখ্যানের জলছাপ, Nature পত্রিকায় (খণ্ড 634, পৃ. 818-823) প্রকাশিত আর সমকক্ষ-পর্যালোচিত হয়েছে।
- Testing of detection tools for AI-generated text Debora Weber-Wulff, Alla Anohina-Naumeca, Sonja Bjelobaba, Tomas Foltynek, Jean Guerrero-Dib, Olumide Popoola, Petr Sigut, Lorna Waddington, 2023। প্রমাণ করে যে AI-তে তৈরি পাঠ শনাক্ত করার চোদ্দটি যন্ত্রের একটি স্বতন্ত্র মূল্যায়ন, যার মধ্যে শিক্ষাক্ষেত্রে ব্যবহৃত বাণিজ্যিক যন্ত্রও আছে, উপসংহারে বলে যে তাদের একটিও একই সঙ্গে নির্ভরযোগ্য আর নির্ভুল নয়।
- OpenAI scuttles AI-written text detector over ‘low rate of accuracy’ Devin Coldewey / TechCrunch, OpenAI উদ্ধৃত করে, 2023। প্রমাণ করে যে OpenAI নিজের AI-তে তৈরি পাঠ শনাক্ত করার যন্ত্রটি চালুর ছয় মাস পরেই তুলে নিয়েছে, নিজেই বলে যে তার নির্ভরযোগ্যতার হার কাজে লাগার মতো নয়।