একটি বানানো ছবি
যন্ত্রে বানানো একটি ছবি প্রায়ই তাকে তৈরি করা কাজগুলির দাগ বয়ে বেড়ায়, আর সেই দাগ মাপা যায়। এই প্রদর্শন আপনার ডিভাইসেই দুটি ছবি বানায়, দেখায় দাগটি কোথায় ফুটে ওঠে, আর দেখায় কোথা থেকে তা আর পড়া যায় না।
সবই আপনার ব্রাউজারে হিসাব হয়। দুটি ছবিই এই ডিভাইসে আঁকা হয়, তাদের স্পেকট্রাম সেখানেই হিসাব হয়, আর কোনো ছবি কোথাও থেকে নামানো হয় না। আপনার ব্রাউজারের নেটওয়ার্ক ট্যাব খুলুন আর প্রদর্শনটি নাড়াচাড়া করুন: কোনো অনুরোধই বাইরে যায় না।
দুটি ছবি, একই বিষয়বস্তু, একটি বিয়োগের কাজ
নিচের দুটি ছবিই একই শুরুর ক্ষেত্র থেকে বেরিয়ে আসে। একটি যেমন আছে তেমনই দেখানো হয়। অন্যটি একটি সরু গলা দিয়ে যায়: তাকে ছোট করা হয়, তার পর প্রতিটি পিক্সেল আবার আবার বসিয়ে বড় করা হয়, আর এটিই সেই অতি-নমুনায়নের কাজ, যা ছবি-জেনারেটরগুলি একটি ছোট মানের ছক থেকে একটি বড় আকারের ছবিতে যেতে একের পর এক চালায়। আর কিছুই তাদের আলাদা করে না।
তৈরি করা চালু করুন। দুটি ছবি, তাদের দুটি স্পেকট্রাম আর সংখ্যায় মাপটি এখানে দেখা যাবে।
মাপটি যা দেখায়
দাগটি একটি ঘাটতি, কোনো চূড়া নয়
প্রচলিত ধারণা বলে, একটি বানানো ছবি তার স্পেকট্রামে চূড়া দেখায়। এই প্রদর্শন যা মাপে, তা উলটোটি, আর তা আরও কৌতূহলজনক। অতি-নমুনায়নের জালিটির কম্পাঙ্কগুলিতে বানানো ছবির শক্তি তার আশপাশের চেয়ে নিয়মিতভাবেই কম থাকে, প্রায় এগারো ডেসিবেল কম। এই কম্পাঙ্কগুলিই ঠিক সেগুলি, যা আবার-বসানোর কার্নেল শূন্য করে দেয়: প্রতিটি পিক্সেল একটি নির্দিষ্ট সংখ্যক বার আবার বসিয়ে এমন একটি ফিল্টার খাটানো হয়, যার শূন্যগুলি এই সংখ্যার গুণিতকেই পড়ে। তাই স্পেকট্রাম যে যন্ত্র তাকে তৈরি করেছে, তার গর্তটি ধরে রাখে।
সাক্ষী ছবিটিতে, কোনো নয়েজ যোগ না করলে, সেই একই মাপ এক ডেসিবেলের চেয়েও কম ফারাক দেয়, এক দিকে বা অন্য দিকে, কারণ একটি বুনন কেন এই কম্পাঙ্কগুলিকেই এগিয়ে দেবে বা এড়িয়ে যাবে, তার কোনো কারণ নেই। তাই দুটি ছবির মধ্যে তফাতটি কোনো ছাপ নয়: এটি একটি সংখ্যা, আর তা আবার করা যায়।
সে প্রায় কিছুরই নিচে মিলিয়ে যায়
নয়েজের স্লাইডারটি ঠেলে দিন আর দেখুন মাপটি গলে যাচ্ছে। ডিফল্ট বীজে, আট গুণকে নেওয়া মানগুলি এই।
| যোগ করা নয়েজ | সাক্ষী ছবি | বানানো ছবি |
|---|---|---|
| কোনোটি নয় | +0.2 | -11.0 |
| 2 স্তর | -0.5 | -4.6 |
| 5 স্তর | -0.8 | -1.6 |
| 10 স্তর | -1.2 | -0.5 |
| 20 স্তর | -0.7 | +0.2 |
| 40 স্তর | -0.4 | +0.8 |
নয়েজের পাঁচ ধূসর স্তরে, অর্থাৎ পুরো মাপের দুই শতাংশে, দাগটি আগেই গলে গেছে: এগারো ডেসিবেল থেকে সে দুইয়েরও নিচে নেমে আসে, অর্থাৎ সাক্ষী ছবি নিজে থেকে যা দেখায়, তার ঠিক দ্বিগুণ। দশ স্তরে সে আর নেই: বানানো ছবিতে মাপা ফারাকটি সাক্ষীর ফারাকের নিচে চলে যায়, আর তাদের আলাদা করার আর কিছুই থাকে না। এই মাত্রার একটি নয়েজ চোখে অদৃশ্য, আর সে নিজেই তৈরি হয়ে যায়: একটি পুনঃসংকোচন, একটি স্ক্রিনশট, একটি আকার বদল, ঘষামাজার একটি ফিল্টার, কেউ না চাইতেই ঠিক ততটাই করে দেয়।
দাগটি অবিসংবাদিত, আর সে প্রায় কিছুই সহ্য করে না। এই বাক্যের দুটি অর্ধেকই সমান গুরুত্বপূর্ণ।
পদ্ধতি
গোটা হিসাবটি, যিনি এই পাতা ছাড়াই তা আবার করতে চান তাঁর জন্য।
- শুরুর ক্ষেত্রটি তৈরি করা। মসৃণ করা নয়েজের পাঁচটি স্তর, ক্রমশ আরও সূক্ষ্ম, এমন একটি বিস্তারে যোগ করা যা প্রতিটি স্তরে অর্ধেক হয়ে যায়। এতে এমন একটি বুনন পাওয়া যায়, যার শক্তি কম্পাঙ্কের সঙ্গে কমে, ঠিক একটি আলোকচিত্রের মতো। তোলাটি দেখানো বীজ দিয়ে বপন করা, তাই পুনরুৎপাদনযোগ্য।
- দ্বিতীয় ছবিটি তৈরি করা। বেছে নেওয়া বাহুর বর্গাকার ব্লক ধরে ক্ষেত্রটির গড় করা, তাতে একটি ছোট ছবি পাওয়া যায়, তার পর প্রতিটি পিক্সেল ততবার আবার বসিয়ে তাকে আবার বড় করা। এটিই নিকটতম-প্রতিবেশী অতি-নমুনায়ন।
- নয়েজ থাকলে তা যোগ করা, দুটি ছবিতেই একই বিস্তারে।
- প্রতিটি ছবিকে দীপ্তিতে নিয়ে যাওয়া, তার গড় সরিয়ে দেওয়া, তার পর তার দুই মাত্রার ফুরিয়ে রূপান্তর হিসাব করা। গড় সরানো অপরিহার্য: নয়তো ধ্রুবক উপাংশটি সবকিছু চাপা দিয়ে দেয় আর স্পেকট্রাম কেন্দ্রে একটি বিন্দু ছাড়া আর কিছুই থাকে না।
- স্পেকট্রামটি আবার কেন্দ্রে আনা, প্রতিটি কম্পাঙ্কের বিস্তার নেওয়া, আর সর্বোচ্চের সঙ্গে তুলনায় তাকে ডেসিবেলে বদলানো।
- মাপা। যেসব কম্পাঙ্কের দুটি স্থানাঙ্কই জালির ধাপের গুণিতক, সেগুলির ডেসিবেলের গড় করা, তার পর আর সব জায়গার ডেসিবেলের গড় করা, আর বিয়োগ করা। এটিই জালির ফারাক। শূন্যের কাছাকাছি একটি মান বলে, এই কম্পাঙ্কগুলিতে বিশেষ কিছুই নেই। স্পষ্টভাবে ঋণাত্মক একটি মান বলে, এখান দিয়ে একটি আবার-বসানোর কার্নেল গেছে।
জালির ধাপ হলো ছবির বাহু ভাগ অতি-নমুনায়নের গুণক। প্রদর্শনে গুণকটি বদলান, আর তার সঙ্গে ধাপটিও বদলায়: মাপটি দাগটি অন্য জায়গায় খুঁজতে যায়, আর সে তা পেয়েও যায়। এই জিনিসটিই দেখায় যে মাপটি সত্যিই কাজটির পিছু নেয়, আর সে যা পেতে চায় তা-ই পেয়ে যায় না।
এই প্রদর্শন যা করে না
- সে দেখায় যে তৈরির একটি কাজ কম্পাঙ্কের পরিসরে একটি মাপা যায় আর আবার করা যায় এমন দাগ রেখে যায়।
- সে দেখায় যে এই দাগটি কাজটির সেটিংয়ের উপরে নির্ভর করে, আর তার সঙ্গেই সরে যায়।
- সে দেখায় যে কোন গোলযোগ থেকে দাগটি আর পড়ার মতো থাকে না।
- সে কিছুই শনাক্ত করে না। এই পাতা নিজেই দুটি ছবি তৈরি করে: সে জানে কোনটি কোনটি, সে তা আন্দাজ করে না, আর সে আত্মবিশ্বাসের কোনো নম্বরও দেয় না।
- আপনি এনেছেন এমন কোনো ছবির সে বিচার করে না, আর সে কোনো ফাইলও নেয় না। যে যন্ত্র একটি সত্যিকারের ছবির উপরে রায় দেওয়ার দাবি করে, সে মিথ্যা বলে।
- সে একটি সত্যিকারের ছবি-জেনারেটর নকল করে না। অতি-নমুনায়ন তার একটি কাজ, সব কাজ নয়, আর সাম্প্রতিক স্থাপত্যগুলি জেনেবুঝেই এই স্বাক্ষরটি হালকা করে দেয়।
গবেষণা যা মেপেছে
প্রকাশিত তিনটি ফল এই প্রদর্শনটিকে ঘিরে রাখে, আর একটি চতুর্থ তার সীমা দেয়।
জেনারেটিভ নেটওয়ার্কে তৈরি ছবিতে নিয়মিত দাগ থাকে, যা কম্পাঙ্কের পরিসরে দেখা যায়, আর যার কারণ এই স্থাপত্যগুলির সাধারণ অতি-নমুনায়নের কাজ। প্রতিদ্বন্দ্বী নেটওয়ার্কের অতি-নমুনায়নের অংশটি একটি বৈশিষ্ট্যপূর্ণ আর আবার করা যায় এমন স্পেকট্রাল ছাপ রেখে যায়, যা প্রশিক্ষণে এই নির্দিষ্ট মডেলটি না দেখা থাকলেও কাজে লাগানো যায়। এই কাজগুলি উপরের মাপটির মতোই একই কথা বলে: যন্ত্র নিজের যাওয়ার স্বাক্ষর রেখে যায়।
সীমাটিও প্রকাশিত, আর তা স্পষ্ট। সমকক্ষ-পর্যালোচিত একটি কাজ প্রমাণ করে যে পিক্সেল স্তরের অদৃশ্য জলছাপ একটি পুনর্গঠনের আক্রমণে সরিয়ে দেওয়া যায়, যা একটি ছবিতে নয়েজ যোগ করে তার পর তাকে আবার গড়ে তোলে, আর এই পরিবারের আক্রমণগুলি ছবির দৃশ্যগত গুণ রেখে দেয়। তার লেখকরা উপসংহারে বলেন, অদৃশ্য জলছাপ ছেড়ে এমন চিহ্নে যাওয়া দরকার, যা ছবির অর্থ রক্ষা করে। এই পাতার নয়েজের স্লাইডারটি তিন সেকেন্ডে যা করে, তা এই আক্রমণেরই প্রাথমিক সংস্করণ।
একটি শেষ তথ্য মানুষের চোখ নিয়ে আলোচনাটি বন্ধ করে দেয়: দর্শকরা আর নির্ভরযোগ্য ভাবে একটি কৃত্রিম মুখ আর একটি সত্যিকারের মুখের তফাত করতে পারেন না, আর কৃত্রিম মুখগুলিকেই গড়ে আরও বেশি বিশ্বাসযোগ্য বলে বিচার করেন। তাই নিজের ছাপের উপরে ভরসা করা কোনো নিরাপদ পিছু-হটা নয়।
যে অভ্যাসটি রেখে দিতে হবে
যে ছবির উৎস গুরুত্বপূর্ণ, তার সামনে ছবির ভেতরে সংকেত খুঁজবেন না। উৎস খুঁজুন: কে তা প্রথমে প্রকাশ করেছে, কোন তারিখে, আর উৎসের মেটাডেটা যখন থাকে তখন তারা কী বলে। এই পথটি সামলানো হয়েছে জলছাপ অধ্যায়ে। একটি কৌশলগত সংকেত একটি সন্দেহ নথিবদ্ধ করতে কাজে লাগে, কখনও একা উপসংহারে পৌঁছাতে নয়।
আরও দূর যেতে
একটি শব্দ-সংকেতের উপরে একই কাজটি আছে একটি বানানো কণ্ঠ অধ্যায়ে। একটি বিষয়বস্তুতে চিহ্ন বসানোর দুটি উপায় আছে জলছাপ অধ্যায়ে। যে পরিস্থিতিতে যন্ত্রটি বন্ধ হয়ে যায়, সেগুলি এক জায়গায় আছে কখন এটি ব্যবহার করবেন না-তে। সাইটের সব প্রদর্শন এক জায়গায় আছে প্রদর্শন পাতায়, আর পাঠক্রমের সূচি আছে বোঝা পাতায়।
উৎস
- Leveraging Frequency Analysis for Deep Fake Image Recognition Joel Frank, Thorsten Eisenhofer, Lea Schönherr, Asja Fischer, Dorothea Kolossa, Thorsten Holz, 2020। প্রমাণ করে যে জেনারেটিভ নেটওয়ার্কে তৈরি ছবিতে নিয়মিত দাগ থাকে, যা কম্পাঙ্কের পরিসরে দেখা যায়, আর যার কারণ এই স্থাপত্যগুলির সাধারণ অতি-নমুনায়নের কাজ।
- Detecting and Simulating Artifacts in GAN Fake Images Xu Zhang, Svebor Karaman, Shih-Fu Chang, 2019। প্রমাণ করে যে প্রতিদ্বন্দ্বী নেটওয়ার্কের ব্যবহৃত অতি-নমুনায়নের অংশটি একটি বৈশিষ্ট্যপূর্ণ আর আবার করা যায় এমন স্পেকট্রাল ছাপ রেখে যায়, যা প্রশিক্ষণে এই নির্দিষ্ট মডেলটি না দেখা থাকলেও একটি তৈরি ছবি শনাক্ত করতে কাজে লাগানো যায়।
- Invisible Image Watermarks Are Provably Removable Using Generative AI Xuandong Zhao, Kexun Zhang, Zihao Su, Saastha Vasan, Ilya Grishchenko, Christopher Kruegel, Giovanni Vigna, Yu-Xiang Wang, Lei Li, NeurIPS 2024। প্রমাণ করে যে একটি পুনর্গঠনের আক্রমণ, যা একটি ছবিতে নয়েজ যোগ করে তার পর তাকে আবার গড়ে তোলে, পিক্সেল স্তরের অদৃশ্য জলছাপ সরিয়ে দেয় আর দৃশ্যগত গুণ রেখে দেয়, আর তার ফলে লেখকরা ছবির অর্থ রক্ষা করে এমন চিহ্নে যাওয়ার সুপারিশ করেন।
- AI-synthesized faces are indistinguishable from real faces and more trustworthy Sophie J. Nightingale, Hany Farid, 2022। প্রমাণ করে যে মানুষ-দর্শকরা আর নির্ভরযোগ্য ভাবে একটি কৃত্রিম মুখ আর একটি সত্যিকারের মুখের তফাত করতে পারেন না, আর কৃত্রিম মুখগুলিকেই গড়ে আরও বেশি বিশ্বাসযোগ্য বলে বিচার করেন।