बनाई गई तस्वीर
मशीन से बनी तस्वीर अक्सर उन कामों का निशान लिए चलती है जिन्होंने उसे बनाया, और वह निशान नापा जा सकता है। यह डेमो आपके डिवाइस पर दो तस्वीरें बनाता है, दिखाता है कि निशान कहाँ उभरता है, और यह भी कि वह कहाँ से पढ़ा ही नहीं जा सकता।
सब कुछ आपके ब्राउज़र में हिसाब होता है। दोनों तस्वीरें इसी डिवाइस पर बनाई जाती हैं, उनके स्पेक्ट्रम यहीं निकाले जाते हैं, और कोई तस्वीर कहीं से डाउनलोड नहीं होती। अपने ब्राउज़र का Network टैब खोलिए और डेमो चलाइए: कोई रिक्वेस्ट बाहर नहीं जाती।
दो तस्वीरें, वही सामग्री, और फ़र्क़ का एक काम
नीचे की दोनों तस्वीरें एक ही शुरुआती क्षेत्र से निकलती हैं। एक जैसी है वैसी दिखा दी जाती है। दूसरी एक गले से गुज़रती है: उसे छोटा किया जाता है, फिर हर पिक्सल दोहराकर दोबारा बड़ा किया जाता है, और यही वह ऊपर-नमूना करने का काम है जिसे तस्वीर बनाने वाले एक के बाद एक चलाते हैं, ताकि मानों की एक छोटी तालिका से एक बड़ी तस्वीर बन जाए। इसके सिवा उनमें कुछ भी फ़र्क़ नहीं है।
बनाना शुरू कीजिए। दोनों तस्वीरें, उनके दोनों स्पेक्ट्रम और आंकड़ों वाली नाप यहाँ दिखेंगे।
नाप क्या दिखाती है
निशान एक कमी है, कोई उभार नहीं
आम धारणा यह है कि बनाई गई तस्वीर अपने स्पेक्ट्रम में उभार दिखाती है। यह डेमो जो नापता है, वह उलटा है, और वह ज़्यादा दिलचस्प है। ऊपर-नमूना करने वाली जाली की आवृत्तियों पर, बनाई गई तस्वीर में अपने आस-पास से हमेशा कम ऊर्जा होती है, लगभग ग्यारह डेसिबल कम। ये ठीक वही आवृत्तियाँ हैं जिन्हें दोहराने वाला कर्नेल शून्य कर देता है: हर पिक्सल को एक तय संख्या में दोहराने से एक ऐसा फ़िल्टर लग जाता है जिसके शून्य उसी संख्या के गुणकों पर गिरते हैं। इसलिए स्पेक्ट्रम उस औज़ार का गड्ढा बनाए रखता है जिसने उसे बनाया।
नियंत्रण तस्वीर पर, जब कोई शोर न जोड़ा गया हो, वही नाप एक डेसिबल से कम का फ़र्क़ देती है, इस तरफ़ या उस तरफ़, क्योंकि किसी बुनावट के पास इन आवृत्तियों का पक्ष लेने या उनसे बचने की कोई वजह नहीं है। इसलिए दोनों तस्वीरों का फ़र्क़ कोई आभास नहीं है: वह एक संख्या है, और वह दोहराई जा सकती है।
ज़रा-सी गड़बड़ी पर वह गायब हो जाती है
शोर का स्लाइडर आगे बढ़ाइए और नाप को पिघलते हुए देखिए। डिफ़ॉल्ट सीड पर, गुणक आठ पर दर्ज किए गए मान ये हैं।
| जोड़ा गया शोर | नियंत्रण तस्वीर | बनाई गई तस्वीर |
|---|---|---|
| कोई नहीं | +0.2 | -11.0 |
| 2 स्तर | -0.5 | -4.6 |
| 5 स्तर | -0.8 | -1.6 |
| 10 स्तर | -1.2 | -0.5 |
| 20 स्तर | -0.7 | +0.2 |
| 40 स्तर | -0.4 | +0.8 |
धूसर के पाँच स्तर के शोर पर, यानी पैमाने के दो प्रतिशत पर, निशान पहले ही पिघल चुका है: ग्यारह डेसिबल से वह दो से भी नीचे आ जाता है, यानी नियंत्रण तस्वीर जो अपने आप दिखाती है उसका ठीक दोगुना। दस स्तर पर वह रहता ही नहीं: बनाई गई तस्वीर पर नापा गया जाली-अंतर नियंत्रण तस्वीर के अंतर से नीचे चला जाता है, और दोनों में कोई फ़र्क़ नहीं बचता। इस मात्रा का शोर आँख को नहीं दिखता, और वह अपने आप पैदा हो जाता है: एक बार दोबारा संपीड़ित करना, एक स्क्रीनशॉट, एक बार आकार बदलना, कोई रीटच फ़िल्टर, इतना ही कर देते हैं, किसी के चाहे बिना।
निशान निर्विवाद है, और वह ज़रा-सी गड़बड़ी भी नहीं झेलता। इस वाक्य के दोनों आधे बराबर मायने रखते हैं।
तरीका
पूरा हिसाब, उनके लिए जो इसे इस पन्ने के बिना दोहराना चाहते हैं।
- शुरुआती क्षेत्र बनाइए। चिकने शोर की पाँच परतें, एक से एक बारीक, ऐसी मात्रा के साथ जोड़ी गईं जो हर परत पर आधी होती जाती है। इससे एक ऐसी बुनावट मिलती है जिसकी ऊर्जा आवृत्ति के साथ घटती है, ठीक किसी फ़ोटो की तरह। बेतरतीब चुनाव दिखाए गए सीड से तय होता है, इसलिए वह दोहराया जा सकता है।
- दूसरी तस्वीर बनाइए। क्षेत्र का औसत चुनी हुई भुजा के वर्ग खंडों में निकालिए, जिससे एक छोटी तस्वीर मिलती है, फिर हर पिक्सल को उतनी बार दोहराकर उसे दोबारा बड़ा कीजिए। यह निकटतम पड़ोसी वाला ऊपर-नमूना करना है।
- शोर जोड़िए, अगर जोड़ना है तो, दोनों तस्वीरों पर उतनी ही मात्रा में।
- हर तस्वीर को चमक में बदलिए, उसका औसत हटाइए, फिर उसका दो-आयामी फ़ूरिए रूपांतरण निकालिए। औसत हटाना ज़रूरी है: वरना स्थिर घटक सब कुछ दबा देता है और स्पेक्ट्रम बीच में एक बिंदु से ज़्यादा कुछ नहीं रहता।
- स्पेक्ट्रम को दोबारा केंद्र में लाइए, हर आवृत्ति की मात्रा लीजिए, और उसे सबसे बड़े मान के मुक़ाबले डेसिबल में बदलिए।
- नापिए। उन आवृत्तियों के डेसिबल का औसत निकालिए जिनके दोनों निर्देशांक जाली-अंतराल के गुणक हैं, फिर बाकी हर जगह के डेसिबल का औसत निकालिए, और घटा दीजिए। यही जाली-अंतर है। शून्य के पास का मान कहता है कि इन आवृत्तियों में कुछ खास नहीं। साफ़-साफ़ ऋणात्मक मान कहता है कि वहाँ से कोई दोहराने वाला कर्नेल गुज़रा है।
जाली-अंतराल तस्वीर की भुजा को ऊपर-नमूना करने के गुणक से भाग देकर मिलता है। डेमो में गुणक बदलिए, और अंतराल उसके साथ बदल जाता है: नाप निशान कहीं और ढूँढ़ने जाती है, और वह उसे पा लेती है। इससे यह पता चलता है कि नाप असल में उस काम के पीछे चल रही है, और वह वही नहीं ढूँढ़ लेती जो उसे ढूँढ़ना है।
यह डेमो क्या नहीं करता
- वह दिखाता है कि बनाने का कोई काम आवृत्तियों के दायरे में एक नापा और दोहराया जा सकने वाला निशान छोड़ जाता है।
- वह दिखाता है कि यह निशान उस काम की सेटिंग पर टिका है, और उसके साथ जगह बदलता है।
- वह दिखाता है कि किस गड़बड़ी के बाद यह निशान पढ़ा ही नहीं जा सकता।
- वह कुछ नहीं पकड़ता। यह पन्ना दोनों तस्वीरें खुद बनाता है: वह जानता है कि कौन सी कौन है, वह अंदाज़ा नहीं लगाता, और वह भरोसे का कोई स्कोर नहीं देता।
- वह आपकी लाई हुई किसी तस्वीर को नहीं आँकता, और वह कोई फ़ाइल लेता ही नहीं। जो औज़ार किसी असली तस्वीर पर फ़ैसला देने का दावा करे, वह झूठ बोलेगा।
- वह किसी असली तस्वीर बनाने वाले की नकल नहीं करता। ऊपर-नमूना करना उसके कामों में से एक है, सब नहीं, और नए ढाँचे इस हस्ताक्षर को जान-बूझकर हलका कर देते हैं।
शोध ने क्या नापा है
तीन प्रकाशित नतीजे इस डेमो को घेरते हैं, और एक चौथा उसकी सीमा बताता है।
जनरेटिव नेटवर्कों से बनी तस्वीरों में ऐसे व्यवस्थित निशान होते हैं जो आवृत्तियों के दायरे में दिखते हैं, और जिनकी वजह इन ढाँचों में आम तौर पर मौजूद ऊपर-नमूना करने के काम हैं। प्रतिद्वंद्वी नेटवर्कों का ऊपर-नमूना करने वाला हिस्सा एक खास और दोहराया जा सकने वाला स्पेक्ट्रल निशान छोड़ जाता है, जिसे उस तय मॉडल को प्रशिक्षण में देखे बिना भी काम में लाया जा सकता है। ये काम वही बात कहते हैं जो ऊपर की नाप कहती है: औज़ार अपने गुज़रने पर दस्तख़त कर देता है।
सीमा भी प्रकाशित है, और वह साफ़ है। एक सहकर्मी-समीक्षित काम स्थापित करता है कि पिक्सल के स्तर पर अदृश्य वॉटरमार्क एक दोबारा-बनाने वाले हमले से हटाए जा सकते हैं, जो शोर जोड़कर तस्वीर फिर से खड़ी कर देता है, और यह कि हमलों का यह परिवार दिखने वाली गुणवत्ता बचा लेता है। उसके लेखक यह नतीजा निकालते हैं कि अदृश्य वॉटरमार्क से हटकर ऐसे निशानों पर जाना पड़ेगा जो तस्वीर के अर्थ को बचाए रखें। इस पन्ने का शोर वाला स्लाइडर तीन सेकंड में जो करता है, वह इसी हमले का सबसे सादा रूप है।
एक आखिरी तथ्य इंसानी आँख पर बहस बंद कर देता है: दर्शक बनाए गए चेहरे को असली चेहरे से भरोसेमंद ढंग से अलग नहीं कर पाते, और औसतन बनाए गए चेहरों को ज़्यादा भरोसे लायक तक मानते हैं। इसलिए अपने आभास पर टिकना पीछे हटने का कोई तरीका नहीं है।
याद रखने लायक आदत
जिस तस्वीर का मूल मायने रखता हो, उसके सामने निशान तस्वीर में न ढूँढ़िए। स्रोत ढूँढ़िए: उसे पहले किसने प्रकाशित किया, किस तारीख को, और उद्गम का मेटाडेटा, जब मौजूद हो, क्या कहता है। यह रास्ता अध्याय वॉटरमार्क में लिया गया है। कोई तकनीकी इशारा किसी शक को दर्ज करने के काम आता है, अकेले नतीजा निकालने के काम कभी नहीं।
आगे पढ़ने के लिए
किसी ध्वनि-संकेत पर वही काम अध्याय बनाई गई आवाज़ में है। किसी सामग्री पर निशान लगाने के दोनों तरीके अध्याय वॉटरमार्क में हैं। जिन हालात में यह औज़ार बंद हो जाता है, वे कब इस्तेमाल न करें में एक जगह हैं। साइट के सारे डेमो डेमो वाले पन्ने पर एक जगह हैं, और कोर्स की सूची समझें वाले पन्ने पर है।
स्रोत
- Leveraging Frequency Analysis for Deep Fake Image Recognition Joel Frank, Thorsten Eisenhofer, Lea Schönherr, Asja Fischer, Dorothea Kolossa, Thorsten Holz, 2020। स्थापित करता है कि जनरेटिव नेटवर्कों से बनी तस्वीरों में ऐसे व्यवस्थित निशान होते हैं जो आवृत्तियों के दायरे में दिखते हैं, और जिनकी वजह इन ढाँचों में आम तौर पर मौजूद ऊपर-नमूना करने के काम हैं।
- Detecting and Simulating Artifacts in GAN Fake Images Xu Zhang, Svebor Karaman, Shih-Fu Chang, 2019। स्थापित करता है कि प्रतिद्वंद्वी नेटवर्कों में इस्तेमाल होने वाला ऊपर-नमूना करने वाला हिस्सा एक खास और दोहराया जा सकने वाला स्पेक्ट्रल निशान छोड़ जाता है, जिससे बनी हुई तस्वीर उस तय मॉडल को प्रशिक्षण में देखे बिना भी पकड़ी जा सकती है।
- Invisible Image Watermarks Are Provably Removable Using Generative AI Xuandong Zhao, Kexun Zhang, Zihao Su, Saastha Vasan, Ilya Grishchenko, Christopher Kruegel, Giovanni Vigna, Yu-Xiang Wang, Lei Li, NeurIPS 2024। स्थापित करता है कि एक दोबारा-बनाने वाला हमला, जो किसी तस्वीर में शोर जोड़कर उसे फिर से खड़ा करता है, पिक्सल के स्तर पर अदृश्य वॉटरमार्क हटा देता है और दिखने वाली गुणवत्ता बचा लेता है, और यह भी कि लेखक इसीलिए ऐसे निशानों पर जाने की सलाह देते हैं जो तस्वीर के अर्थ को बचाए रखें।
- AI-synthesized faces are indistinguishable from real faces and more trustworthy Sophie J. Nightingale, Hany Farid, 2022। स्थापित करता है कि इंसानी दर्शक बनाए गए चेहरे को असली चेहरे से भरोसेमंद ढंग से अलग नहीं कर पाते, और औसतन बनाए गए चेहरों को ज़्यादा भरोसे लायक तक मानते हैं।