बनाई गई आवाज़
कोई आवाज़ हार्मोनिक एक पर एक रखकर बनाई जाती है, और फिर उन्हें किसी स्वर-नली की तरह गुँजाकर। यह डेमो एक ही ध्वनि दो बार बनाता है, एक बार मोटे तौर पर और एक बार सँवारकर, और आपको यह तुलना करने देता है कि क्या सुनाई देता है और क्या उसके तराशे पर दिखता है।
सब कुछ आपके ब्राउज़र में हिसाब होता है। दोनों ध्वनियाँ इसी डिवाइस पर बनाई जाती हैं, उनका स्पेक्ट्रम यहीं निकाला जाता है, और कोई ध्वनि किसी सर्वर को न भेजी जाती है न उससे ली जाती है। अपने ब्राउज़र का Network टैब खोलिए और डेमो चलाइए: कोई रिक्वेस्ट बाहर नहीं जाती। दोनों “सुनिए” बटन एक ध्वनि बजाते हैं: सुनना हो तो आवाज़ बढ़ा लीजिए, या सीधे तराशे पढ़ लीजिए, जिन पर ऐसे कैप्शन हैं कि वे ध्वनि के बिना भी पढ़े जा सकें।
एक ही ध्वनि, दो बार बनाई गई
इस पन्ने की दोनों ध्वनियाँ एक ही शुरुआती बिंदु से चलती हैं: वही ऊँचाई, वही सीड, वही एक सेकंड की अवधि। एक कच्ची छोड़ दी जाती है, दूसरी पर एक अतिरिक्त काम होता है, जिसका ब्यौरा नीचे “तरीका” वाले हिस्से में है। इसके सिवा उनमें कोई फ़र्क़ नहीं है।
बनाना शुरू कीजिए। दोनों ध्वनियाँ, उनके दोनों स्पेक्ट्रोग्राम और हार्मोनिक तथा पृष्ठभूमि के बीच नापा गया फ़र्क़ यहाँ दिखेंगे, हर एक के लिए एक “सुनिए” बटन के साथ।
डेमो क्या दिखाता है
हार्मोनिक की एक कतार, नंगी या सँवारी हुई
दोनों ध्वनियाँ एक ही काम से चलती हैं: एक ही ऊँचाई, एक ही सीड, एक ही अवधि पर सधी हार्मोनिक की एक श्रेणी। कच्चा रूप वहीं रुक जाता है। सँवारा रूप दो काम और करता है: वह हर हार्मोनिक की मात्रा को तीन तय अनुनादों से गढ़ता है, जो किसी स्वर को उसका रंग देते हैं, और वह एक आवर्तन से दूसरे तक ऊँचाई और मात्रा में एक सूक्ष्म उतार-चढ़ाव जोड़ता है, साथ में हलके स्तर की एक फूँक। इसके सिवा उनमें कुछ भी फ़र्क़ नहीं है।
तराशे पर फ़र्क़ सुनाई देने से पहले दिख जाता है: कच्चा रूप महीन और बिलकुल साफ़ पट्टियाँ दिखाता है, जिनके बीच लगभग कोई ऊर्जा नहीं। सँवारा रूप चौड़ी पट्टियाँ दिखाता है, जो तीनों अनुनादों पर जमा हैं, और हार्मोनिक के बीच हलकी धूसर पृष्ठभूमि के साथ: वही फूँक है।
एक फ़र्क़ जो लगभग कुछ भी न होने पर मिट जाता है
यह फ़र्क़, यानी हार्मोनिक के स्तर और उनके बीच की पृष्ठभूमि के स्तर का अंतर, ध्वनि के बीच से लिए गए चौंसठ मिलीसेकंड के एक ही टुकड़े पर डेसिबल में नापा जाता है। डिफ़ॉल्ट ऊँचाई, यानी एक सौ तीस हर्ट्ज़ पर दर्ज किए गए मान ये हैं।
| जोड़ा गया लाइन का शोर | कच्चा रूप | सँवारा रूप |
|---|---|---|
| कोई नहीं | 49.7 | 11.7 |
| 1% | 30.3 | 11.5 |
| 2% | 24.6 | 11.3 |
| 5% | 17.1 | 10.6 |
| 10% | 11.8 | 9.8 |
| 20% | 8.4 | 8.4 |
बिना कोई शोर जोड़े, कच्चे रूप का फ़र्क़ सँवारे रूप के फ़र्क़ से लगभग चार गुना बड़ा है: हार्मोनिक की एक नंगी कतार, बिना फूँक और बिना अनियमितता, किसी भी असली आवाज़ से ज़्यादा साफ़ होती है। ज़रा भी लाइन का शोर जोड़िए, और यह अतिरिक्त सफ़ाई ढह जाती है: दस प्रतिशत पर कच्चे रूप का फ़र्क़ पहले ही चार गुना से ज़्यादा घट चुका है। बीस प्रतिशत पर दोनों फ़र्क़ बिलकुल बराबर हो जाते हैं: नाप अब कच्चे रूप को सँवारे रूप से अलग नहीं कर पाती।
जो चीज़ किसी ध्वनि को सच होने के लिए बहुत साफ़ बना देती है, ठीक वही एक आम फ़ोन लाइन सबसे पहले मिटा देती है।
तरीका
हर रूप क्या हिसाब लगाता है, उनके लिए जो इसे इस पन्ने के बिना दोहराना चाहते हैं।
- चुनी हुई ऊँचाई पर सधी हार्मोनिक की एक कतार बनाइए: हर पूर्ण क्रम के लिए, उस क्रम गुणा मूल आवृत्ति पर एक साइन, जिसकी मात्रा एक बटा उस क्रम हो। यह एक सरल किए गए कंठ-स्रोत का रूप है, जो दोनों रूपों में समान है।
- कच्चा रूप: वहीं रुक जाइए। दोनों किनारों पर मात्रा का एक बहुत छोटा लिफ़ाफ़ा सिर्फ़ शुरू और आखिर की खटक से बचाता है: इसके सिवा कुछ नहीं जोड़ा जाता।
- सँवारा रूप: हर हार्मोनिक की मात्रा को तीन तय अनुनादों से गढ़िए, जो चुने गए स्वर के लिए आम हैं, किसी असली व्यक्ति पर नापे हुए नहीं। एक आवर्तन से दूसरे तक ऊँचाई और मात्रा को एक छोटे अंश से बदलिए, जो सीड से निकाला जाता है। एक फूँक मिलाइए: हलके स्तर का एक शोर, जो उसी सीड से निकाला जाता है।
- दोनों ध्वनियों को एक ही शिखर-मात्रा पर लाइए, ताकि तुलना कभी आवाज़ के मामूली फ़र्क़ पर न टिके।
- अगर सेटिंग यह माँगे, तो बाद में दोनों ध्वनियों में वही लाइन का शोर जोड़िए: कोई आम प्रसारण यह किसी भी हाल में जोड़ देता है, चाहे कुछ बनाया गया हो या नहीं।
- नापिए: ध्वनि के बीच से 1024 नमूनों का एक टुकड़ा लीजिए, फ़ूरिए रूपांतरण से उसका स्पेक्ट्रम निकालिए, हर हार्मोनिक का स्तर दर्ज कीजिए, उनके बीच का औसत स्तर दर्ज कीजिए, और घटा दीजिए।
डेमो में ऊँचाई या स्वर बदलिए, और अनुनाद उनके साथ जगह बदल लेते हैं: नाप ध्वनि के पीछे चलती है, वह पहले से लिखा कोई आंकड़ा कभी नहीं उतारती।
यह डेमो क्या नहीं करता
- वह दिखाता है कि बोली की कोई ध्वनि दो मंज़िलों में बनती है: एक स्रोत जो काँपता है, एक नली जो गूँजती है, और दूसरी मंज़िल वह सब बदल देती है जो किसी ध्वनि को जीवित बनाता है।
- वह हार्मोनिक और स्पेक्ट्रम की पृष्ठभूमि के बीच एक नापा जा सकने वाला फ़र्क़ दिखाता है, जो दोनों रूपों में मौजूद है।
- वह दिखाता है कि लाइन के किस शोर से आगे यह फ़र्क़ दोनों रूपों को अलग करना बंद कर देता है।
- वह कुछ नहीं पकड़ता। यह पन्ना दोनों ध्वनियाँ खुद बनाता है: वह जानता है कि कौन सी कौन है, वह अंदाज़ा नहीं लगाता।
- वह आपकी लाई हुई किसी रिकॉर्डिंग को नहीं आँकता, और वह कोई फ़ाइल लेता ही नहीं। जो औज़ार किसी असली आवाज़ पर फ़ैसला देने का दावा करे, वह झूठ बोलेगा।
- वह आवाज़ की नकल करने वाले किसी असली सिस्टम की नकल नहीं करता। वे अपनी सेटिंग किसी असली व्यक्ति की रिकॉर्डिंग से सीखते हैं, जबकि यहाँ तीनों अनुनाद हाथ से रखे गए हैं, एक बनाई हुई ध्वनि पर।
शोध ने क्या नापा है
तीन प्रकाशित नतीजे उस बात की जगह तय करते हैं जो यह पन्ना एक मिनट में महसूस करा देता है।
किसी आवाज़ की नकल के लिए आज बहुत कम सामग्री चाहिए: एक शोध-कार्य एक सिस्टम का ब्यौरा देता है, जिसका नाम VALL-E है, और जो ऐसे व्यक्ति की सिर्फ़ तीन सेकंड की रिकॉर्डिंग से, जिसे उसने कभी सुना ही नहीं, ऊँची गुणवत्ता मानी गई निजी बोली बना सकता है। तीन सेकंड, यानी अपना ही नाम कहने से कम वक़्त।
जो इशारे बचते हैं, वे बनाए गए ऑडियो में पहचाने जा सकने वाले संकेत-प्रसंस्करण के निशानों पर टिके हैं, और उनकी पहचान पर हो रहा शोध अपने संदर्भ-डेटासेट बनाने के लिए ठीक इसी तरह के निशान का सहारा लेता है। पर उन्हें पकड़ने का ज़िम्मा उठाने वाले सिस्टमों में असली ध्वनि-हालात के सामने अब भी मज़बूती की कमी है, और वे ऐसे बनाने के तरीकों तक अच्छी तरह नहीं पहुँच पाते जो उन्होंने प्रशिक्षण में देखे ही नहीं।
इनमें से कोई स्रोत किसी नई नकल की गई आवाज़ के सामने इंसानी कान को सीधे नहीं नापता: इसलिए यह ऐसा दावा नहीं है जो यह पन्ना उनकी जगह कर सके। वे जो कहने देते हैं, वह इससे कम है और उतना ही काम का है: बनाई गई आवाज़ पकड़ने के लिए खास तौर पर सधाया गया सिस्टम भी किसी नए तरीके तक पहुँचने में पहले ही मुश्किल में पड़ जाता है, और स्पेक्ट्रम की अतिरिक्त सफ़ाई, जब मौजूद हो, ठीक उस तरह का निशान है जिसे लाइन का आम शोर किसी के, इंसान या डिटेक्टर के, काम आने से पहले ही मिटा देता है।
एक पहचानी हुई आवाज़, फ़ोन पर
जनवरी 2024 में एक अमेरिकी सरकारी प्राधिकरण, Federal Communications Commission ने ठगी का एक असली अभियान दर्ज किया और उस पर कानूनी कार्रवाई की: New Hampshire में राज्य की राष्ट्रपति-पद की प्राइमरी से पहले फैलाया गया एक अपने आप चलने वाला फ़ोन कॉल, जिसमें राष्ट्रपति Joe Biden की नकल करती AI से बनी आवाज़ थी, और जो मतदाताओं से कह रही थी कि वे घर पर ही रहें और इस प्राइमरी को छोड़कर “अपना वोट बचा रखें”। ध्वनि में कुछ भी किसी को उसकी बनावट की चेतावनी नहीं दे रहा था।
कोई फ़ोन कॉल ध्वनि को पहले से संपीड़ित करता है, उसमें लाइन का शोर जोड़ता है, और कान के लिए आवृत्तियों की एक तंग पट्टी ही छोड़ता है। यह ठीक वही मेल है जो इस पन्ने ने अभी अपने लाइन-शोर की सेटिंग से बनाया: जिन हालात में किसी इशारे के गायब होने की सबसे ज़्यादा गुंजाइश है, वे किसी आम फ़ोन कॉल के हालात हैं, किसी रिकॉर्डिंग स्टूडियो के नहीं।
याद रखने लायक आदत
किसी पहचानी हुई आवाज़ के सामने, जो फ़ोन पर कुछ ज़रूरी माँगती है, कोई भुगतान, कोई कोड, कोई पता, आवाज़ को आँकने की कोशिश न कीजिए: यह पन्ना अभी दिखा चुका है कि वह कितना कम भरोसेमंद है। फ़ोन काटिए, और खुद उस नंबर पर वापस कॉल कीजिए जो आपके पास पहले से है, उस पर नहीं जिससे अभी कॉल आया। अगर बात तुरंत आगे बढ़ानी ही हो, तो ऐसा सवाल पूछिए जिसका जवाब कहीं सार्वजनिक रूप से लिखा न हो। कोई परिवार या कोई टीम पहले से एक शब्द भी तय कर सकती है जो सिर्फ़ असली व्यक्ति जानता हो, उन हालात के लिए जहाँ जल्दबाज़ी बाकी सब कुछ जाँचना मुश्किल कर देती है। इस आदत की कोई कीमत नहीं: ऊपर दर्ज ठगी ने, इसके उलट, अपने कान पर भरोसा करने वालों को महँगी पड़ी।
आगे पढ़ने के लिए
किसी तस्वीर पर वही काम अध्याय बनाई गई तस्वीर में है। किसी सामग्री पर स्रोत में ही निशान लगाने के दोनों तरीके अध्याय वॉटरमार्क में हैं। जिन हालात में यह औज़ार बंद हो जाता है, वे कब इस्तेमाल न करें में एक जगह हैं। साइट के सारे डेमो डेमो वाले पन्ने पर एक जगह हैं, और कोर्स की सूची समझें वाले पन्ने पर है।
स्रोत
- WaveFake: A Data Set to Facilitate Audio Deepfake Detection Joel Frank, Lea Schönherr, 2021। स्थापित करता है कि बनाई गई आवाज़ की पहचान पर हो रहा शोध बनाए गए ऑडियो में पहचाने जा सकने वाले संकेत-प्रसंस्करण के निशानों पर टिका है, और उन्हें पढ़ने के लिए एक संदर्भ-डेटासेट देता है।
- ASVspoof 2021: Towards Spoofed and Deepfake Speech Detection in the Wild Xuechen Liu, Xin Wang, Md Sahidullah, Jose Patino, Hector Delgado, Tomi Kinnunen, Massimiliano Todisco, Junichi Yamagishi, Nicholas Evans, Andreas Nautsch, Kong Aik Lee, 2021। स्थापित करता है कि बनाई गई बोली पकड़ने वाले सिस्टमों में असली ध्वनि-वातावरण के सामने अब भी मज़बूती की कमी है, और वे ऐसे बनाने के तरीकों तक अच्छी तरह नहीं पहुँच पाते जो उन्होंने प्रशिक्षण में देखे ही नहीं।
- FCC Makes AI-Generated Voices in Robocalls Illegal (अपनाया गया वक्तव्य: FCC 24-17) Federal Communications Commission (FCC), 2024। स्थापित करता है कि एक अमेरिकी सरकारी प्राधिकरण ने ठगी का एक असली अभियान दर्ज किया और उस पर कानूनी कार्रवाई की, जिसमें चुनाव से पहले मतदाताओं के पास किसी राजनेता की नकल करती AI से बनी आवाज़ भेजी गई थी।
- Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers Chengyi Wang, Sanyuan Chen, Yu Wu, Ziqiang Zhang, Long Zhou, Shujie Liu, Zhuo Chen, Yanqing Liu, Huaming Wang, Jinyu Li, Lei He, Sheng Zhao, Furu Wei, 2023। स्थापित करता है कि VALL-E सिस्टम ऐसे व्यक्ति की सिर्फ़ तीन सेकंड की रिकॉर्डिंग से, जिसे उसने कभी सुना ही नहीं, ऊँची गुणवत्ता मानी गई निजी बोली बना देता है।