यह ODERSA की एक आधिकारिक वेबसाइट है। यह कैसे जानें

आधिकारिक डोमेन

इस साइट का पता odersa.org पर खत्म होता है। संस्था की हर सेवा odersa.org के किसी उपडोमेन पर ही होती है, और कहीं नहीं। अगर आपके ब्राउज़र की पता-पट्टी में दिख रहा पता odersa.org पर खत्म नहीं होता, तो यह साइट हमारी नहीं है।

मुफ़्त, और बिना खाते

सब कुछ पहले पल से खुला है: कोई रजिस्ट्रेशन नहीं, कोई खाता नहीं, कोई पासवर्ड नहीं, कोई सब्सक्रिप्शन नहीं, कोई विज्ञापन नहीं। पैसे देने वालों के लिए अलग से कुछ नहीं रखा गया, क्योंकि यहाँ कुछ भी पैसे से नहीं मिलता।

कोई डेटा इकट्ठा नहीं

यह साइट आपका पीछा नहीं करती: न कोई ट्रैकर, न कोई ट्रैकिंग कुकी, न इन पन्नों में जड़ा कोई मापने वाला औज़ार, और न आपके उपकरण पर कुछ मापा जाता है। हमारा होस्ट अनुरोधों की गिनती कुल जोड़ के रूप में रखता है, जैसा जवाब देने वाला हर सर्वर रखता है: एक कुल योग, कभी कोई प्रोफ़ाइल नहीं। हमारी बात मान लेने की ज़रूरत नहीं: अपने ब्राउज़र के डेवलपर टूल खोलिए, Network टैब में जाइए, और पन्ना दोबारा लोड कीजिए। साइट जो कुछ माँगती है, उसकी पूरी सूची आपके सामने आ जाएगी। सब कुछ odersa.org से आता है, कुछ भी कहीं और नहीं जाता।

खुला कंटेंट

कंटेंट CC BY 4.0 लाइसेंस के तहत प्रकाशित है। आप इसे कॉपी कर सकते हैं, अनुवाद कर सकते हैं, छाप सकते हैं और आगे बाँट सकते हैं, अपनी कक्षा के लिए भी और अपने घर-परिवार के लिए भी। बस एक शर्त: ODERSA का नाम दें।

बनाई गई आवाज़

कोई आवाज़ हार्मोनिक एक पर एक रखकर बनाई जाती है, और फिर उन्हें किसी स्वर-नली की तरह गुँजाकर। यह डेमो एक ही ध्वनि दो बार बनाता है, एक बार मोटे तौर पर और एक बार सँवारकर, और आपको यह तुलना करने देता है कि क्या सुनाई देता है और क्या उसके तराशे पर दिखता है।

एक रिकॉर्डिंग स्टूडियो में, ड्रम सेट के चारों तरफ़ स्टैंड पर लगे कई माइक्रोफ़ोन
किसी आवाज़ को रिकॉर्ड करने के लिए एक स्टूडियो चाहिए था। उसकी नकल के लिए आज कुछ सेकंड की ध्वनि काफ़ी है। फ़ोटोग्राफ़: dan paluska, फ़ाइल पृष्ठ, लाइसेंस CC BY 2.0 (लाइसेंस का पाठ).
जानकारी

सब कुछ आपके ब्राउज़र में हिसाब होता है। दोनों ध्वनियाँ इसी डिवाइस पर बनाई जाती हैं, उनका स्पेक्ट्रम यहीं निकाला जाता है, और कोई ध्वनि किसी सर्वर को न भेजी जाती है न उससे ली जाती है। अपने ब्राउज़र का Network टैब खोलिए और डेमो चलाइए: कोई रिक्वेस्ट बाहर नहीं जाती। दोनों “सुनिए” बटन एक ध्वनि बजाते हैं: सुनना हो तो आवाज़ बढ़ा लीजिए, या सीधे तराशे पढ़ लीजिए, जिन पर ऐसे कैप्शन हैं कि वे ध्वनि के बिना भी पढ़े जा सकें।

एक ही ध्वनि, दो बार बनाई गई

इस पन्ने की दोनों ध्वनियाँ एक ही शुरुआती बिंदु से चलती हैं: वही ऊँचाई, वही सीड, वही एक सेकंड की अवधि। एक कच्ची छोड़ दी जाती है, दूसरी पर एक अतिरिक्त काम होता है, जिसका ब्यौरा नीचे “तरीका” वाले हिस्से में है। इसके सिवा उनमें कोई फ़र्क़ नहीं है।

एक शब्द या एक संख्या। यह ऊँचाई की सूक्ष्म उतार-चढ़ाव, फूँक का दाना और लाइन का शोर तय करता है: एक ही सीड ठीक वही ध्वनि और वही तराशा देता है, किसी भी डिवाइस पर।
तीन तय अनुनाद हर स्वर को उसका रंग देते हैं। इस चुनाव के साथ वे बदल जाते हैं।
130 Hz
मूल आवृत्ति, हर्ट्ज़ में। भारी आवाज़ लगभग 90 से शुरू होती है, पतली आवाज़ 240 तक चढ़ जाती है।
0%
दोनों ध्वनियों में बाद में जोड़ा गया, किसी फ़ोन लाइन या किसी संपीड़ित फ़ाइल की नकल करने के लिए। इस पन्ने की सबसे सिखाने वाली सेटिंग।

बनाना शुरू कीजिए। दोनों ध्वनियाँ, उनके दोनों स्पेक्ट्रोग्राम और हार्मोनिक तथा पृष्ठभूमि के बीच नापा गया फ़र्क़ यहाँ दिखेंगे, हर एक के लिए एक “सुनिए” बटन के साथ।

डेमो क्या दिखाता है

हार्मोनिक की एक कतार, नंगी या सँवारी हुई

दोनों ध्वनियाँ एक ही काम से चलती हैं: एक ही ऊँचाई, एक ही सीड, एक ही अवधि पर सधी हार्मोनिक की एक श्रेणी। कच्चा रूप वहीं रुक जाता है। सँवारा रूप दो काम और करता है: वह हर हार्मोनिक की मात्रा को तीन तय अनुनादों से गढ़ता है, जो किसी स्वर को उसका रंग देते हैं, और वह एक आवर्तन से दूसरे तक ऊँचाई और मात्रा में एक सूक्ष्म उतार-चढ़ाव जोड़ता है, साथ में हलके स्तर की एक फूँक। इसके सिवा उनमें कुछ भी फ़र्क़ नहीं है।

तराशे पर फ़र्क़ सुनाई देने से पहले दिख जाता है: कच्चा रूप महीन और बिलकुल साफ़ पट्टियाँ दिखाता है, जिनके बीच लगभग कोई ऊर्जा नहीं। सँवारा रूप चौड़ी पट्टियाँ दिखाता है, जो तीनों अनुनादों पर जमा हैं, और हार्मोनिक के बीच हलकी धूसर पृष्ठभूमि के साथ: वही फूँक है।

एक फ़र्क़ जो लगभग कुछ भी न होने पर मिट जाता है

यह फ़र्क़, यानी हार्मोनिक के स्तर और उनके बीच की पृष्ठभूमि के स्तर का अंतर, ध्वनि के बीच से लिए गए चौंसठ मिलीसेकंड के एक ही टुकड़े पर डेसिबल में नापा जाता है। डिफ़ॉल्ट ऊँचाई, यानी एक सौ तीस हर्ट्ज़ पर दर्ज किए गए मान ये हैं।

हार्मोनिक के स्तर और स्पेक्ट्रम की पृष्ठभूमि के स्तर के बीच नापा गया फ़र्क़, डेसिबल में, बनाने के बाद जोड़े गए लाइन के शोर के हिसाब से। सीड “ODERSA”, ऊँचाई 130 Hz, स्वर [a]।
जोड़ा गया लाइन का शोरकच्चा रूपसँवारा रूप
कोई नहीं49.711.7
1%30.311.5
2%24.611.3
5%17.110.6
10%11.89.8
20%8.48.4

बिना कोई शोर जोड़े, कच्चे रूप का फ़र्क़ सँवारे रूप के फ़र्क़ से लगभग चार गुना बड़ा है: हार्मोनिक की एक नंगी कतार, बिना फूँक और बिना अनियमितता, किसी भी असली आवाज़ से ज़्यादा साफ़ होती है। ज़रा भी लाइन का शोर जोड़िए, और यह अतिरिक्त सफ़ाई ढह जाती है: दस प्रतिशत पर कच्चे रूप का फ़र्क़ पहले ही चार गुना से ज़्यादा घट चुका है। बीस प्रतिशत पर दोनों फ़र्क़ बिलकुल बराबर हो जाते हैं: नाप अब कच्चे रूप को सँवारे रूप से अलग नहीं कर पाती।

जो चीज़ किसी ध्वनि को सच होने के लिए बहुत साफ़ बना देती है, ठीक वही एक आम फ़ोन लाइन सबसे पहले मिटा देती है।

तरीका

हर रूप क्या हिसाब लगाता है, उनके लिए जो इसे इस पन्ने के बिना दोहराना चाहते हैं।

  1. चुनी हुई ऊँचाई पर सधी हार्मोनिक की एक कतार बनाइए: हर पूर्ण क्रम के लिए, उस क्रम गुणा मूल आवृत्ति पर एक साइन, जिसकी मात्रा एक बटा उस क्रम हो। यह एक सरल किए गए कंठ-स्रोत का रूप है, जो दोनों रूपों में समान है।
  2. कच्चा रूप: वहीं रुक जाइए। दोनों किनारों पर मात्रा का एक बहुत छोटा लिफ़ाफ़ा सिर्फ़ शुरू और आखिर की खटक से बचाता है: इसके सिवा कुछ नहीं जोड़ा जाता।
  3. सँवारा रूप: हर हार्मोनिक की मात्रा को तीन तय अनुनादों से गढ़िए, जो चुने गए स्वर के लिए आम हैं, किसी असली व्यक्ति पर नापे हुए नहीं। एक आवर्तन से दूसरे तक ऊँचाई और मात्रा को एक छोटे अंश से बदलिए, जो सीड से निकाला जाता है। एक फूँक मिलाइए: हलके स्तर का एक शोर, जो उसी सीड से निकाला जाता है।
  4. दोनों ध्वनियों को एक ही शिखर-मात्रा पर लाइए, ताकि तुलना कभी आवाज़ के मामूली फ़र्क़ पर न टिके।
  5. अगर सेटिंग यह माँगे, तो बाद में दोनों ध्वनियों में वही लाइन का शोर जोड़िए: कोई आम प्रसारण यह किसी भी हाल में जोड़ देता है, चाहे कुछ बनाया गया हो या नहीं।
  6. नापिए: ध्वनि के बीच से 1024 नमूनों का एक टुकड़ा लीजिए, फ़ूरिए रूपांतरण से उसका स्पेक्ट्रम निकालिए, हर हार्मोनिक का स्तर दर्ज कीजिए, उनके बीच का औसत स्तर दर्ज कीजिए, और घटा दीजिए।

डेमो में ऊँचाई या स्वर बदलिए, और अनुनाद उनके साथ जगह बदल लेते हैं: नाप ध्वनि के पीछे चलती है, वह पहले से लिखा कोई आंकड़ा कभी नहीं उतारती।

यह डेमो क्या नहीं करता

  • वह दिखाता है कि बोली की कोई ध्वनि दो मंज़िलों में बनती है: एक स्रोत जो काँपता है, एक नली जो गूँजती है, और दूसरी मंज़िल वह सब बदल देती है जो किसी ध्वनि को जीवित बनाता है।
  • वह हार्मोनिक और स्पेक्ट्रम की पृष्ठभूमि के बीच एक नापा जा सकने वाला फ़र्क़ दिखाता है, जो दोनों रूपों में मौजूद है।
  • वह दिखाता है कि लाइन के किस शोर से आगे यह फ़र्क़ दोनों रूपों को अलग करना बंद कर देता है।
  • वह कुछ नहीं पकड़ता। यह पन्ना दोनों ध्वनियाँ खुद बनाता है: वह जानता है कि कौन सी कौन है, वह अंदाज़ा नहीं लगाता।
  • वह आपकी लाई हुई किसी रिकॉर्डिंग को नहीं आँकता, और वह कोई फ़ाइल लेता ही नहीं। जो औज़ार किसी असली आवाज़ पर फ़ैसला देने का दावा करे, वह झूठ बोलेगा।
  • वह आवाज़ की नकल करने वाले किसी असली सिस्टम की नकल नहीं करता। वे अपनी सेटिंग किसी असली व्यक्ति की रिकॉर्डिंग से सीखते हैं, जबकि यहाँ तीनों अनुनाद हाथ से रखे गए हैं, एक बनाई हुई ध्वनि पर।

शोध ने क्या नापा है

तीन प्रकाशित नतीजे उस बात की जगह तय करते हैं जो यह पन्ना एक मिनट में महसूस करा देता है।

किसी आवाज़ की नकल के लिए आज बहुत कम सामग्री चाहिए: एक शोध-कार्य एक सिस्टम का ब्यौरा देता है, जिसका नाम VALL-E है, और जो ऐसे व्यक्ति की सिर्फ़ तीन सेकंड की रिकॉर्डिंग से, जिसे उसने कभी सुना ही नहीं, ऊँची गुणवत्ता मानी गई निजी बोली बना सकता है। तीन सेकंड, यानी अपना ही नाम कहने से कम वक़्त।

जो इशारे बचते हैं, वे बनाए गए ऑडियो में पहचाने जा सकने वाले संकेत-प्रसंस्करण के निशानों पर टिके हैं, और उनकी पहचान पर हो रहा शोध अपने संदर्भ-डेटासेट बनाने के लिए ठीक इसी तरह के निशान का सहारा लेता है। पर उन्हें पकड़ने का ज़िम्मा उठाने वाले सिस्टमों में असली ध्वनि-हालात के सामने अब भी मज़बूती की कमी है, और वे ऐसे बनाने के तरीकों तक अच्छी तरह नहीं पहुँच पाते जो उन्होंने प्रशिक्षण में देखे ही नहीं।

इनमें से कोई स्रोत किसी नई नकल की गई आवाज़ के सामने इंसानी कान को सीधे नहीं नापता: इसलिए यह ऐसा दावा नहीं है जो यह पन्ना उनकी जगह कर सके। वे जो कहने देते हैं, वह इससे कम है और उतना ही काम का है: बनाई गई आवाज़ पकड़ने के लिए खास तौर पर सधाया गया सिस्टम भी किसी नए तरीके तक पहुँचने में पहले ही मुश्किल में पड़ जाता है, और स्पेक्ट्रम की अतिरिक्त सफ़ाई, जब मौजूद हो, ठीक उस तरह का निशान है जिसे लाइन का आम शोर किसी के, इंसान या डिटेक्टर के, काम आने से पहले ही मिटा देता है।

एक पहचानी हुई आवाज़, फ़ोन पर

जनवरी 2024 में एक अमेरिकी सरकारी प्राधिकरण, Federal Communications Commission ने ठगी का एक असली अभियान दर्ज किया और उस पर कानूनी कार्रवाई की: New Hampshire में राज्य की राष्ट्रपति-पद की प्राइमरी से पहले फैलाया गया एक अपने आप चलने वाला फ़ोन कॉल, जिसमें राष्ट्रपति Joe Biden की नकल करती AI से बनी आवाज़ थी, और जो मतदाताओं से कह रही थी कि वे घर पर ही रहें और इस प्राइमरी को छोड़कर “अपना वोट बचा रखें”। ध्वनि में कुछ भी किसी को उसकी बनावट की चेतावनी नहीं दे रहा था।

कोई फ़ोन कॉल ध्वनि को पहले से संपीड़ित करता है, उसमें लाइन का शोर जोड़ता है, और कान के लिए आवृत्तियों की एक तंग पट्टी ही छोड़ता है। यह ठीक वही मेल है जो इस पन्ने ने अभी अपने लाइन-शोर की सेटिंग से बनाया: जिन हालात में किसी इशारे के गायब होने की सबसे ज़्यादा गुंजाइश है, वे किसी आम फ़ोन कॉल के हालात हैं, किसी रिकॉर्डिंग स्टूडियो के नहीं।

याद रखने लायक आदत

किसी पहचानी हुई आवाज़ के सामने, जो फ़ोन पर कुछ ज़रूरी माँगती है, कोई भुगतान, कोई कोड, कोई पता, आवाज़ को आँकने की कोशिश न कीजिए: यह पन्ना अभी दिखा चुका है कि वह कितना कम भरोसेमंद है। फ़ोन काटिए, और खुद उस नंबर पर वापस कॉल कीजिए जो आपके पास पहले से है, उस पर नहीं जिससे अभी कॉल आया। अगर बात तुरंत आगे बढ़ानी ही हो, तो ऐसा सवाल पूछिए जिसका जवाब कहीं सार्वजनिक रूप से लिखा न हो। कोई परिवार या कोई टीम पहले से एक शब्द भी तय कर सकती है जो सिर्फ़ असली व्यक्ति जानता हो, उन हालात के लिए जहाँ जल्दबाज़ी बाकी सब कुछ जाँचना मुश्किल कर देती है। इस आदत की कोई कीमत नहीं: ऊपर दर्ज ठगी ने, इसके उलट, अपने कान पर भरोसा करने वालों को महँगी पड़ी।

आगे पढ़ने के लिए

किसी तस्वीर पर वही काम अध्याय बनाई गई तस्वीर में है। किसी सामग्री पर स्रोत में ही निशान लगाने के दोनों तरीके अध्याय वॉटरमार्क में हैं। जिन हालात में यह औज़ार बंद हो जाता है, वे कब इस्तेमाल न करें में एक जगह हैं। साइट के सारे डेमो डेमो वाले पन्ने पर एक जगह हैं, और कोर्स की सूची समझें वाले पन्ने पर है।

स्रोत