यह ODERSA की एक आधिकारिक वेबसाइट है। यह कैसे जानें

आधिकारिक डोमेन

इस साइट का पता odersa.org पर खत्म होता है। संस्था की हर सेवा odersa.org के किसी उपडोमेन पर ही होती है, और कहीं नहीं। अगर आपके ब्राउज़र की पता-पट्टी में दिख रहा पता odersa.org पर खत्म नहीं होता, तो यह साइट हमारी नहीं है।

मुफ़्त, और बिना खाते

सब कुछ पहले पल से खुला है: कोई रजिस्ट्रेशन नहीं, कोई खाता नहीं, कोई पासवर्ड नहीं, कोई सब्सक्रिप्शन नहीं, कोई विज्ञापन नहीं। पैसे देने वालों के लिए अलग से कुछ नहीं रखा गया, क्योंकि यहाँ कुछ भी पैसे से नहीं मिलता।

कोई डेटा इकट्ठा नहीं

यह साइट आपका पीछा नहीं करती: न कोई ट्रैकर, न कोई ट्रैकिंग कुकी, न इन पन्नों में जड़ा कोई मापने वाला औज़ार, और न आपके उपकरण पर कुछ मापा जाता है। हमारा होस्ट अनुरोधों की गिनती कुल जोड़ के रूप में रखता है, जैसा जवाब देने वाला हर सर्वर रखता है: एक कुल योग, कभी कोई प्रोफ़ाइल नहीं। हमारी बात मान लेने की ज़रूरत नहीं: अपने ब्राउज़र के डेवलपर टूल खोलिए, Network टैब में जाइए, और पन्ना दोबारा लोड कीजिए। साइट जो कुछ माँगती है, उसकी पूरी सूची आपके सामने आ जाएगी। सब कुछ odersa.org से आता है, कुछ भी कहीं और नहीं जाता।

खुला कंटेंट

कंटेंट CC BY 4.0 लाइसेंस के तहत प्रकाशित है। आप इसे कॉपी कर सकते हैं, अनुवाद कर सकते हैं, छाप सकते हैं और आगे बाँट सकते हैं, अपनी कक्षा के लिए भी और अपने घर-परिवार के लिए भी। बस एक शर्त: ODERSA का नाम दें।

वह क्यों गढ़ लेता है, पूरे आत्मविश्वास के साथ

कोई मॉडल यह नहीं जानता कि उसे नहीं पता। वह किसी भी शुरुआती टुकड़े के लिए एक संभावित आगे की कड़ी निकाल देता है, चाहे उसने वह सामग्री पढ़ी हो या न पढ़ी हो, और उसके जवाब देने के ढंग में कुछ भी इन दो हालात को अलग नहीं करता। यह पन्ना पिछले अध्याय के मॉडल से एक बार वह पूछता है जो वह जानता है, एक बार वह जो उसने कभी नहीं देखा, और साथ में दिखा देता है कि वह असल में क्या जानता है।

अनुमान लगाने वाली मशीन के लिए “गढ़ना” का मतलब क्या है

कोई भाषा मॉडल जवाब देने के लिए तथ्यों का कोई डेटाबेस नहीं देखता। वह अगले शब्द पर एक संभावना-वितरण निकालता है, जैसा अध्याय अगला शब्द दिखाता है, और फिर उसमें दाँव लगाता है। यह हिसाब अपनी प्रकृति कभी नहीं बदलता, चाहे विषय उसके कॉर्पस में भरपूर दर्ज हो या पूरी तरह गैर-हाज़िर: यह वही फ़ॉर्मूला है, अलग-अलग गिनतियों पर लगा हुआ।

इसलिए “गढ़ना” किसी खराबी का नाम नहीं है। यह वही है जो मॉडल हर शब्द पर करता है, चाहे उसके पास सामग्री हो या न हो। जब वह नहीं होती, तो वितरण छोटे संदर्भ पर टिक जाता है, फिर उससे भी छोटे पर, और ज़रूरत पड़े तो पूरे कॉर्पस पर: वह हमेशा मौजूद रहता है, वह हमेशा एक शब्द बना देता है, और उसे बनाने के ढंग में कुछ भी नहीं बदलता। शोध इस परिघटना को जो नाम देता है, वह है गढ़ा हुआ जवाब: एक बहती और व्याकरण की दृष्टि से सही सामग्री, जिसका किसी जाँचे जा सकने वाले तथ्य से नाता होने की कोई गारंटी नहीं।

उसी मॉडल से वह पूछना जो उसके पास नहीं है

इस पन्ने का मॉडल वही है जो अध्याय अगला शब्द का है: एक n-ग्राम मॉडल, जो Jules Verne के 1873 में प्रकाशित Le Tour du monde en quatre-vingts jours (“अस्सी दिन में दुनिया की सैर”) पर सीखा है। इस उपन्यास में … शब्द और विराम-चिह्न हैं, और उनकी शब्दावली … अलग-अलग शब्दों की है। 1873 का कोई टेक्स्ट उस बारे में कुछ नहीं जान सकता जो तब तक मौजूद ही नहीं था, न उस बारे में जो उसमें बस नहीं है: इसी से पूरे यक़ीन के साथ जाना जा सकता है कि मॉडल ने क्या कभी नहीं पढ़ा।

एक से तीन शब्दों का ऐसा शुरुआती टुकड़ा डालिए जो उपन्यास में असल में मौजूद है, या कोई उदाहरण चुनिए। फिर ऐसा शुरुआती टुकड़ा डालिए जो उसमें पक्का नहीं है। मॉडल दोनों हालात में जवाब देता है, एक ही तरह से। उसके जवाब के साथ एक ऐसी नाप जो कोई आम प्रोडक्ट कभी नहीं दिखाता: यह गिनती कि यह ठीक यही शुरुआती टुकड़ा पूरे कॉर्पस में कितनी बार आता है, और शून्य अगर वह वहाँ कभी आया ही नहीं।

जानकारी

सब कुछ आपके ब्राउज़र में हिसाब होता है। कॉर्पस पन्ने के साथ लोड होता है, मॉडल इसी डिवाइस पर उस पर सीखता है, और आप जो कुछ डालते हैं, वह आपकी मशीन से बाहर नहीं जाता। अपने ब्राउज़र का Network टैब खोलिए और डेमो चलाइए: कोई रिक्वेस्ट बाहर नहीं जाती।

दो शुरुआती टुकड़े जो असल में उपन्यास में हैं, दो जो उसमें पक्का नहीं हैं। कोई उदाहरण चुनने से नीचे का खाना भर जाता है और पूछताछ शुरू हो जाती है।
एक से तीन शब्द। अपनी पसंद का कोई टुकड़ा डालने से कुछ नहीं रोकता, चाहे वह उपन्यास में हो या न हो।
30 शब्द
शुरुआती टुकड़े के बाद मॉडल कितने शब्द बनाता है।
एक शब्द या एक संख्या। एक ही सीड हमेशा एक ही नतीजा देता है, और यही इस पन्ने को कक्षा में हवाला देने लायक बनाता है।

कोई उदाहरण चुनिए, या कोई शुरुआती टुकड़ा डालिए, फिर पूछताछ शुरू कीजिए। बनाया गया जवाब और यह कि मॉडल असल में क्या जानता है, यहाँ दिखेंगे।

डेमो क्या दिखाता है

एक ही आवाज़, चाहे सामग्री हो या न हो

“Phileas Fogg avait” आज़माइए, यानी वह शुरुआती टुकड़ा जो उपन्यास में असल में है, फिर “Phileas Fogg alluma son smartphone”, जो उसमें ज़ाहिर है नहीं है। दोनों आगे की कड़ियाँ एक जैसी सुनाई देती हैं: वही लंबाई, वही व्याकरण, वही भरोसे से भरा लहजा। इनमें से कोई भी पहले नहीं बताती कि वह क्या जानती है और क्या नहीं।

पीछे लौटना चुपचाप होता है: उसे कोई गुज़रते हुए नहीं देखता

जब माँगे गए शब्दों में से एक भी देखा हुआ न हो, तो मॉडल रुकता नहीं: वह पूरे उपन्यास के सबसे बार-बार आने वाले शब्द पर लौट आता है, और बने हुए टेक्स्ट में इसकी कोई सूचना कहीं नहीं देता। एक ही सीड पर दो बिलकुल असंबंधित शुरुआती टुकड़े आज़माइए जो दोनों इसी हाल में गिरते हैं: आपको वही टेक्स्ट मिलेगा, शब्द दर शब्द। तब जवाब उस बात से नहीं आता जो आपने पूछी, बल्कि उससे आता है जो कॉर्पस में सबसे ज़्यादा बार है।

तरीका

“मॉडल से पूछिए” बटन क्या करता है, क्रम में। उसे हाथ से, उपन्यास खोलकर और एक पेंसिल से दोहराया जा सकता है।

  1. शुरुआती टुकड़े को बाँटिए। डाला गया टेक्स्ट शब्दों और विराम-चिह्नों की एक कतार बन जाता है, जैसा अध्याय अगला शब्द में।
  2. सबसे लंबा जाना-पहचाना संदर्भ ढूँढ़िए। मॉडल देखता है कि शुरुआती टुकड़े के आखिरी तीन शब्दों के बाद उपन्यास में कहीं कोई शब्द पहले आया है या नहीं। न मिले तो वह दो शब्दों से ढूँढ़ता है। न मिले तो एक से। न मिले तो वह पूरे उपन्यास पर लौट आता है: यह तालिका हमेशा मौजूद रहती है, और जब तक कॉर्पस खाली नहीं, वह खाली नहीं हो सकती।
  3. गिनिए। जो तालिका रखी गई, उसका स्तर कोई भी हो, उसमें वह हर शब्द दर्ज कीजिए जो बाद में आया और कितनी बार। यह कदम एक जैसा रहता है, चाहे रखा गया संदर्भ माँगा हुआ हो या पीछे लौटकर लिया गया।
  4. दाँव लगाइए, फिर दोहराइए। इन गिनतियों में एक शब्द निकाला जाता है, कतार में जोड़ा जाता है, और अगले शब्द के लिए दूसरा कदम फिर शुरू होता है। यही बना हुआ टेक्स्ट बनाता है, शुरू का सवाल जो भी रहा हो।
  5. ठीक उस शुरुआती टुकड़े को, अलग से गिनिए। यह जवाब देने के काम नहीं आता: यह एक अलग नाप है, जो गिनती है कि माँगी गई शब्दों की कतार, जैसी है वैसी, पूरे उपन्यास में कितनी बार देखी गई। कोई असली मॉडल यह संख्या कभी नहीं दिखाता। यह पन्ना दिखाता है।

पाँचवाँ कदम वही है जो किसी आम प्रोडक्ट में नहीं होता। तकनीकी रूप से उसे होने से कुछ नहीं रोकता: वह बस उसमें नहीं है जो इंटरफ़ेस दिखाता है।

बहाव सच्चाई का संकेत क्यों नहीं है

किसी जवाब का बहाव, उसका सही व्याकरण, उसका भरोसे से भरा लहजा, सब उसी हिसाब से आते हैं जिससे शब्द खुद आता है। ऐसा कोई अलग कदम मौजूद नहीं जो लिखने से पहले सामग्री जाँच ले। एक सच्चा वाक्य और एक गढ़ा हुआ वाक्य ठीक उसी मशीनरी से गुज़रते हैं, और उस मशीनरी में कुछ भी पहले वाले का पक्ष नहीं लेता।

यह कोई अलग-थलग खामी नहीं है: यह इस बात का नतीजा है कि मॉडल को कैसे प्रशिक्षित, और फिर कैसे आँका जाता है। प्रशिक्षण उस कड़ी को इनाम देता है जो टेक्स्ट में मौजूद चीज़ जैसी लगती है; इस हिसाब में “मुझे नहीं पता” वाला कोई खाना नहीं है जो किसी सही जवाब जितना कमा दे।

उसके बाद आने वाला मूल्यांकन इस दिक्कत को सुधारने के बजाय बढ़ा देता है। ज़्यादातर परीक्षण सिर्फ़ यह देखते हैं कि जवाब सही है या गलत: एक गलत जवाब और चुप रह जाना, दोनों को एक ही नंबर मिलता है, शून्य। तब अंदाज़ा लगाना ही सबसे अच्छी रणनीति बन जाता है, ठीक जैसे बहुविकल्पीय परीक्षा में किसी परीक्षार्थी का फ़ायदा किसी खाने को खाली छोड़ने के बजाय अंदाज़े से भर देने में है, क्योंकि खाली खाना कभी कोई नंबर नहीं देता और अंदाज़े से भरा खाना एक दे सकता है। इस तरह के नंबर के लिए सधाया गया मॉडल वही रणनीति सीख लेता है: अंदाज़ा लगाना कमाता है, चुप रहना कभी नहीं कमाता।

इस मशीनरी में कुछ भी मॉडल को इस बात के लिए नहीं धकेलता कि वह जाने-पहचाने शुरुआती टुकड़े को उस टुकड़े से अलग करे जिसे वह ज़रा भी नहीं जानता। दोनों उसी हिसाब से आखिर तक गुज़रते हैं, और कुछ भी इस कड़ी को तोड़कर उस अनुपस्थिति की सूचना नहीं देता।

कोई असली मॉडल क्या जोड़ता है, और क्या नहीं हटाता

यह डेमो एक शर्त पर ईमानदार है: यह बता देना कि तुलना कहाँ रुक जाती है।

जो किसी बड़े मॉडल में भी सच रहता है

  • वह हमेशा जवाब देता है, सामग्री के बिना भी: डिफ़ॉल्ट रूप से कोई चुप्पी कभी नहीं, अपने आप कहा गया कोई “मुझे नहीं पता” कभी नहीं।
  • गढ़े हुए जवाब की तरफ़ पलटना चुपचाप होता है: बनावट, लंबाई, व्याकरण या लहजे में कुछ नहीं बदलता।
  • मॉडल ने जो सीखा है और वह जो जवाब देता है, ये दो अलग चीज़ें हैं: पहली उसके प्रशिक्षण-डेटा में नापी जाती है, दूसरी उसकी सामग्री में पढ़ी जाती है, और कोई आम प्रोडक्ट पहली कभी नहीं दिखाता।

यह खिलौना मॉडल क्या नहीं करता

  • उसके पास जवाब देने से पहले देखा जाने वाला भरोसे का कोई भीतरी संकेत नहीं है: कोई बड़ा मॉडल इस काम के लिए इस्तेमाल हो सकने वाली संभावनाएँ ज़रूर निकालता है, पर वे किसी प्रोडक्ट में कम ही सामने रखी या देखी जाती हैं।
  • वह झूठ नहीं बोलता: झूठ बोलने के लिए किसी सच्चाई को जानना और उसे तोड़-मोड़ देना पड़ता है। यहाँ न कोई जानकारी है, न कोई इरादा, सिर्फ़ एक हिसाब है जो कभी रुकता नहीं।
  • अरबों शब्दों पर सीखे किसी असली मॉडल का पीछे लौटना 1873 के एक उपन्यास पर सीखे मॉडल से कम दिखता है; फिर भी वह उसी नियम पर चलता है: नियमित सामग्री जितनी कम, सामग्री उतनी ही सामान्य और चिकनी होती जाती है, और खुद को वैसा बताती कभी नहीं।

शोध ने क्या नापा है

एक संदर्भ-समीक्षा मौजूद है जो बड़े भाषा मॉडलों में गढ़े हुए जवाबों की वजहों और रूपों को, और शोध के सुझाए पहचान तथा कमी करने के तरीकों को क्रम में रखती है: यह सवाल कई साल से पढ़ा जा रहा है, यह कोई किस्सा-कहानी नहीं है।

एक सैद्धांतिक काम इससे आगे जाता है और सीखने के सिद्धांत के नतीजों के आधार पर दलील देता है कि सामान्य समस्या-समाधक की तरह इस्तेमाल होने वाले भाषा मॉडल के लिए गढ़ने की एक दर गणितीय रूप से अटल होगी। यह नतीजा बहस के घेरे में है: बाद के काम इस पर सवाल उठाते हैं कि उसकी औपचारिक मान्यताएँ मॉडलों के असल और सीमित इस्तेमालों पर लागू होती हैं या नहीं। यह असहमति दिक्कत के होने पर नहीं है, सिर्फ़ उसके ठीक-ठीक फैलाव पर है।

याद रखने लायक आदत

यह अध्याय यह नहीं कहता कि मॉडल जो कुछ लिखता है उस सब पर शक कीजिए: यह कहता है कि किसी जवाब के आत्मविश्वास को उसकी सच्चाई के साथ कभी न मिलाइए। हिसाब की कोई मशीनरी इन दोनों को जोड़ती नहीं: वे मिल भी सकते हैं, और बराबर उतनी ही आसानी से न भी मिलें, और कोई संकेत इसे अलग नहीं करता।

इसलिए जाँच शुरू करने वाली चीज़ जवाब का लहजा कभी नहीं होती। वह उस बात की प्रकृति होती है जो कही जा रही है: कोई तय तारीख, कोई आंकड़ा, कोई हवाला, कोई उद्धरण, कोई विशेष नाम, कोई पता, यानी वह सब जो उसे लिए चलने वाले वाक्य की शैली से अलग सही या गलत हो सकता है। कोई ब्यौरा जितना तय और जाँचने लायक हो, उतना ही वह किसी बाहरी स्रोत का हक़दार है: ठीक वहीं मॉडल का बहाव एक जैसा रहता है, चाहे उसके पास सामग्री हो या वह उसे गढ़ रहा हो।

मॉडल से यह पूछने का कोई फ़ायदा नहीं कि उसे खुद पर भरोसा है या नहीं: इस सवाल का उसका जवाब भी उसी हिसाब से बनता है, सच्चाई की किसी भीतरी नाप तक पहुँच के बिना। काम का सवाल हमेशा यह है: क्या कहीं और, इस बात का कोई स्वतंत्र और जाँचा जा सकने वाला स्रोत मौजूद है? जब जवाब “नहीं” हो, तो वही जवाब है।

आगे पढ़ने के लिए

वितरण और दाँव की मशीनरी अध्याय अगला शब्द में समझाई गई है। उसी हिसाब का एक और नतीजा, यानी कॉर्पस के पूर्वाग्रहों का दोहराया जाना, अध्याय पूर्वाग्रह कहाँ से आते हैं में लिया गया है। जिन हालात में यह औज़ार पूरी तरह बंद हो जाता है, वे कब इस्तेमाल न करें में एक जगह हैं। साइट के सारे डेमो डेमो वाले पन्ने पर एक जगह हैं, और कोर्स की सूची समझें वाले पन्ने पर है।

स्रोत