यह ODERSA की एक आधिकारिक वेबसाइट है। यह कैसे जानें

आधिकारिक डोमेन

इस साइट का पता odersa.org पर खत्म होता है। संस्था की हर सेवा odersa.org के किसी उपडोमेन पर ही होती है, और कहीं नहीं। अगर आपके ब्राउज़र की पता-पट्टी में दिख रहा पता odersa.org पर खत्म नहीं होता, तो यह साइट हमारी नहीं है।

मुफ़्त, और बिना खाते

सब कुछ पहले पल से खुला है: कोई रजिस्ट्रेशन नहीं, कोई खाता नहीं, कोई पासवर्ड नहीं, कोई सब्सक्रिप्शन नहीं, कोई विज्ञापन नहीं। पैसे देने वालों के लिए अलग से कुछ नहीं रखा गया, क्योंकि यहाँ कुछ भी पैसे से नहीं मिलता।

कोई डेटा इकट्ठा नहीं

यह साइट आपका पीछा नहीं करती: न कोई ट्रैकर, न कोई ट्रैकिंग कुकी, न इन पन्नों में जड़ा कोई मापने वाला औज़ार, और न आपके उपकरण पर कुछ मापा जाता है। हमारा होस्ट अनुरोधों की गिनती कुल जोड़ के रूप में रखता है, जैसा जवाब देने वाला हर सर्वर रखता है: एक कुल योग, कभी कोई प्रोफ़ाइल नहीं। हमारी बात मान लेने की ज़रूरत नहीं: अपने ब्राउज़र के डेवलपर टूल खोलिए, Network टैब में जाइए, और पन्ना दोबारा लोड कीजिए। साइट जो कुछ माँगती है, उसकी पूरी सूची आपके सामने आ जाएगी। सब कुछ odersa.org से आता है, कुछ भी कहीं और नहीं जाता।

खुला कंटेंट

कंटेंट CC BY 4.0 लाइसेंस के तहत प्रकाशित है। आप इसे कॉपी कर सकते हैं, अनुवाद कर सकते हैं, छाप सकते हैं और आगे बाँट सकते हैं, अपनी कक्षा के लिए भी और अपने घर-परिवार के लिए भी। बस एक शर्त: ODERSA का नाम दें।

पूर्वाग्रह कहाँ से आते हैं

किसी मॉडल की कोई राय नहीं होती। वह जो देख चुका है उसे गिनता है, और फिर अपनी गिनतियों में दाँव लगाता है। यह डेमो आपको खुद किसी कॉर्पस की बनावट बिगाड़ने देता है, और आपको मॉडल को ठीक वही बिगाड़ लौटाते हुए दिखाता है जो आपने अभी रखा था।

पेरिस की Sainte-Geneviève लाइब्रेरी का वाचनालय, उसकी लंबी मेज़ें और मेहराब के नीचे उसकी अलमारियाँ
प्रशिक्षण का कॉर्पस टेक्स्ट का एक संग्रह होता है। कोई संग्रह क्या रखता है, और क्या बाहर छोड़ देता है, वह जवाबों में लौट आता है। फ़ोटोग्राफ़: JOHN TOWNER heytowner, फ़ाइल पृष्ठ, लाइसेंस CC0 (लाइसेंस का पाठ).
जानकारी

सब कुछ आपके ब्राउज़र में हिसाब होता है। कॉर्पस इसी डिवाइस पर बनाया जाता है, मॉडल इसी डिवाइस पर उस पर सीखता है, और आप जो कुछ सेट करते हैं, वह आपकी मशीन से बाहर नहीं जाता। अपने ब्राउज़र का Network टैब खोलिए और डेमो चलाइए: कोई रिक्वेस्ट बाहर नहीं जाती।

किसी कॉर्पस को बिगाड़िए, और देखिए मॉडल उसका क्या करता है

इस डेमो का कॉर्पस इसी के लिए लिखा गया है, और शुरुआत में उसकी बनावट संतुलित है। हर स्लाइडर किसी एक पेशे के लिए यह तय करता है कि कितने वाक्यों में कर्ता स्त्रीलिंग में है। पचास पर कॉर्पस दोनों को बराबर कहता है। कोई स्लाइडर खिसकाइए, और आप तय कर देते हैं कि मॉडल ने क्या पढ़ा होगा। कॉर्पस के वाक्य फ़्रेंच में हैं, क्योंकि यह डेमो फ़्रेंच के व्याकरणिक लिंग पर चलता है।

कॉर्पस की बनावट
50%
शून्य पर कोई वाक्य “ingénieure” नहीं कहता। सौ पर कोई वाक्य “ingénieur” नहीं कहता।
50%
वही सेटिंग, एक दूसरे पेशे पर।
50%
वही सेटिंग, एक प्रबंधन वाले पेशे पर।
50%
वही सेटिंग, एक दस्तकारी वाले पेशे पर।

चार और पेशे पचास पर संतुलित रहते हैं और नियंत्रण के तौर पर काम करते हैं: chercheur, enseignant, technicien, avocat। वे हिलते नहीं, और यही फ़र्क़ को पढ़ने लायक बनाता है।

कॉर्पस में मौजूद शहर

कॉर्पस में “Le train part de ville” जैसे वाक्य भी हैं, यानी “ट्रेन शहर से चलती है”। किसी शहर का निशान हटाकर उसे डेटा से पूरी तरह निकाल दीजिए, और देखिए मॉडल अब क्या कह सकता है।

एक शब्द या एक संख्या। एक ही सीड डालने वाले दो लोगों को ठीक वही बना हुआ टेक्स्ट मिलता है, और यही इस डेमो को कक्षा में हवाला देने लायक बनाता है।

बनावट सेट कीजिए, फिर सीखना शुरू कीजिए। मॉडल का वितरण, बनाया गया कॉर्पस और एक बना हुआ टेक्स्ट यहाँ दिखेंगे।

डेमो क्या दिखाता है

नतीजे में कोई हैरानी नहीं है, और ठीक यही समझने वाली बात है। मॉडल जो स्त्रीलिंग का हिस्सा लौटाता है, वही हिस्सा है जो आपने स्लाइडर पर रखा। कोई पास-पास का मान नहीं, कोई रुझान नहीं: वही मान। कोई n-ग्राम मॉडल गिनने के सिवा कुछ नहीं करता, इसलिए उसका नतीजा एक गिनती है।

इससे दो सबक निकलते हैं, और वे एक-दूसरे में मिलते नहीं।

पूर्वाग्रह एक नतीजा है, कोई इरादा नहीं

किसी ने मॉडल में यह नहीं लिखा कि कोई पेशा किसी एक लिंग का है। नियम गिनतियों में उभर आया, क्योंकि वह डेटा में था। इसीलिए किसी मॉडल में इरादा ढूँढ़ना वक़्त की बरबादी है: काम का सवाल हमेशा यह है कि “यह कॉर्पस किस चीज़ से बना है”, और यह सवाल उन लोगों पर आता है जिन्होंने डेटा जुटाया, छाँटा और प्रकाशित किया।

जो गैर-हाज़िर है, वह नामुमकिन है, असंभव-सा नहीं

कॉर्पस से कोई शहर हटा दीजिए, और मॉडल उसे फिर कभी नहीं सुझाता। वह उसे कम बार नहीं सुझाता: वह उसे सुझा ही नहीं सकता, क्योंकि उसकी कोई गिनती नहीं है। तापमान की कोई सेटिंग, कोई कटाई, संदर्भ की कोई लंबाई उसे लौटा नहीं सकती। और यह भी देखिए कि इस कॉर्पस में कभी क्या नहीं रहा: पेरिस, लंदन, न्यूयॉर्क, टोक्यो उसका हिस्सा नहीं हैं। इस पर सीखा मॉडल ऐसी दुनिया का आभास देता जहाँ ये शहर मौजूद ही नहीं, और उस गैर-हाज़िरी की सूचना कभी नहीं देता।

यही समस्या का वह आधा हिस्सा है जो भुला दिया जाता है। पूर्वाग्रह तब नज़र आता है जब कोई जवाब गलत हो। गैर-हाज़िरी कभी नज़र नहीं आती, क्योंकि देखने के लिए कुछ ही नहीं होता।

तरीका

यह पूरा हिसाब है। इसे इस पन्ने के बिना, एक पेंसिल से दोहराया जा सकता है।

  1. कॉर्पस बनाइए। हर पेशे के लिए चालीस छोटे वाक्य लिखिए। अगर स्लाइडर नब्बे पर है, तो इन वाक्यों के नब्बे प्रतिशत “Elle est ingénieure.” होते हैं (“वह इंजीनियर है”, स्त्रीलिंग में) और बाकी “Il est ingénieur.” (पुल्लिंग में)। यह बाँट पूरी गिनती से फैलाई जाती है, किसी दाँव से कभी नहीं: इसलिए एक ही सेटिंग पर कॉर्पस सबके लिए एक ही रहता है।
  2. बाँटिए। टेक्स्ट इकाइयों की एक कतार बन जाता है: “Elle”, “est”, “ingénieure”, “.”। यहाँ जो बँटवारा इस्तेमाल हुआ है, वह शब्दों में बँटवारा है, जो असली मॉडलों के उप-शब्दों में बँटवारे से ज़्यादा पढ़ने लायक है, और जिसका अपना अध्याय है।
  3. गिनिए। दो इकाइयों के हर संदर्भ के लिए, वे सारी इकाइयाँ दर्ज कीजिए जो उसके बाद आईं और कितनी बार। संदर्भ “Elle est” अस्सी वाक्यों के बाद आया? तब उसकी तालिका में स्त्रीलिंग वाले पेशे होंगे, हर एक अपनी गिनती के साथ।
  4. भाग दीजिए। किसी संदर्भ के बाद किसी इकाई की संभावना उसकी गिनती है, जिसे तालिका के कुल से भाग दिया जाता है। मॉडल इससे ज़्यादा कुछ नहीं जानता।
  5. दाँव लगाइए। टेक्स्ट बनाने के लिए इस तालिका में इन संभावनाओं के हिसाब से दाँव लगाइए, ऐसे जनरेटर से जिसका बीज दिखते हुए सीड से पड़ा है।

चौथे कदम पर सेटिंग और नतीजे की बराबरी रहस्य नहीं रह जाती: कोई सापेक्ष बार-बारी वही अनुपात है जो आपने रखा था। गिनने वाला मॉडल यही करता है, और यही वह आधार है जिस पर बड़े मॉडल अपनी मशीनरियाँ जोड़ते हैं।

कोई असली मॉडल क्या जोड़ता है, और क्या नहीं हटाता

यह डेमो एक शर्त पर ईमानदार है: यह बता देना कि तुलना कहाँ रुक जाती है।

  • भीतर की मशीनरी वही है। कोई मॉडल किसी कॉर्पस में सांख्यिकीय नियमित रूप सीखता है, और उन्हें लौटा देता है।
  • व्यावहारिक नतीजा वही है। डेटा को छुए बिना मॉडल में किसी पूर्वाग्रह को सुधारना उसकी वजह पर काम नहीं करता।
  • गैर-हाज़िरी का असर वही है, और किसी असली मॉडल में वह और गंभीर है, जहाँ कोई कॉर्पस पढ़कर यह जाँच ही नहीं सकता कि क्या कमी है।
  • कोई असली मॉडल अनुपात नकल नहीं करता: वह सामान्यीकरण करता है, और किसी एक शब्द पर सीखा नियमित रूप उन दूसरे शब्दों पर भी चला जाता है जो उस संदर्भ में कभी देखे ही नहीं गए। इसलिए कोई बिगाड़ डेटा में मौजूद हालात से आगे भी फैल सकता है।
  • यह कॉर्पस बनावटी है और जान-बूझकर बहुत छोटा है। उसके अनुपात किसी देश, किसी पेशे, किसी आबादी का ब्यौरा नहीं देते। वे उस काम का ब्यौरा देते हैं जो आपने अभी एक स्लाइडर पर किया।
  • कोई असली कॉर्पस लगभग कभी पढ़ने लायक नहीं होता। ठीक इसीलिए डेटासेटों के मानकीकृत दस्तावेज़ीकरण का प्रस्ताव रखा गया, और इसीलिए बिना दर्ज बनावट एक कमी हुई जानकारी है, कोई छोटी बात नहीं।

शोध ने क्या नापा है

तीन प्रकाशित नतीजे उस बात की जगह तय करते हैं जो यह डेमो महसूस कराता है।

आम टेक्स्ट के बड़े कॉर्पस पर, खासकर अखबारी लेखों पर सीखी गई शब्दों की एम्बेडिंग नापे जा सकने वाले लैंगिक रूढ़िवाद दोहरा देती हैं, और कुछ पेशों को किसी एक लिंग से ज़्यादा जोड़ देती हैं। किसी आम वेब कॉर्पस पर सीखा एक मानक सांख्यिकीय मॉडल अपने आप वे इंसानी पूर्वाग्रह दोहरा देता है जो मनोवैज्ञानिक परीक्षणों से पहले से जाने और नापे जा चुके हैं, लिंग और मूल पर भी। और असर टेक्स्ट में रुकता नहीं: तस्वीर से लिंग वर्गीकरण करने वाले व्यापारिक सिस्टमों में गहरे रंग की त्वचा वाली महिलाओं के लिए गलती की दर 34.7% तक पहुँची, जबकि हलके रंग की त्वचा वाले पुरुषों के लिए वह 0.8% थी, और यह फ़र्क़ त्वचा के रंग और लिंग, दोनों को मिलाकर नापा गया।

यह आखिरी आंकड़ा असली कीमत बताता है। इस पैमाने का प्रदर्शन-अंतर कोई तकनीकी खामी नहीं है: यह एक ऐसी सेवा है जो कुछ लोगों के लिए चलती है और दूसरों के लिए नहीं।

याद रखने लायक आदत

जब कोई जवाब अपनी नियमितता से आपको चौंका दे, तो मॉडल से यह न पूछिए कि वह ऐसा क्यों सोचता है: उसे कुछ पता नहीं, और उसकी सफ़ाई भी बाकी सब की तरह हिसाब से बनती है। पूछिए कि उसे किस पर सिखाया गया, और उस कॉर्पस को किसने दर्ज किया। जब इस सवाल का जवाब ही मौजूद न हो, तो वही जवाब है।

आगे पढ़ने के लिए

टेक्स्ट को इकाइयों में बाँटना अध्याय शब्द, टुकड़ों में में लिया गया है। वितरण और उसका दाँव अध्याय अगला शब्द में लिए गए हैं। किसी सेवा को सौंपी गई सामग्री का क्या होता है, यह अध्याय हम उसे क्या देते हैं में लिया गया है। जिन हालात में यह औज़ार बंद हो जाता है, वे कब इस्तेमाल न करें में एक जगह हैं। साइट के सारे डेमो डेमो वाले पन्ने पर एक जगह हैं, और कोर्स की सूची समझें वाले पन्ने पर है।

स्रोत