यह ODERSA की एक आधिकारिक वेबसाइट है। यह कैसे जानें

आधिकारिक डोमेन

इस साइट का पता odersa.org पर खत्म होता है। संस्था की हर सेवा odersa.org के किसी उपडोमेन पर ही होती है, और कहीं नहीं। अगर आपके ब्राउज़र की पता-पट्टी में दिख रहा पता odersa.org पर खत्म नहीं होता, तो यह साइट हमारी नहीं है।

मुफ़्त, और बिना खाते

सब कुछ पहले पल से खुला है: कोई रजिस्ट्रेशन नहीं, कोई खाता नहीं, कोई पासवर्ड नहीं, कोई सब्सक्रिप्शन नहीं, कोई विज्ञापन नहीं। पैसे देने वालों के लिए अलग से कुछ नहीं रखा गया, क्योंकि यहाँ कुछ भी पैसे से नहीं मिलता।

कोई डेटा इकट्ठा नहीं

यह साइट आपका पीछा नहीं करती: न कोई ट्रैकर, न कोई ट्रैकिंग कुकी, न इन पन्नों में जड़ा कोई मापने वाला औज़ार, और न आपके उपकरण पर कुछ मापा जाता है। हमारा होस्ट अनुरोधों की गिनती कुल जोड़ के रूप में रखता है, जैसा जवाब देने वाला हर सर्वर रखता है: एक कुल योग, कभी कोई प्रोफ़ाइल नहीं। हमारी बात मान लेने की ज़रूरत नहीं: अपने ब्राउज़र के डेवलपर टूल खोलिए, Network टैब में जाइए, और पन्ना दोबारा लोड कीजिए। साइट जो कुछ माँगती है, उसकी पूरी सूची आपके सामने आ जाएगी। सब कुछ odersa.org से आता है, कुछ भी कहीं और नहीं जाता।

खुला कंटेंट

कंटेंट CC BY 4.0 लाइसेंस के तहत प्रकाशित है। आप इसे कॉपी कर सकते हैं, अनुवाद कर सकते हैं, छाप सकते हैं और आगे बाँट सकते हैं, अपनी कक्षा के लिए भी और अपने घर-परिवार के लिए भी। बस एक शर्त: ODERSA का नाम दें।

एक भाषा की कीमत

एक ही वाक्य, जिस भाषा में लिखा गया है उसके हिसाब से, 15 गुना तक ज़्यादा टोकन बना सकता है। यह शैली की कोई छोटी बात नहीं: यह इंजीनियरिंग का एक चुनाव है, जिसके नतीजे नापे जा सकते हैं।

किसी भाषा मॉडल से एक ही सवाल, दो अलग भाषाओं में पूछने पर हिसाब लगाने की कीमत एक जैसी नहीं होती। यह शब्दों की लंबाई या शिष्टाचार का मामला नहीं है: यह एक नापा हुआ, दर्ज किया हुआ फ़र्क़ है, और वह इंजीनियरिंग के एक ऐसे चुनाव से आता है जो किसी के कोई सवाल पूछने से बहुत पहले लिया जा चुका था।

मॉडल में दाखिल होने से पहले कोई टेक्स्ट क्या बन जाता है

कोई भाषा मॉडल शब्द नहीं पढ़ता। वह टोकन पढ़ता है: टेक्स्ट के टुकड़े, किसी शब्द से छोटे या कभी उससे बड़े, जिन्हें टोकनाइज़र नाम का एक प्रोग्राम टेक्स्ट के हिसाब में दाखिल होने से पहले काट देता है। इस बँटवारे का ब्यौरा एक तय शब्दावली पर टिका है, जो किसी बहुत बड़े टेक्स्ट-कॉर्पस पर एक ही बार, हमेशा के लिए सीखी जाती है। हर शब्द के अपने टोकनों की एक संख्या होती है, और यही संख्या वह चीज़ है जिसका बिल मॉडल बनाता है, हिसाब के वक़्त में भी और अपनी कार्य-स्मृति की जगह में भी।

वही सामग्री, बहुत अलग जोड़

2023 के एक अध्ययन ने यह फ़र्क़ भाषा मॉडलों में असल में इस्तेमाल हो रहे टोकनाइज़रों के एक समूह पर नापा। उसका नतीजा: एक ही सामग्री, अलग-अलग भाषाओं में अनुवाद की गई, सबसे नुकसान में रहने वाली भाषा में सबसे फ़ायदे में रहने वाली भाषा से 15 गुना तक ज़्यादा टोकन बना सकती है। वे टोकनाइज़र भी, जो अक्षर या बाइट के स्तर पर काटते हैं और जिन्हें इस दिक्कत से बचना चाहिए था, भाषा-जोड़ों के हिसाब से 4 गुना से ज़्यादा का नापा हुआ फ़र्क़ बनाए रखते हैं।

15×

एक ही सामग्री के लिए नापा गया टोकनों का फ़र्क़, सबसे फ़ायदे में रहने वाली और सबसे नुकसान में रहने वाली भाषा के बीच, सबसे प्रतिकूल हालात में (Petrov et al., 2023)।

वही बात कहने के लिए ज़्यादा टोकन कोई सजावटी छोटी बात नहीं है। यह हर जवाब पर ज़्यादा हिसाब है, इसलिए बनने में ज़्यादा धीमा और टोकन के हिसाब से बिल बनाने वाली सेवा के लिए चलाने में ज़्यादा महँगा। यह वह संदर्भ-खिड़की भी है, यानी किसी मॉडल की सीमित कार्य-स्मृति, जो ज़्यादा जल्दी भर जाती है: टोकनों की एक ही मंज़ूर संख्या पर, नुकसान में रहने वाली भाषा का टेक्स्ट असल में काम की कम सामग्री ही रख पाता है।

यह चुनाव तटस्थ क्यों नहीं है

सबसे फैले हुए बँटवारे के तरीके का नाम BPE है, यानी byte pair encoding। इसे भाषा के लिए नहीं बनाया गया था। Philip Gage 1994 में इसका ब्यौरा कंप्यूटर फ़ाइलों के संपीड़न की एक सामान्य विधि के तौर पर देते हैं: वह किसी डेटा में सबसे बार-बार आने वाला बाइट-जोड़ा पहचानती है, उसकी जगह कोई बेकार पड़ा बाइट रख देती है, और यह काम तब तक दोहराती है जब तक फ़ायदा खत्म न हो जाए। मूल रूप से किसी इंसानी भाषा से इसका कोई नाता नहीं था।

2016 में Rico Sennrich, Barry Haddow और Alexandra Birch इस विचार को मशीनी अनुवाद की एक तय दिक्कत के लिए उठाते हैं: किसी दुर्लभ शब्द का क्या करें, जो मॉडल की सीखी शब्दावली में ही नहीं है? उनका जवाब उस शब्द को ज़्यादा आम टुकड़ों में काट देता है, जिन्हें मॉडल पहले से जानता है। यह तरीका अच्छा चलता है, और तब से लगभग सारे बड़े भाषा मॉडल इसे अपनाते आए हैं।

उप-शब्दों की कोई शब्दावली किसी कॉर्पस पर, एक बार, खुद मॉडल के प्रशिक्षण से पहले सीखी जाती है। ज़्यादातर अंग्रेज़ी वाला कॉर्पस अंग्रेज़ी के लिए सधी हुई शब्दावली सीखता है: इस भाषा के सबसे आम टुकड़े अकेले, छोटे और गिनती में कम टोकन बन जाते हैं। इस कॉर्पस में कम मौजूद किसी भाषा का शब्द ज़्यादा टुकड़ों में बँटा मिलता है, बस इसलिए कि उसके अपने बार-बार आने वाले दोहरावों को शब्दावली सीखने के दौरान वही मौका नहीं मिला कि उन्हें देखा जाए। यह भाषा का कोई गुण नहीं है। यह एक कॉर्पस का निशान है।

इससे ठोस तौर पर क्या बदलता है

टोकन के हिसाब से बिल बनाने वाली सेवा, बराबर की सामग्री के लिए, उसे ज़्यादा महँगी पड़ती है जो टोकनाइज़र की नज़र में नुकसान में रहने वाली भाषा में लिखता है। जवाब दिखने में भी ज़्यादा वक़्त लेता है, क्योंकि कोई मॉडल अपने टोकन एक के बाद एक बनाता है, लगभग एक-सी रफ़्तार से: बनाने के लिए ज़्यादा टोकन, तो ज़्यादा इंतज़ार। और संदर्भ-खिड़की, यानी टोकनों की वह तय संख्या जो कोई मॉडल एक बार में पढ़ या लिख सकता है, उसमें काम का कम टेक्स्ट आता है: कोई दस्तावेज़, बातचीत का कोई इतिहास, कोई लंबा निर्देश, सब उसमें कम अच्छी तरह बैठते हैं।

इनमें से कोई भी असर इससे नहीं आता कि कोई भाषा दूसरी से ज़्यादा जटिल है। वे एक ऐसी शब्दावली से आते हैं जो एक बार, किसी दिए हुए कॉर्पस पर सीखी गई, और जिसे इस हिसाब से दोबारा कभी नहीं निकाला गया कि आगे उसका इस्तेमाल कौन करता है। 2023 के अध्ययन के लेखक एक राह सुझाते हैं: ऐसे टोकनाइज़र शुरू से ही बनाए जाएं जो बनावट से ही किसी एक भाषा का दूसरी से ज़्यादा पक्ष न लें।

स्रोत

यह लेख CC BY 4.0 लाइसेंस के तहत प्रकाशित है: इसे कॉपी कीजिए, अनुवाद कीजिए, दोबारा प्रकाशित कीजिए, ODERSA का नाम देकर।

ब्लॉग पर वापस