एक भाषा की कीमत
एक ही वाक्य, जिस भाषा में लिखा गया है उसके हिसाब से, 15 गुना तक ज़्यादा टोकन बना सकता है। यह शैली की कोई छोटी बात नहीं: यह इंजीनियरिंग का एक चुनाव है, जिसके नतीजे नापे जा सकते हैं।
किसी भाषा मॉडल से एक ही सवाल, दो अलग भाषाओं में पूछने पर हिसाब लगाने की कीमत एक जैसी नहीं होती। यह शब्दों की लंबाई या शिष्टाचार का मामला नहीं है: यह एक नापा हुआ, दर्ज किया हुआ फ़र्क़ है, और वह इंजीनियरिंग के एक ऐसे चुनाव से आता है जो किसी के कोई सवाल पूछने से बहुत पहले लिया जा चुका था।
मॉडल में दाखिल होने से पहले कोई टेक्स्ट क्या बन जाता है
कोई भाषा मॉडल शब्द नहीं पढ़ता। वह टोकन पढ़ता है: टेक्स्ट के टुकड़े, किसी शब्द से छोटे या कभी उससे बड़े, जिन्हें टोकनाइज़र नाम का एक प्रोग्राम टेक्स्ट के हिसाब में दाखिल होने से पहले काट देता है। इस बँटवारे का ब्यौरा एक तय शब्दावली पर टिका है, जो किसी बहुत बड़े टेक्स्ट-कॉर्पस पर एक ही बार, हमेशा के लिए सीखी जाती है। हर शब्द के अपने टोकनों की एक संख्या होती है, और यही संख्या वह चीज़ है जिसका बिल मॉडल बनाता है, हिसाब के वक़्त में भी और अपनी कार्य-स्मृति की जगह में भी।
वही सामग्री, बहुत अलग जोड़
2023 के एक अध्ययन ने यह फ़र्क़ भाषा मॉडलों में असल में इस्तेमाल हो रहे टोकनाइज़रों के एक समूह पर नापा। उसका नतीजा: एक ही सामग्री, अलग-अलग भाषाओं में अनुवाद की गई, सबसे नुकसान में रहने वाली भाषा में सबसे फ़ायदे में रहने वाली भाषा से 15 गुना तक ज़्यादा टोकन बना सकती है। वे टोकनाइज़र भी, जो अक्षर या बाइट के स्तर पर काटते हैं और जिन्हें इस दिक्कत से बचना चाहिए था, भाषा-जोड़ों के हिसाब से 4 गुना से ज़्यादा का नापा हुआ फ़र्क़ बनाए रखते हैं।
15×
एक ही सामग्री के लिए नापा गया टोकनों का फ़र्क़, सबसे फ़ायदे में रहने वाली और सबसे नुकसान में रहने वाली भाषा के बीच, सबसे प्रतिकूल हालात में (Petrov et al., 2023)।
वही बात कहने के लिए ज़्यादा टोकन कोई सजावटी छोटी बात नहीं है। यह हर जवाब पर ज़्यादा हिसाब है, इसलिए बनने में ज़्यादा धीमा और टोकन के हिसाब से बिल बनाने वाली सेवा के लिए चलाने में ज़्यादा महँगा। यह वह संदर्भ-खिड़की भी है, यानी किसी मॉडल की सीमित कार्य-स्मृति, जो ज़्यादा जल्दी भर जाती है: टोकनों की एक ही मंज़ूर संख्या पर, नुकसान में रहने वाली भाषा का टेक्स्ट असल में काम की कम सामग्री ही रख पाता है।
यह चुनाव तटस्थ क्यों नहीं है
सबसे फैले हुए बँटवारे के तरीके का नाम BPE है, यानी byte pair encoding। इसे भाषा के लिए नहीं बनाया गया था। Philip Gage 1994 में इसका ब्यौरा कंप्यूटर फ़ाइलों के संपीड़न की एक सामान्य विधि के तौर पर देते हैं: वह किसी डेटा में सबसे बार-बार आने वाला बाइट-जोड़ा पहचानती है, उसकी जगह कोई बेकार पड़ा बाइट रख देती है, और यह काम तब तक दोहराती है जब तक फ़ायदा खत्म न हो जाए। मूल रूप से किसी इंसानी भाषा से इसका कोई नाता नहीं था।
2016 में Rico Sennrich, Barry Haddow और Alexandra Birch इस विचार को मशीनी अनुवाद की एक तय दिक्कत के लिए उठाते हैं: किसी दुर्लभ शब्द का क्या करें, जो मॉडल की सीखी शब्दावली में ही नहीं है? उनका जवाब उस शब्द को ज़्यादा आम टुकड़ों में काट देता है, जिन्हें मॉडल पहले से जानता है। यह तरीका अच्छा चलता है, और तब से लगभग सारे बड़े भाषा मॉडल इसे अपनाते आए हैं।
उप-शब्दों की कोई शब्दावली किसी कॉर्पस पर, एक बार, खुद मॉडल के प्रशिक्षण से पहले सीखी जाती है। ज़्यादातर अंग्रेज़ी वाला कॉर्पस अंग्रेज़ी के लिए सधी हुई शब्दावली सीखता है: इस भाषा के सबसे आम टुकड़े अकेले, छोटे और गिनती में कम टोकन बन जाते हैं। इस कॉर्पस में कम मौजूद किसी भाषा का शब्द ज़्यादा टुकड़ों में बँटा मिलता है, बस इसलिए कि उसके अपने बार-बार आने वाले दोहरावों को शब्दावली सीखने के दौरान वही मौका नहीं मिला कि उन्हें देखा जाए। यह भाषा का कोई गुण नहीं है। यह एक कॉर्पस का निशान है।
इससे ठोस तौर पर क्या बदलता है
टोकन के हिसाब से बिल बनाने वाली सेवा, बराबर की सामग्री के लिए, उसे ज़्यादा महँगी पड़ती है जो टोकनाइज़र की नज़र में नुकसान में रहने वाली भाषा में लिखता है। जवाब दिखने में भी ज़्यादा वक़्त लेता है, क्योंकि कोई मॉडल अपने टोकन एक के बाद एक बनाता है, लगभग एक-सी रफ़्तार से: बनाने के लिए ज़्यादा टोकन, तो ज़्यादा इंतज़ार। और संदर्भ-खिड़की, यानी टोकनों की वह तय संख्या जो कोई मॉडल एक बार में पढ़ या लिख सकता है, उसमें काम का कम टेक्स्ट आता है: कोई दस्तावेज़, बातचीत का कोई इतिहास, कोई लंबा निर्देश, सब उसमें कम अच्छी तरह बैठते हैं।
इनमें से कोई भी असर इससे नहीं आता कि कोई भाषा दूसरी से ज़्यादा जटिल है। वे एक ऐसी शब्दावली से आते हैं जो एक बार, किसी दिए हुए कॉर्पस पर सीखी गई, और जिसे इस हिसाब से दोबारा कभी नहीं निकाला गया कि आगे उसका इस्तेमाल कौन करता है। 2023 के अध्ययन के लेखक एक राह सुझाते हैं: ऐसे टोकनाइज़र शुरू से ही बनाए जाएं जो बनावट से ही किसी एक भाषा का दूसरी से ज़्यादा पक्ष न लें।
स्रोत
- Language Model Tokenizers Introduce Unfairness Between Languages Aleksandar Petrov, Emanuele La Malfa, Philip H. S. Torr, Adel Bibi, 2023।
- Neural Machine Translation of Rare Words with Subword Units Rico Sennrich, Barry Haddow, Alexandra Birch, 2016।
- A New Algorithm for Data Compression Philip Gage, 1994।
यह लेख CC BY 4.0 लाइसेंस के तहत प्रकाशित है: इसे कॉपी कीजिए, अनुवाद कीजिए, दोबारा प्रकाशित कीजिए, ODERSA का नाम देकर।