यह ODERSA की एक आधिकारिक वेबसाइट है। यह कैसे जानें

आधिकारिक डोमेन

इस साइट का पता odersa.org पर खत्म होता है। संस्था की हर सेवा odersa.org के किसी उपडोमेन पर ही होती है, और कहीं नहीं। अगर आपके ब्राउज़र की पता-पट्टी में दिख रहा पता odersa.org पर खत्म नहीं होता, तो यह साइट हमारी नहीं है।

मुफ़्त, और बिना खाते

सब कुछ पहले पल से खुला है: कोई रजिस्ट्रेशन नहीं, कोई खाता नहीं, कोई पासवर्ड नहीं, कोई सब्सक्रिप्शन नहीं, कोई विज्ञापन नहीं। पैसे देने वालों के लिए अलग से कुछ नहीं रखा गया, क्योंकि यहाँ कुछ भी पैसे से नहीं मिलता।

कोई डेटा इकट्ठा नहीं

यह साइट आपका पीछा नहीं करती: न कोई ट्रैकर, न कोई ट्रैकिंग कुकी, न इन पन्नों में जड़ा कोई मापने वाला औज़ार, और न आपके उपकरण पर कुछ मापा जाता है। हमारा होस्ट अनुरोधों की गिनती कुल जोड़ के रूप में रखता है, जैसा जवाब देने वाला हर सर्वर रखता है: एक कुल योग, कभी कोई प्रोफ़ाइल नहीं। हमारी बात मान लेने की ज़रूरत नहीं: अपने ब्राउज़र के डेवलपर टूल खोलिए, Network टैब में जाइए, और पन्ना दोबारा लोड कीजिए। साइट जो कुछ माँगती है, उसकी पूरी सूची आपके सामने आ जाएगी। सब कुछ odersa.org से आता है, कुछ भी कहीं और नहीं जाता।

खुला कंटेंट

कंटेंट CC BY 4.0 लाइसेंस के तहत प्रकाशित है। आप इसे कॉपी कर सकते हैं, अनुवाद कर सकते हैं, छाप सकते हैं और आगे बाँट सकते हैं, अपनी कक्षा के लिए भी और अपने घर-परिवार के लिए भी। बस एक शर्त: ODERSA का नाम दें।

शब्दकोश

इस कोर्स में इस्तेमाल होने वाला हर शब्द, साफ़-साफ़ समझाया, और साथ में एक एंकर ताकि कोई अध्याय सीधे उस पर भेज सके।

इस क्षेत्र की रोज़मर्रा की शब्दावली गुमराह करती है, और यह जानना कि क्यों, इस कोर्स का हिस्सा है। इंसानी मन से उधार लिए शब्द, “समझना”, “जानना”, “सीखना”, “मतिभ्रम होना”, यहाँ एक हिसाब का ब्यौरा देते हैं, किसी भीतरी हालत का कभी नहीं। कोई भाषा मॉडल न कुछ समझता है, न कुछ जानता है, न कुछ सीखता है, उस अर्थ में जिसमें कोई व्यक्ति करता है: वह किसी कॉर्पस पर संख्या वाले पैरामीटर सेट करता है, और फिर इनपुट में मिले टेक्स्ट से एक संभावित आगे की कड़ी का हिसाब लगाता है। यह कहना कि वह “मतिभ्रम” करता है, किसी बीमारी का ब्यौरा नहीं देता: यह एक ऐसे नतीजे को नाम देता है जो संभावित और गलत है, और जो उसी हिसाब से निकलता है जिससे सही जवाब निकलता है। यह शब्दकोश इन शब्दों को इसलिए रखता है कि कोर्स और शोध इनका इस्तेमाल करते हैं, पर हर परिभाषा उन्हें उस हिसाब पर लौटा देती है जिसे वे असल में बताते हैं।

शब्द, वर्णक्रम में

हर प्रविष्टि पर एक एंकर है: कोर्स का कोई अध्याय सीधे उस पर भेज सकता है। किसी परिभाषा में लिंक किया हुआ शब्द इसी सूची में, ऊपर या नीचे, अपनी अलग प्रविष्टि रखता है।

अनुमान-गणना (इन्फ़रेंस)
वह हिसाब जो पहले से प्रशिक्षित किसी मॉडल से जवाब बनाता है, उस प्रशिक्षण से अलग जिसने उससे पहले उसके पैरामीटर तय किए थे। यही हर बार होता है जब किसी प्रॉम्प्ट को जवाब मिलता है: कोई पैरामीटर नहीं बदलता, सिर्फ़ पहले से तय मानों पर एक हिसाब चलता है।
आत्मविश्वास
किसी जवाब का भरोसे से भरा लहजा, चाहे वह सही हो या न हो। कोई मॉडल गढ़ते वक़्त अपना लहजा नहीं गिराता: उसकी बनावट में कुछ भी एक जाँचे हुए तथ्य को गढ़े हुए जवाब से अलग नहीं करता। इसलिए किसी जवाब का आत्मविश्वास उसकी सच्चाई का सबूत कभी नहीं होता।
आर्टिफ़ैक्ट
किसी तस्वीर या किसी आवाज़ की बनावट का छोड़ा हुआ निशान, जो आँख या कान को नहीं दिखता पर हिसाब से नापा जा सकता है। मिसाल के लिए, जो काम किसी तस्वीर को बनाते वक़्त उसे बड़ा करते हैं, वे एक नियमित छाप छोड़ जाते हैं, जो फ़ाइल की आवृत्तियों के ब्यौरे में पकड़ी जा सकती है। कोई आर्टिफ़ैक्ट बनाई गई तस्वीर पहचानने में मदद करता है, पर नए मॉडल इन्हें कम से कम छोड़ते हैं।
आर्टिफिशियल इंटेलिजेंस साक्षरता
वे सारी जानकारियाँ, कौशल और रवैये जिनसे किसी आर्टिफिशियल इंटेलिजेंस सिस्टम का इस्तेमाल किया जा सके, उससे सवाल किए जा सकें और, कुछ लोगों के लिए, उसे बनाया जा सके, बिना उस पर आँख मूँदकर टिके। 2026 में OECD और यूरोपीय आयोग का प्रकाशित एक साझा ढाँचा उसे योग्यताओं के चार क्षेत्रों में बताता है, जो प्राथमिक और माध्यमिक शिक्षा के लिए सोचे गए हैं। इस ढाँचे और उसे पूरा करने वाले अंतरराष्ट्रीय ढाँचों का ब्यौरा आधिकारिक ढाँचे पन्ने पर एक जगह है।
आवाज़ की नकल (वॉइस क्लोनिंग)
एक तकनीक जो किसी ऑडियो नमूने से किसी तय व्यक्ति की आवाज़ दोबारा बना देती है, ताकि उससे वह वाक्य कहलवाया जा सके जो उसने कभी नहीं कहा। एक अमेरिकी सरकारी प्राधिकरण ने एक असली अभियान दर्ज किया और उस पर कार्रवाई की, जिसमें चुनाव से पहले मतदाताओं के पास किसी राजनेता की नकल की गई आवाज़ भेजी गई थी। यह डीपफ़ेक का ही एक रूप है, जो खासकर आवाज़ पर लागू होता है।
उद्गम (प्रोवेनेंस)
किसी फ़ाइल के मूल और उसमें हुए बदलावों का जाँचा जा सकने वाला निशान, जो फ़ाइल के साथ जुड़ा रहता है, उसके कंटेंट में छिपा नहीं। एक सार्वजनिक तकनीकी मानक, C2PA, तय करता है कि यह जानकारी हस्ताक्षरित और जाँचे जा सकने वाले ढंग से कैसे जोड़ी जाए। मानक खुद मानता है कि यह जानकारी फ़ाइल से अलग हो सकती है, और इसलिए एक साधारण स्क्रीनशॉट पर खो जाती है: उद्गम मूल फ़ाइल को बचाता है, उसकी नकलों को नहीं।
एम्बेडिंग
किसी शब्द या किसी टोकन को संख्याओं की एक सूची के रूप में दिखाना, जो प्रशिक्षण के दौरान इस तरह बनाई जाती है कि पास-पास के संदर्भों में इस्तेमाल होने वाले दो शब्दों को पास-पास की सूचियाँ मिलें। आम टेक्स्ट के बड़े कॉर्पस पर सीखी गई एम्बेडिंग इस तरह नापे जा सकने वाले लैंगिक रूढ़िवाद दोहरा देती हैं, मिसाल के लिए कुछ पेशों को एक लिंग से दूसरे की तुलना में ज़्यादा जोड़कर। इसलिए कोई एम्बेडिंग खुद शब्दों के बारे में जितना कहती है, उतना ही अपने मूल कॉर्पस के बारे में भी।
कॉर्पस
टेक्स्ट, तस्वीरों या आवाज़ों का वह पूरा जमावड़ा जिस पर कोई मॉडल सीखता है, उसके नियमित रूपों का एकमात्र स्रोत। कोई डेटासेट एक तय इस्तेमाल के लिए व्यवस्थित और दर्ज किया गया कॉर्पस है; कॉर्पस शब्द उस काम से पहले की कच्ची सामग्री को कहता है। जो कॉर्पस में नहीं है, वह मॉडल के लिए किसी भी रूप में मौजूद नहीं: न किसी दुर्लभ चीज़ की तरह, न किसी गलत चीज़ की तरह।
खुला स्रोत
वह मॉडल जिसका कोड, जिसके पैरामीटर या दोनों प्रकाशित हैं, ताकि दूसरे उन्हें देख सकें, दोबारा इस्तेमाल कर सकें या जाँच सकें, बजाय सिर्फ़ किसी बंद सेवा के ज़रिए उन तक पहुँचने के। खुलापन अकेले प्रशिक्षण में इस्तेमाल हुए डेटा के बारे में कुछ नहीं कहता: कोई मॉडल अपने पैरामीटर प्रकाशित कर सकता है और अपना कॉर्पस कभी दर्ज न करे। इसलिए “खुला स्रोत” और “दर्ज किया गया डेटासेट” दो अलग गारंटियाँ रहती हैं, जो कम ही साथ मिलती हैं।
गढ़ा हुआ जवाब (हैलुसिनेशन)
एक गढ़ा हुआ जवाब, जो उतने ही आत्मविश्वास के साथ कहा जाता है जितने के साथ कोई सही जवाब। वह किसी भी दूसरे जवाब के उसी हिसाब से निकलता है: मॉडल के काम करने के ढंग में कुछ भी एक जाँचे हुए तथ्य को एक संभावित अटकल से अलग नहीं करता, और आज की प्रशिक्षण और मूल्यांकन की प्रक्रियाएँ अनिश्चितता मान लेने के बजाय एक संभावित जवाब को इनाम देती हैं। एक सैद्धांतिक काम यह दलील देता है कि इस तरह के मॉडल के लिए गढ़ने की एक दर गणितीय रूप से अटल होगी; यह नतीजा बहस के घेरे में है, और दूसरे काम इस पर सवाल उठाते हैं कि उसकी मान्यताएँ असल इस्तेमालों पर लागू होती हैं या नहीं।
झूठा हाँ और झूठा नहीं
वे दो तरीके जिनसे कोई डिटेक्टर गलती करता है: झूठा हाँ किसी इंसानी सामग्री पर मॉडल से बनी होने का आरोप लगाता है, झूठा नहीं मॉडल से बनी सामग्री को इंसानी बताकर जाने देता है। कई बहुत इस्तेमाल होने वाले टेक्स्ट डिटेक्टर इस तरह मूल अंग्रेज़ी न बोलने वालों के ज़्यादातर टेक्स्ट को गलती से मशीन-निर्मित बता देते हैं, जबकि मूल भाषा बोलने वालों के टेक्स्ट को वे ठीक-ठीक पहचानते हैं: यह झूठा हाँ संयोग से नहीं बँटता। जो औज़ार इन दो जोखिमों में से एक घटाना चाहता है, वह लगभग हमेशा दूसरा बढ़ा देता है।
टोकन
टेक्स्ट की वह सबसे छोटी इकाई जिसे कोई मॉडल संभालता है, अक्सर पूरे शब्द से छोटी। कोई दुर्लभ या अजाना शब्द तब पहले से जाने-पहचाने टुकड़ों से बने कई टोकन में बँट जाता है, जिससे उसे कभी वैसा देखे बिना भी संभाला जा सकता है। हर टोकन उसके बाद, किसी भी हिसाब से पहले, एक संख्या में बदल दिया जाता है: कोई मॉडल कभी अक्षर नहीं पढ़ता, वह संख्याएँ पढ़ता है।
टोकनाइज़ेशन
वह काम जो किसी भी हिसाब से पहले किसी टेक्स्ट को टोकन में बाँट देता है। आज सबसे ज़्यादा इस्तेमाल होने वाला तरीका मूल रूप से 1994 के एक डेटा-संपीड़न एल्गोरिद्म से आया है, जिसका बनते वक़्त भाषा से कोई नाता नहीं था। अलग-अलग भाषाओं में अनुवाद की गई एक ही सामग्री, भाषा के हिसाब से, पंद्रह गुना तक ज़्यादा टोकन माँग सकती है, जिससे कुछ भाषाएँ दूसरों से धीमी और महँगी पड़ती हैं।
टॉप-k
एक तरीका जो हर कदम पर दाँव को सबसे संभावित k टोकन तक सीमित कर देता है, जहाँ k पहले से तय एक संख्या है। सबसे कम संभावित टोकन इस तरह नमूना-चयन से पहले ही हटा दिए जाते हैं, जिससे कोई बहुत असंभव चुनाव नहीं होता और नतीजा पूरी तरह पहले से तय भी नहीं रहता।
टॉप-p
एक तरीका जो दाँव को टोकन के उस सबसे छोटे समूह तक सीमित करता है जिसकी जुड़ी हुई संभावनाएँ p तक पहुँच जाती हैं, बजाय टॉप-k की तरह टोकन की किसी तय संख्या तक। इसलिए यह समूह एक कदम से दूसरे कदम पर अपना आकार बदलता है: चौड़ा, जब कई शब्द संभावना में पास-पास रहते हैं; छोटा, जब एक शब्द बाकियों पर भारी पड़ता है। यह तरीका, जिसे न्यूक्लियस सैंपलिंग भी कहा जाता है, सबसे संभावित शब्द के हमेशा चुने जाने की जगह लेता है, जो सपाट और दोहराव वाला होता है।
ट्रांसफ़ॉर्मर
आज के भाषा मॉडलों के पीछे का न्यूरल नेटवर्क ढाँचा। किसी टेक्स्ट को सख़्त क्रम में टोकन दर टोकन पढ़ने के बजाय, यह संदर्भ-खिड़की के हर टोकन की तुलना बाकी सारे टोकन से एक ही बार में करता है, और उनकी अहमियत एक-दूसरे के मुक़ाबले तोलता है। एक साथ तुलना करने की यही मशीनरी है जिसने पहले से कहीं बड़े कॉर्पस पर मॉडल प्रशिक्षित करना मुमकिन किया।
डिटेक्टर
वह औज़ार जो यह बताने का दावा करता है कि कोई टेक्स्ट, कोई तस्वीर या कोई आवाज़ किसी मॉडल ने बनाई है या नहीं। चौदह टेक्स्ट डिटेक्टरों के एक स्वतंत्र मूल्यांकन में, जिनमें शिक्षा को बेचे जाने वाले व्यापारिक औज़ार भी थे, एक भी ऐसा नहीं मिला जो एक साथ भरोसेमंद और सटीक हो। कोई डिटेक्टर कभी फ़ैसला नहीं देता: ज़्यादा से ज़्यादा एक इशारा, जिसे कहीं और से मिलाना पड़ता है।
डिफ़्यूज़न मॉडल
एक तकनीक जो किसी तस्वीर को यादृच्छिक दृश्य शोर से शुरू करके बनाती है, और फिर उसे कदम-कदम हटाती जाती है जब तक एक संभावित तस्वीर उभर आए, और यह सब किसी टेक्स्ट ब्यौरे के निर्देश पर होता है। आज तस्वीर बनाने वालों के पीछे यही सबसे ज़्यादा इस्तेमाल होने वाला तरीका है। किसी भी बनी हुई तस्वीर की तरह, नतीजा एक ऐसा आर्टिफ़ैक्ट लिए चल सकता है जो उसकी बनावट खोल देता है, तब भी जब नंगी आँख को कुछ नहीं दिखता।
डीप लर्निंग
मशीन लर्निंग करने का एक ढंग, ऐसे न्यूरल नेटवर्क के साथ जो एक पर एक चढ़ी कई परतों से बना हो। हर परत पिछली से मिली जानकारी को थोड़ा और बदल देती है, जिससे वे नियमित रूप पकड़े जा सकते हैं जिन्हें हाथ से लिखा कोई नियम पकड़ न पाता। आज के भाषा मॉडलों और तस्वीर बनाने वालों के पीछे यही तकनीक है।
डीपफ़ेक
किसी मॉडल से बनाई या बदली गई कोई तस्वीर, कोई वीडियो या कोई आवाज़, जो ऐसी किसी घटना पर यकीन दिलाने के लिए हो जो कभी हुई ही नहीं। आवाज़ की नकल इसका ही एक रूप है, जो आवाज़ पर लागू होता है। इंसानी दर्शक अब नए बनाए गए चेहरे को असली चेहरे से भरोसेमंद ढंग से अलग नहीं कर पाते, और औसतन उसे ज़्यादा भरोसे लायक तक मानते हैं।
डेटासेट
एक तय इस्तेमाल के लिए व्यवस्थित और दर्ज किया गया कॉर्पस: उसकी बनावट, उसका मूल और उसे जुटाने का तरीका जाना हुआ होना चाहिए, सिर्फ़ उसका कंटेंट नहीं। इसके लिए 2018 से एक मानकीकृत दस्तावेज़ीकरण का प्रस्ताव मौजूद है, ताकि सामने आए किसी पूर्वाग्रह की जड़ तक पहुँचा जा सके, बजाय मॉडल तैनात होने के बाद उसका पता चलने के। जो डेटासेट दर्ज नहीं है, वह असल में एक कॉर्पस से ज़्यादा कुछ नहीं।
तापमान
एक सेटिंग जो मॉडल के निकाले संभावना-वितरण को नमूना-चयन से पहले नरम या सख़्त कर देती है। ज़्यादा तापमान मुमकिन शब्दों की संभावनाओं को एक-दूसरे के पास ले आता है, जिससे चुनाव कम पूर्वानुमेय हो जाते हैं; कम तापमान पहले से सबसे संभावित शब्द के पक्ष में फ़र्क़ और बढ़ा देता है। यह कोई भौतिक माप नहीं है: शब्द सांख्यिकीय भौतिकी के एक फ़ॉर्मूले से उधार लिया गया है, किसी असली गर्मी से इसका नाता नहीं।
तस्वीर बनाने वाला (इमेज जनरेटर)
वह सिस्टम जो टेक्स्ट में दिए ब्यौरे से एक नई तस्वीर बनाता है। आज इसके लिए सबसे ज़्यादा इस्तेमाल होने वाला तरीका डिफ़्यूज़न मॉडल है। किसी भाषा मॉडल की तरह, किसी तस्वीर बनाने वाले ने कोई असली दृश्य देखा नहीं होता जिसे वह उतार दे: वह अपने प्रशिक्षण-कॉर्पस के दृश्य नियमित रूपों से एक संभावित तस्वीर जोड़ देता है।
नमूना-चयन (सैंपलिंग)
वह काम जो मॉडल के निकाले संभावना-वितरण में से एक टोकन चुनता है, बजाय हमेशा सबसे संभावित लेने के। हमेशा सबसे संभावित चुनने से टेक्स्ट सपाट और दोहराव वाला बनता है; संभावनाओं के हिसाब से दाँव लगाने से, और ज़रूरत पड़ने पर तापमान, टॉप-k या टॉप-p से उसे कसने से, टेक्स्ट ज़्यादा स्वाभाविक बनता है।
न्यूरल नेटवर्क
आसान इकाइयों की परतों से बना एक हिसाब का ढाँचा, जिसमें हर इकाई अपने मिले हुए इनपुट को अपने ही पैरामीटर के साथ जोड़ती है। यह नाम जैविक न्यूरॉन से मिली एक दूर की प्रेरणा से आया है, पर नेटवर्क की कोई इकाई सोचती नहीं, ठीक जैसे कोई अकेला न्यूरॉन नहीं सोचता: प्रशिक्षण से पूरे ढाँचे का सधना ही एक काम का हिसाब बनाता है। ट्रांसफ़ॉर्मर इस तरह का वह ढाँचा है जो आज टेक्स्ट के लिए सबसे ज़्यादा इस्तेमाल होता है।
पूर्वाग्रह
एक व्यवस्थित झुकाव जिसे मॉडल दोहरा देता है, और जो उसे प्रशिक्षित करने वाले कॉर्पस के नियमित रूपों में सीखा गया होता है, कोई राय कभी नहीं जो उसने खुद बना ली हो। अगर डेटा किसी पेशे को किसी एक लिंग से ज़्यादा बार जोड़ता है, तो मॉडल वही जोड़ लौटा देगा, उसी मात्रा में। प्रतिनिधित्व का पूर्वाग्रह इसका एक खास रूप है: वह जो डेटा में जो कुछ ज़्यादा है उससे नहीं, बल्कि जो कुछ नहीं है उससे आता है।
पैरामीटर
मॉडल के भीतर की एक संख्या, जो प्रशिक्षण के दौरान सधती है और उसके हिसाब पर असर डालती है। इसे वेट भी कहा जाता है। किसी मॉडल में ये अरबों में होते हैं, और इनमें से कोई भी, अलग से लिया जाए, तो उसका ऐसा कोई अर्थ नहीं जो कोई व्यक्ति पढ़ सके: काम का हिसाब उनका पूरा जमावड़ा बनाता है, कोई अकेला पैरामीटर कभी नहीं।
प्रतिनिधित्व का पूर्वाग्रह
वह पूर्वाग्रह जो इस बात से आता है कि कोई समूह, कोई स्थिति या कोई भाषा प्रशिक्षण-डेटा में गैर-हाज़िर या कम-हाज़िर है, किसी बिगड़े हुए जोड़ से नहीं। तस्वीर से वर्गीकरण करने वाले एक सिस्टम में इसी तरह गहरे रंग की त्वचा वाली महिलाओं के लिए गलती की दर 34.7% तक पहुँची, जबकि हलके रंग की त्वचा वाले पुरुषों के लिए वह 0.8% थी, और यह फ़र्क़ प्रशिक्षण-डेटा की बनावट से जुड़ा था। जो डेटा में नहीं है, मॉडल उसे लौटा नहीं सकता: वह उसमें गलती नहीं करता, वह उसे जानता ही नहीं।
प्रशिक्षण
वह हिसाब, जो कहीं उपलब्ध कराने से पहले एक बार चलाया जाता है और किसी मॉडल के पैरामीटर इस तरह सधाता है कि वह अपने कॉर्पस के नियमित रूप बेहतर से बेहतर लौटाए। प्रशिक्षण पूरा होने पर ये पैरामीटर तय हो जाते हैं: उसके बाद उनसे कोई जवाब बनाना एक अलग काम है, अनुमान-गणना। कोई फ़ाइन-ट्यूनिंग एक दूसरा, छोटा प्रशिक्षण है, किसी तंग कॉर्पस पर।
प्रशिक्षण-डेटा का निष्कर्षण
मॉडल से पूछे गए किसी आम सवाल के ज़रिए वह हिस्सा हासिल कर लेना जो उसके प्रशिक्षण-कॉर्पस में शब्द दर शब्द मौजूद था। शोधकर्ताओं ने इसी तरह असल में उत्पादन में तैनात मॉडलों से एक साधारण तरीके से गीगाबाइटों में प्रशिक्षण-डेटा निकाल लिया। यह याद रख लेने का सबसे सीधा सबूत है: यह अब कोई सैद्धांतिक संभावना नहीं, यह एक बरामद किया गया टेक्स्ट है।
प्रॉम्प्ट
वह टेक्स्ट जो किसी मॉडल को जवाब पाने के लिए इनपुट में दिया जाता है। उसकी बनावट बदल देती है कि मॉडल क्या लौटाता है, क्योंकि वह अपनी आगे की कड़ी ठीक इसी टेक्स्ट से निकालता है, किसी दूसरे से नहीं। कोई प्रॉम्प्ट आम टेक्स्ट ही रहता है: वह किसी प्रोग्राम के अर्थ में कोई आदेश नहीं देता, वह एक संभावित हिसाब को दिशा देता है।
फ़ाइन-ट्यूनिंग
एक दूसरा प्रशिक्षण, छोटा और किसी तंग कॉर्पस पर चलाया गया, जो पहले से प्रशिक्षित किसी मॉडल को किसी तय काम या तय शैली के लिए सधा देता है। वह शून्य से शुरू करने के बजाय पहले प्रशिक्षण में मिले पैरामीटर से चलता है। फ़ाइन-ट्यून किया गया मॉडल एक भाषा मॉडल ही रहता है: उसके हिसाब की मशीनरी नहीं बदलती, सिर्फ़ उसके पैरामीटर थोड़ा खिसकते हैं।
बंद डिब्बा (ब्लैक बॉक्स)
वह सिस्टम जिसके जवाब देखे जा सकते हैं पर जिसका भीतरी तर्क पढ़ा नहीं जा सकता, उसे बनाने वाले के लिए भी नहीं। कोई भाषा मॉडल इस अर्थ में एक बंद डिब्बा है: उसके पैरामीटर, यानी प्रशिक्षण के दौरान सधाई गई अरबों संख्याएँ, अलग-अलग ऐसा कोई अर्थ नहीं रखतीं जिसे कोई व्यक्ति एक-एक पढ़ सके। इससे यह नहीं रुकता कि सिस्टम व्यवहार में क्या करता है उसे परखा जाए, सिर्फ़ यह नहीं समझाया जा सकता कि वह ठीक वैसा ही क्यों करता है।
भाषा मॉडल
टेक्स्ट पर प्रशिक्षित एक सिस्टम जो, पहले आ चुकी बात से, आगे बढ़ाने के लिए सबसे संभावित टोकन का हिसाब लगाता है। वह यह हिसाब टोकन दर टोकन दोहराकर एक पूरा जवाब जोड़ देता है। वह इस हिसाब के साथ-साथ तथ्यों का कोई डेटाबेस नहीं देखता: वह जो कुछ लौटाता है, सब उसी एक काम से आता है, चाहे बात किसी जाँचे हुए तथ्य की हो या किसी गढ़े हुए जवाब की।
मशीन लर्निंग
तरीकों का वह परिवार जहाँ कोई प्रोग्राम अपना बरताव उदाहरणों से सधाता है, बजाय हाथ से एक-एक लिखे नियमों पर चलने के। कोई भाषा मॉडल और कोई तस्वीर बनाने वाला इसके दो उपयोग हैं। डीप लर्निंग इसकी वह शाखा है जो आज सबसे ज़्यादा इस्तेमाल होती है।
मेटाडेटा
किसी फ़ाइल से जुड़ी वे जानकारियाँ जो खुद फ़ाइल के बारे में होती हैं, उसका मूल, उसके बनने की तारीख, उसमें हुए बदलाव, बजाय इसके कि वह क्या दिखाती है। उद्गम की जानकारी मेटाडेटा का एक प्रकार है। कोई मेटाडेटा एक साधारण स्क्रीनशॉट या किसी दूसरे फ़ॉर्मैट में सेव करने से गायब हो सकता है, और यही उसे सबूत के तौर पर कमज़ोर बना देता है।
याद रख लेना
यह बात कि कोई मॉडल अपने प्रशिक्षण-डेटा का कोई टुकड़ा शब्द दर शब्द लौटा सकता है, बजाय उसे अपने शब्दों में कहने के। यह परिघटना मॉडल के आकार के साथ, डेटा में एक ही सामग्री के दोहराव की संख्या के साथ, और आगे बढ़ाने को कहने से पहले संदर्भ में दिए गए टेक्स्ट की लंबाई के साथ बढ़ती है। किसी मॉडल में ऐसी कोई फ़ाइल नहीं होती जहाँ यह टेक्स्ट मिल जाए: उस सामग्री ने उसके पैरामीटर बदल दिए होते हैं, और यही बदलाव कुछ हालात में उसे लगभग जस का तस लौटा सकता है।
वॉटरमार्क
बनाई गई किसी सामग्री में जान-बूझकर रखा गया एक संकेत, आम इस्तेमाल में अदृश्य, जिसे इसके लिए बना कोई औज़ार ढूँढ़ सकता है। किसी टेक्स्ट में वह हर कदम पर कुछ शब्दों के प्रति एक हलकी सांख्यिकीय तरफ़दारी का रूप ले सकता है, ऐसी तरफ़दारी जो पढ़ने में दिखने के लिए बहुत महीन है पर हिसाब से पकड़ी जा सकती है, और यह तरीका पहले से प्रकाशित और सहकर्मी-समीक्षित है। किसी वॉटरमार्क के लिए यह ज़रूरी है कि जिस औज़ार ने उसे रखा, या कोई दूसरा जो उसका तरीका जानता है, उसे ढूँढ़ने के लिए अब भी मौजूद हो।
संदर्भ-खिड़की
टेक्स्ट की वह सबसे ज़्यादा मात्रा, टोकन में गिनी हुई, जिसे कोई मॉडल अपना जवाब निकालने के लिए एक बार में ध्यान में रख सकता है। इस खिड़की से पहले जो लिखा गया, वह चालू हिसाब में नहीं आता, ठीक जैसे वह कभी हुआ ही न हो। खिड़की से लंबे दस्तावेज़ को पूरा मॉडल को सौंपने से पहले काटना या छोटा करना पड़ता है।
संभावना-वितरण
किसी टेक्स्ट को आगे बढ़ाने के लिए मुमकिन टोकन की सूची, जिसमें हर एक के साथ शून्य और एक के बीच की एक संख्या होती है जो उसकी संभावना बताती है, और सबका जोड़ एक होता है। मॉडल यह सूची हर कदम पर निकालता है, फिर नमूना-चयन उसमें से एक टोकन चुन लेता है। तापमान, टॉप-k और टॉप-p इस सूची में दाँव लगाने से पहले उसे बदलने के तीन तरीके हैं।

इन बातों को काम करते देखिए

यह शब्दकोश शब्दावली तय करता है। समझें वाला कोर्स उसे अध्याय दर अध्याय बरतता है, और डेमो उसे चलाकर दिखाते हैं: वहाँ एक तापमान सेट किया जाता है, एक कॉर्पस बिगाड़ा जाता है, और एक वॉटरमार्क उभरते हुए देखा जाता है।

स्रोत

जो परिभाषाएँ कोई तय तथ्य कहती हैं, वे उसे यहाँ शब्द दर शब्द जोड़ देती हैं, हर एक परिभाषा को भारी किए बिना।