शब्दकोश
इस कोर्स में इस्तेमाल होने वाला हर शब्द, साफ़-साफ़ समझाया, और साथ में एक एंकर ताकि कोई अध्याय सीधे उस पर भेज सके।
इस क्षेत्र की रोज़मर्रा की शब्दावली गुमराह करती है, और यह जानना कि क्यों, इस कोर्स का हिस्सा है। इंसानी मन से उधार लिए शब्द, “समझना”, “जानना”, “सीखना”, “मतिभ्रम होना”, यहाँ एक हिसाब का ब्यौरा देते हैं, किसी भीतरी हालत का कभी नहीं। कोई भाषा मॉडल न कुछ समझता है, न कुछ जानता है, न कुछ सीखता है, उस अर्थ में जिसमें कोई व्यक्ति करता है: वह किसी कॉर्पस पर संख्या वाले पैरामीटर सेट करता है, और फिर इनपुट में मिले टेक्स्ट से एक संभावित आगे की कड़ी का हिसाब लगाता है। यह कहना कि वह “मतिभ्रम” करता है, किसी बीमारी का ब्यौरा नहीं देता: यह एक ऐसे नतीजे को नाम देता है जो संभावित और गलत है, और जो उसी हिसाब से निकलता है जिससे सही जवाब निकलता है। यह शब्दकोश इन शब्दों को इसलिए रखता है कि कोर्स और शोध इनका इस्तेमाल करते हैं, पर हर परिभाषा उन्हें उस हिसाब पर लौटा देती है जिसे वे असल में बताते हैं।
शब्द, वर्णक्रम में
हर प्रविष्टि पर एक एंकर है: कोर्स का कोई अध्याय सीधे उस पर भेज सकता है। किसी परिभाषा में लिंक किया हुआ शब्द इसी सूची में, ऊपर या नीचे, अपनी अलग प्रविष्टि रखता है।
- अनुमान-गणना (इन्फ़रेंस)
- वह हिसाब जो पहले से प्रशिक्षित किसी मॉडल से जवाब बनाता है, उस प्रशिक्षण से अलग जिसने उससे पहले उसके पैरामीटर तय किए थे। यही हर बार होता है जब किसी प्रॉम्प्ट को जवाब मिलता है: कोई पैरामीटर नहीं बदलता, सिर्फ़ पहले से तय मानों पर एक हिसाब चलता है।
- आत्मविश्वास
- किसी जवाब का भरोसे से भरा लहजा, चाहे वह सही हो या न हो। कोई मॉडल गढ़ते वक़्त अपना लहजा नहीं गिराता: उसकी बनावट में कुछ भी एक जाँचे हुए तथ्य को गढ़े हुए जवाब से अलग नहीं करता। इसलिए किसी जवाब का आत्मविश्वास उसकी सच्चाई का सबूत कभी नहीं होता।
- आर्टिफ़ैक्ट
- किसी तस्वीर या किसी आवाज़ की बनावट का छोड़ा हुआ निशान, जो आँख या कान को नहीं दिखता पर हिसाब से नापा जा सकता है। मिसाल के लिए, जो काम किसी तस्वीर को बनाते वक़्त उसे बड़ा करते हैं, वे एक नियमित छाप छोड़ जाते हैं, जो फ़ाइल की आवृत्तियों के ब्यौरे में पकड़ी जा सकती है। कोई आर्टिफ़ैक्ट बनाई गई तस्वीर पहचानने में मदद करता है, पर नए मॉडल इन्हें कम से कम छोड़ते हैं।
- आर्टिफिशियल इंटेलिजेंस साक्षरता
- वे सारी जानकारियाँ, कौशल और रवैये जिनसे किसी आर्टिफिशियल इंटेलिजेंस सिस्टम का इस्तेमाल किया जा सके, उससे सवाल किए जा सकें और, कुछ लोगों के लिए, उसे बनाया जा सके, बिना उस पर आँख मूँदकर टिके। 2026 में OECD और यूरोपीय आयोग का प्रकाशित एक साझा ढाँचा उसे योग्यताओं के चार क्षेत्रों में बताता है, जो प्राथमिक और माध्यमिक शिक्षा के लिए सोचे गए हैं। इस ढाँचे और उसे पूरा करने वाले अंतरराष्ट्रीय ढाँचों का ब्यौरा आधिकारिक ढाँचे पन्ने पर एक जगह है।
- आवाज़ की नकल (वॉइस क्लोनिंग)
- एक तकनीक जो किसी ऑडियो नमूने से किसी तय व्यक्ति की आवाज़ दोबारा बना देती है, ताकि उससे वह वाक्य कहलवाया जा सके जो उसने कभी नहीं कहा। एक अमेरिकी सरकारी प्राधिकरण ने एक असली अभियान दर्ज किया और उस पर कार्रवाई की, जिसमें चुनाव से पहले मतदाताओं के पास किसी राजनेता की नकल की गई आवाज़ भेजी गई थी। यह डीपफ़ेक का ही एक रूप है, जो खासकर आवाज़ पर लागू होता है।
- उद्गम (प्रोवेनेंस)
- किसी फ़ाइल के मूल और उसमें हुए बदलावों का जाँचा जा सकने वाला निशान, जो फ़ाइल के साथ जुड़ा रहता है, उसके कंटेंट में छिपा नहीं। एक सार्वजनिक तकनीकी मानक, C2PA, तय करता है कि यह जानकारी हस्ताक्षरित और जाँचे जा सकने वाले ढंग से कैसे जोड़ी जाए। मानक खुद मानता है कि यह जानकारी फ़ाइल से अलग हो सकती है, और इसलिए एक साधारण स्क्रीनशॉट पर खो जाती है: उद्गम मूल फ़ाइल को बचाता है, उसकी नकलों को नहीं।
- एम्बेडिंग
- किसी शब्द या किसी टोकन को संख्याओं की एक सूची के रूप में दिखाना, जो प्रशिक्षण के दौरान इस तरह बनाई जाती है कि पास-पास के संदर्भों में इस्तेमाल होने वाले दो शब्दों को पास-पास की सूचियाँ मिलें। आम टेक्स्ट के बड़े कॉर्पस पर सीखी गई एम्बेडिंग इस तरह नापे जा सकने वाले लैंगिक रूढ़िवाद दोहरा देती हैं, मिसाल के लिए कुछ पेशों को एक लिंग से दूसरे की तुलना में ज़्यादा जोड़कर। इसलिए कोई एम्बेडिंग खुद शब्दों के बारे में जितना कहती है, उतना ही अपने मूल कॉर्पस के बारे में भी।
- कॉर्पस
- टेक्स्ट, तस्वीरों या आवाज़ों का वह पूरा जमावड़ा जिस पर कोई मॉडल सीखता है, उसके नियमित रूपों का एकमात्र स्रोत। कोई डेटासेट एक तय इस्तेमाल के लिए व्यवस्थित और दर्ज किया गया कॉर्पस है; कॉर्पस शब्द उस काम से पहले की कच्ची सामग्री को कहता है। जो कॉर्पस में नहीं है, वह मॉडल के लिए किसी भी रूप में मौजूद नहीं: न किसी दुर्लभ चीज़ की तरह, न किसी गलत चीज़ की तरह।
- खुला स्रोत
- वह मॉडल जिसका कोड, जिसके पैरामीटर या दोनों प्रकाशित हैं, ताकि दूसरे उन्हें देख सकें, दोबारा इस्तेमाल कर सकें या जाँच सकें, बजाय सिर्फ़ किसी बंद सेवा के ज़रिए उन तक पहुँचने के। खुलापन अकेले प्रशिक्षण में इस्तेमाल हुए डेटा के बारे में कुछ नहीं कहता: कोई मॉडल अपने पैरामीटर प्रकाशित कर सकता है और अपना कॉर्पस कभी दर्ज न करे। इसलिए “खुला स्रोत” और “दर्ज किया गया डेटासेट” दो अलग गारंटियाँ रहती हैं, जो कम ही साथ मिलती हैं।
- गढ़ा हुआ जवाब (हैलुसिनेशन)
- एक गढ़ा हुआ जवाब, जो उतने ही आत्मविश्वास के साथ कहा जाता है जितने के साथ कोई सही जवाब। वह किसी भी दूसरे जवाब के उसी हिसाब से निकलता है: मॉडल के काम करने के ढंग में कुछ भी एक जाँचे हुए तथ्य को एक संभावित अटकल से अलग नहीं करता, और आज की प्रशिक्षण और मूल्यांकन की प्रक्रियाएँ अनिश्चितता मान लेने के बजाय एक संभावित जवाब को इनाम देती हैं। एक सैद्धांतिक काम यह दलील देता है कि इस तरह के मॉडल के लिए गढ़ने की एक दर गणितीय रूप से अटल होगी; यह नतीजा बहस के घेरे में है, और दूसरे काम इस पर सवाल उठाते हैं कि उसकी मान्यताएँ असल इस्तेमालों पर लागू होती हैं या नहीं।
- झूठा हाँ और झूठा नहीं
- वे दो तरीके जिनसे कोई डिटेक्टर गलती करता है: झूठा हाँ किसी इंसानी सामग्री पर मॉडल से बनी होने का आरोप लगाता है, झूठा नहीं मॉडल से बनी सामग्री को इंसानी बताकर जाने देता है। कई बहुत इस्तेमाल होने वाले टेक्स्ट डिटेक्टर इस तरह मूल अंग्रेज़ी न बोलने वालों के ज़्यादातर टेक्स्ट को गलती से मशीन-निर्मित बता देते हैं, जबकि मूल भाषा बोलने वालों के टेक्स्ट को वे ठीक-ठीक पहचानते हैं: यह झूठा हाँ संयोग से नहीं बँटता। जो औज़ार इन दो जोखिमों में से एक घटाना चाहता है, वह लगभग हमेशा दूसरा बढ़ा देता है।
- टोकन
- टेक्स्ट की वह सबसे छोटी इकाई जिसे कोई मॉडल संभालता है, अक्सर पूरे शब्द से छोटी। कोई दुर्लभ या अजाना शब्द तब पहले से जाने-पहचाने टुकड़ों से बने कई टोकन में बँट जाता है, जिससे उसे कभी वैसा देखे बिना भी संभाला जा सकता है। हर टोकन उसके बाद, किसी भी हिसाब से पहले, एक संख्या में बदल दिया जाता है: कोई मॉडल कभी अक्षर नहीं पढ़ता, वह संख्याएँ पढ़ता है।
- टोकनाइज़ेशन
- वह काम जो किसी भी हिसाब से पहले किसी टेक्स्ट को टोकन में बाँट देता है। आज सबसे ज़्यादा इस्तेमाल होने वाला तरीका मूल रूप से 1994 के एक डेटा-संपीड़न एल्गोरिद्म से आया है, जिसका बनते वक़्त भाषा से कोई नाता नहीं था। अलग-अलग भाषाओं में अनुवाद की गई एक ही सामग्री, भाषा के हिसाब से, पंद्रह गुना तक ज़्यादा टोकन माँग सकती है, जिससे कुछ भाषाएँ दूसरों से धीमी और महँगी पड़ती हैं।
- टॉप-k
- एक तरीका जो हर कदम पर दाँव को सबसे संभावित k टोकन तक सीमित कर देता है, जहाँ k पहले से तय एक संख्या है। सबसे कम संभावित टोकन इस तरह नमूना-चयन से पहले ही हटा दिए जाते हैं, जिससे कोई बहुत असंभव चुनाव नहीं होता और नतीजा पूरी तरह पहले से तय भी नहीं रहता।
- टॉप-p
- एक तरीका जो दाँव को टोकन के उस सबसे छोटे समूह तक सीमित करता है जिसकी जुड़ी हुई संभावनाएँ p तक पहुँच जाती हैं, बजाय टॉप-k की तरह टोकन की किसी तय संख्या तक। इसलिए यह समूह एक कदम से दूसरे कदम पर अपना आकार बदलता है: चौड़ा, जब कई शब्द संभावना में पास-पास रहते हैं; छोटा, जब एक शब्द बाकियों पर भारी पड़ता है। यह तरीका, जिसे न्यूक्लियस सैंपलिंग भी कहा जाता है, सबसे संभावित शब्द के हमेशा चुने जाने की जगह लेता है, जो सपाट और दोहराव वाला होता है।
- ट्रांसफ़ॉर्मर
- आज के भाषा मॉडलों के पीछे का न्यूरल नेटवर्क ढाँचा। किसी टेक्स्ट को सख़्त क्रम में टोकन दर टोकन पढ़ने के बजाय, यह संदर्भ-खिड़की के हर टोकन की तुलना बाकी सारे टोकन से एक ही बार में करता है, और उनकी अहमियत एक-दूसरे के मुक़ाबले तोलता है। एक साथ तुलना करने की यही मशीनरी है जिसने पहले से कहीं बड़े कॉर्पस पर मॉडल प्रशिक्षित करना मुमकिन किया।
- डिटेक्टर
- वह औज़ार जो यह बताने का दावा करता है कि कोई टेक्स्ट, कोई तस्वीर या कोई आवाज़ किसी मॉडल ने बनाई है या नहीं। चौदह टेक्स्ट डिटेक्टरों के एक स्वतंत्र मूल्यांकन में, जिनमें शिक्षा को बेचे जाने वाले व्यापारिक औज़ार भी थे, एक भी ऐसा नहीं मिला जो एक साथ भरोसेमंद और सटीक हो। कोई डिटेक्टर कभी फ़ैसला नहीं देता: ज़्यादा से ज़्यादा एक इशारा, जिसे कहीं और से मिलाना पड़ता है।
- डिफ़्यूज़न मॉडल
- एक तकनीक जो किसी तस्वीर को यादृच्छिक दृश्य शोर से शुरू करके बनाती है, और फिर उसे कदम-कदम हटाती जाती है जब तक एक संभावित तस्वीर उभर आए, और यह सब किसी टेक्स्ट ब्यौरे के निर्देश पर होता है। आज तस्वीर बनाने वालों के पीछे यही सबसे ज़्यादा इस्तेमाल होने वाला तरीका है। किसी भी बनी हुई तस्वीर की तरह, नतीजा एक ऐसा आर्टिफ़ैक्ट लिए चल सकता है जो उसकी बनावट खोल देता है, तब भी जब नंगी आँख को कुछ नहीं दिखता।
- डीप लर्निंग
- मशीन लर्निंग करने का एक ढंग, ऐसे न्यूरल नेटवर्क के साथ जो एक पर एक चढ़ी कई परतों से बना हो। हर परत पिछली से मिली जानकारी को थोड़ा और बदल देती है, जिससे वे नियमित रूप पकड़े जा सकते हैं जिन्हें हाथ से लिखा कोई नियम पकड़ न पाता। आज के भाषा मॉडलों और तस्वीर बनाने वालों के पीछे यही तकनीक है।
- डीपफ़ेक
- किसी मॉडल से बनाई या बदली गई कोई तस्वीर, कोई वीडियो या कोई आवाज़, जो ऐसी किसी घटना पर यकीन दिलाने के लिए हो जो कभी हुई ही नहीं। आवाज़ की नकल इसका ही एक रूप है, जो आवाज़ पर लागू होता है। इंसानी दर्शक अब नए बनाए गए चेहरे को असली चेहरे से भरोसेमंद ढंग से अलग नहीं कर पाते, और औसतन उसे ज़्यादा भरोसे लायक तक मानते हैं।
- डेटासेट
- एक तय इस्तेमाल के लिए व्यवस्थित और दर्ज किया गया कॉर्पस: उसकी बनावट, उसका मूल और उसे जुटाने का तरीका जाना हुआ होना चाहिए, सिर्फ़ उसका कंटेंट नहीं। इसके लिए 2018 से एक मानकीकृत दस्तावेज़ीकरण का प्रस्ताव मौजूद है, ताकि सामने आए किसी पूर्वाग्रह की जड़ तक पहुँचा जा सके, बजाय मॉडल तैनात होने के बाद उसका पता चलने के। जो डेटासेट दर्ज नहीं है, वह असल में एक कॉर्पस से ज़्यादा कुछ नहीं।
- तापमान
- एक सेटिंग जो मॉडल के निकाले संभावना-वितरण को नमूना-चयन से पहले नरम या सख़्त कर देती है। ज़्यादा तापमान मुमकिन शब्दों की संभावनाओं को एक-दूसरे के पास ले आता है, जिससे चुनाव कम पूर्वानुमेय हो जाते हैं; कम तापमान पहले से सबसे संभावित शब्द के पक्ष में फ़र्क़ और बढ़ा देता है। यह कोई भौतिक माप नहीं है: शब्द सांख्यिकीय भौतिकी के एक फ़ॉर्मूले से उधार लिया गया है, किसी असली गर्मी से इसका नाता नहीं।
- तस्वीर बनाने वाला (इमेज जनरेटर)
- वह सिस्टम जो टेक्स्ट में दिए ब्यौरे से एक नई तस्वीर बनाता है। आज इसके लिए सबसे ज़्यादा इस्तेमाल होने वाला तरीका डिफ़्यूज़न मॉडल है। किसी भाषा मॉडल की तरह, किसी तस्वीर बनाने वाले ने कोई असली दृश्य देखा नहीं होता जिसे वह उतार दे: वह अपने प्रशिक्षण-कॉर्पस के दृश्य नियमित रूपों से एक संभावित तस्वीर जोड़ देता है।
- नमूना-चयन (सैंपलिंग)
- वह काम जो मॉडल के निकाले संभावना-वितरण में से एक टोकन चुनता है, बजाय हमेशा सबसे संभावित लेने के। हमेशा सबसे संभावित चुनने से टेक्स्ट सपाट और दोहराव वाला बनता है; संभावनाओं के हिसाब से दाँव लगाने से, और ज़रूरत पड़ने पर तापमान, टॉप-k या टॉप-p से उसे कसने से, टेक्स्ट ज़्यादा स्वाभाविक बनता है।
- न्यूरल नेटवर्क
- आसान इकाइयों की परतों से बना एक हिसाब का ढाँचा, जिसमें हर इकाई अपने मिले हुए इनपुट को अपने ही पैरामीटर के साथ जोड़ती है। यह नाम जैविक न्यूरॉन से मिली एक दूर की प्रेरणा से आया है, पर नेटवर्क की कोई इकाई सोचती नहीं, ठीक जैसे कोई अकेला न्यूरॉन नहीं सोचता: प्रशिक्षण से पूरे ढाँचे का सधना ही एक काम का हिसाब बनाता है। ट्रांसफ़ॉर्मर इस तरह का वह ढाँचा है जो आज टेक्स्ट के लिए सबसे ज़्यादा इस्तेमाल होता है।
- पूर्वाग्रह
- एक व्यवस्थित झुकाव जिसे मॉडल दोहरा देता है, और जो उसे प्रशिक्षित करने वाले कॉर्पस के नियमित रूपों में सीखा गया होता है, कोई राय कभी नहीं जो उसने खुद बना ली हो। अगर डेटा किसी पेशे को किसी एक लिंग से ज़्यादा बार जोड़ता है, तो मॉडल वही जोड़ लौटा देगा, उसी मात्रा में। प्रतिनिधित्व का पूर्वाग्रह इसका एक खास रूप है: वह जो डेटा में जो कुछ ज़्यादा है उससे नहीं, बल्कि जो कुछ नहीं है उससे आता है।
- पैरामीटर
- मॉडल के भीतर की एक संख्या, जो प्रशिक्षण के दौरान सधती है और उसके हिसाब पर असर डालती है। इसे वेट भी कहा जाता है। किसी मॉडल में ये अरबों में होते हैं, और इनमें से कोई भी, अलग से लिया जाए, तो उसका ऐसा कोई अर्थ नहीं जो कोई व्यक्ति पढ़ सके: काम का हिसाब उनका पूरा जमावड़ा बनाता है, कोई अकेला पैरामीटर कभी नहीं।
- प्रतिनिधित्व का पूर्वाग्रह
- वह पूर्वाग्रह जो इस बात से आता है कि कोई समूह, कोई स्थिति या कोई भाषा प्रशिक्षण-डेटा में गैर-हाज़िर या कम-हाज़िर है, किसी बिगड़े हुए जोड़ से नहीं। तस्वीर से वर्गीकरण करने वाले एक सिस्टम में इसी तरह गहरे रंग की त्वचा वाली महिलाओं के लिए गलती की दर 34.7% तक पहुँची, जबकि हलके रंग की त्वचा वाले पुरुषों के लिए वह 0.8% थी, और यह फ़र्क़ प्रशिक्षण-डेटा की बनावट से जुड़ा था। जो डेटा में नहीं है, मॉडल उसे लौटा नहीं सकता: वह उसमें गलती नहीं करता, वह उसे जानता ही नहीं।
- प्रशिक्षण
- वह हिसाब, जो कहीं उपलब्ध कराने से पहले एक बार चलाया जाता है और किसी मॉडल के पैरामीटर इस तरह सधाता है कि वह अपने कॉर्पस के नियमित रूप बेहतर से बेहतर लौटाए। प्रशिक्षण पूरा होने पर ये पैरामीटर तय हो जाते हैं: उसके बाद उनसे कोई जवाब बनाना एक अलग काम है, अनुमान-गणना। कोई फ़ाइन-ट्यूनिंग एक दूसरा, छोटा प्रशिक्षण है, किसी तंग कॉर्पस पर।
- प्रशिक्षण-डेटा का निष्कर्षण
- मॉडल से पूछे गए किसी आम सवाल के ज़रिए वह हिस्सा हासिल कर लेना जो उसके प्रशिक्षण-कॉर्पस में शब्द दर शब्द मौजूद था। शोधकर्ताओं ने इसी तरह असल में उत्पादन में तैनात मॉडलों से एक साधारण तरीके से गीगाबाइटों में प्रशिक्षण-डेटा निकाल लिया। यह याद रख लेने का सबसे सीधा सबूत है: यह अब कोई सैद्धांतिक संभावना नहीं, यह एक बरामद किया गया टेक्स्ट है।
- प्रॉम्प्ट
- वह टेक्स्ट जो किसी मॉडल को जवाब पाने के लिए इनपुट में दिया जाता है। उसकी बनावट बदल देती है कि मॉडल क्या लौटाता है, क्योंकि वह अपनी आगे की कड़ी ठीक इसी टेक्स्ट से निकालता है, किसी दूसरे से नहीं। कोई प्रॉम्प्ट आम टेक्स्ट ही रहता है: वह किसी प्रोग्राम के अर्थ में कोई आदेश नहीं देता, वह एक संभावित हिसाब को दिशा देता है।
- फ़ाइन-ट्यूनिंग
- एक दूसरा प्रशिक्षण, छोटा और किसी तंग कॉर्पस पर चलाया गया, जो पहले से प्रशिक्षित किसी मॉडल को किसी तय काम या तय शैली के लिए सधा देता है। वह शून्य से शुरू करने के बजाय पहले प्रशिक्षण में मिले पैरामीटर से चलता है। फ़ाइन-ट्यून किया गया मॉडल एक भाषा मॉडल ही रहता है: उसके हिसाब की मशीनरी नहीं बदलती, सिर्फ़ उसके पैरामीटर थोड़ा खिसकते हैं।
- बंद डिब्बा (ब्लैक बॉक्स)
- वह सिस्टम जिसके जवाब देखे जा सकते हैं पर जिसका भीतरी तर्क पढ़ा नहीं जा सकता, उसे बनाने वाले के लिए भी नहीं। कोई भाषा मॉडल इस अर्थ में एक बंद डिब्बा है: उसके पैरामीटर, यानी प्रशिक्षण के दौरान सधाई गई अरबों संख्याएँ, अलग-अलग ऐसा कोई अर्थ नहीं रखतीं जिसे कोई व्यक्ति एक-एक पढ़ सके। इससे यह नहीं रुकता कि सिस्टम व्यवहार में क्या करता है उसे परखा जाए, सिर्फ़ यह नहीं समझाया जा सकता कि वह ठीक वैसा ही क्यों करता है।
- भाषा मॉडल
- टेक्स्ट पर प्रशिक्षित एक सिस्टम जो, पहले आ चुकी बात से, आगे बढ़ाने के लिए सबसे संभावित टोकन का हिसाब लगाता है। वह यह हिसाब टोकन दर टोकन दोहराकर एक पूरा जवाब जोड़ देता है। वह इस हिसाब के साथ-साथ तथ्यों का कोई डेटाबेस नहीं देखता: वह जो कुछ लौटाता है, सब उसी एक काम से आता है, चाहे बात किसी जाँचे हुए तथ्य की हो या किसी गढ़े हुए जवाब की।
- मशीन लर्निंग
- तरीकों का वह परिवार जहाँ कोई प्रोग्राम अपना बरताव उदाहरणों से सधाता है, बजाय हाथ से एक-एक लिखे नियमों पर चलने के। कोई भाषा मॉडल और कोई तस्वीर बनाने वाला इसके दो उपयोग हैं। डीप लर्निंग इसकी वह शाखा है जो आज सबसे ज़्यादा इस्तेमाल होती है।
- मेटाडेटा
- किसी फ़ाइल से जुड़ी वे जानकारियाँ जो खुद फ़ाइल के बारे में होती हैं, उसका मूल, उसके बनने की तारीख, उसमें हुए बदलाव, बजाय इसके कि वह क्या दिखाती है। उद्गम की जानकारी मेटाडेटा का एक प्रकार है। कोई मेटाडेटा एक साधारण स्क्रीनशॉट या किसी दूसरे फ़ॉर्मैट में सेव करने से गायब हो सकता है, और यही उसे सबूत के तौर पर कमज़ोर बना देता है।
- याद रख लेना
- यह बात कि कोई मॉडल अपने प्रशिक्षण-डेटा का कोई टुकड़ा शब्द दर शब्द लौटा सकता है, बजाय उसे अपने शब्दों में कहने के। यह परिघटना मॉडल के आकार के साथ, डेटा में एक ही सामग्री के दोहराव की संख्या के साथ, और आगे बढ़ाने को कहने से पहले संदर्भ में दिए गए टेक्स्ट की लंबाई के साथ बढ़ती है। किसी मॉडल में ऐसी कोई फ़ाइल नहीं होती जहाँ यह टेक्स्ट मिल जाए: उस सामग्री ने उसके पैरामीटर बदल दिए होते हैं, और यही बदलाव कुछ हालात में उसे लगभग जस का तस लौटा सकता है।
- वॉटरमार्क
- बनाई गई किसी सामग्री में जान-बूझकर रखा गया एक संकेत, आम इस्तेमाल में अदृश्य, जिसे इसके लिए बना कोई औज़ार ढूँढ़ सकता है। किसी टेक्स्ट में वह हर कदम पर कुछ शब्दों के प्रति एक हलकी सांख्यिकीय तरफ़दारी का रूप ले सकता है, ऐसी तरफ़दारी जो पढ़ने में दिखने के लिए बहुत महीन है पर हिसाब से पकड़ी जा सकती है, और यह तरीका पहले से प्रकाशित और सहकर्मी-समीक्षित है। किसी वॉटरमार्क के लिए यह ज़रूरी है कि जिस औज़ार ने उसे रखा, या कोई दूसरा जो उसका तरीका जानता है, उसे ढूँढ़ने के लिए अब भी मौजूद हो।
- संदर्भ-खिड़की
- टेक्स्ट की वह सबसे ज़्यादा मात्रा, टोकन में गिनी हुई, जिसे कोई मॉडल अपना जवाब निकालने के लिए एक बार में ध्यान में रख सकता है। इस खिड़की से पहले जो लिखा गया, वह चालू हिसाब में नहीं आता, ठीक जैसे वह कभी हुआ ही न हो। खिड़की से लंबे दस्तावेज़ को पूरा मॉडल को सौंपने से पहले काटना या छोटा करना पड़ता है।
- संभावना-वितरण
- किसी टेक्स्ट को आगे बढ़ाने के लिए मुमकिन टोकन की सूची, जिसमें हर एक के साथ शून्य और एक के बीच की एक संख्या होती है जो उसकी संभावना बताती है, और सबका जोड़ एक होता है। मॉडल यह सूची हर कदम पर निकालता है, फिर नमूना-चयन उसमें से एक टोकन चुन लेता है। तापमान, टॉप-k और टॉप-p इस सूची में दाँव लगाने से पहले उसे बदलने के तीन तरीके हैं।
इन बातों को काम करते देखिए
यह शब्दकोश शब्दावली तय करता है। समझें वाला कोर्स उसे अध्याय दर अध्याय बरतता है, और डेमो उसे चलाकर दिखाते हैं: वहाँ एक तापमान सेट किया जाता है, एक कॉर्पस बिगाड़ा जाता है, और एक वॉटरमार्क उभरते हुए देखा जाता है।
स्रोत
जो परिभाषाएँ कोई तय तथ्य कहती हैं, वे उसे यहाँ शब्द दर शब्द जोड़ देती हैं, हर एक परिभाषा को भारी किए बिना।
- Detecting and Simulating Artifacts in GAN Fake Images, Xu Zhang, Svebor Karaman, Shih-Fu Chang, 2019। आर्टिफ़ैक्ट। बनाई गई तस्वीरों में लगा ऊपर-नमूना करने वाला हिस्सा एक खास और दोहराया जा सकने वाला स्पेक्ट्रल निशान छोड़ जाता है।
- Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification, Joy Buolamwini, Timnit Gebru, 2018। प्रतिनिधित्व का पूर्वाग्रह। तस्वीर से लिंग वर्गीकरण करने वाले व्यापारिक सिस्टमों में गहरे रंग की त्वचा वाली महिलाओं के लिए गलती की दर 34.7% तक पहुँची, जबकि हलके रंग की त्वचा वाले पुरुषों के लिए वह 0.8% थी।
- FCC Makes AI-Generated Voices in Robocalls Illegal (FCC 24-17 वक्तव्य), Federal Communications Commission (FCC), 2024। आवाज़ की नकल। एक अमेरिकी सरकारी प्राधिकरण ने नकल की गई आवाज़ से ठगी का एक असली अभियान दर्ज किया और उस पर कार्रवाई की, जिसमें चुनाव से पहले किसी राजनेता की नकल की गई थी।
- Testing of detection tools for AI-generated text, Debora Weber-Wulff et al., 2023। डिटेक्टर। चौदह डिटेक्शन औज़ार आँके गए: कोई भी एक साथ भरोसेमंद और सटीक नहीं है।
- The Curious Case of Neural Text Degeneration, Ari Holtzman, Jan Buys, Li Du, Maxwell Forbes, Yejin Choi, 2020। नमूना-चयन और टॉप-p। हमेशा सबसे संभावित शब्द चुनने से टेक्स्ट सपाट और दोहराव वाला बनता है; न्यूक्लियस सैंपलिंग, जो वितरण का कम भरोसेमंद हिस्सा काट देती है, ज़्यादा स्वाभाविक टेक्स्ट बनाती है।
- Scalable Extraction of Training Data from (Production) Language Models, Milad Nasr et al., 2023। प्रशिक्षण-डेटा का निष्कर्षण। असल में उत्पादन में तैनात मॉडलों से एक साधारण हमले से गीगाबाइटों में प्रशिक्षण-डेटा निकाला गया।
- GPT detectors are biased against non-native English writers, Weixin Liang, Mert Yuksekgonul, Yining Mao, Eric Wu, James Zou, 2023। झूठा हाँ और झूठा नहीं। कई बहुत इस्तेमाल होने वाले डिटेक्टर मूल अंग्रेज़ी न बोलने वालों के ज़्यादातर टेक्स्ट को गलती से AI-निर्मित बता देते हैं, जबकि मूल भाषा बोलने वालों के टेक्स्ट को वे ठीक-ठीक पहचानते हैं।
- A Watermark for Large Language Models, John Kirchenbauer, Jonas Geiping, Yuxin Wen, Jonathan Katz, Ian Miers, Tom Goldstein, 2023। वॉटरमार्क। बनाए गए किसी टेक्स्ट में एक सांख्यिकीय वॉटरमार्क डाला जा सकता है, जो इंसानी आँख को नहीं दिखता और बाद में एक सांख्यिकीय जाँच से पकड़ा जा सकता है।
- Scalable watermarking for identifying large language model outputs, Sumanth Dathathri, Abigail See, Sumedh Ghaisas, Po-Sen Huang, Rob McAdam, Johannes Welbl, et al., 2024। वॉटरमार्क। टेक्स्ट बनाने की प्रक्रिया में जुड़ा एक सांख्यिकीय वॉटरमार्क Nature पत्रिका में प्रकाशित और सहकर्मी-समीक्षित हुआ।
- Why Language Models Hallucinate, Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, Edwin Zhang, 2025। गढ़ा हुआ जवाब। आज की प्रशिक्षण और मूल्यांकन की प्रक्रियाएँ अनिश्चितता मान लेने के बजाय एक संभावित जवाब बनाने को इनाम देती हैं।
- Hallucination is Inevitable: An Innate Limitation of Large Language Models, Ziwei Xu, Sanjay Jain, Mohan Kankanhalli, 2024। गढ़ा हुआ जवाब। बहस के घेरे में: यह काम दलील देता है कि इस तरह के मॉडल के लिए गढ़ने की एक दर गणितीय रूप से अटल है; बाद के काम इस पर सवाल उठाते हैं कि उसकी मान्यताएँ मॉडलों के असल और सीमित इस्तेमालों पर लागू होती हैं या नहीं।
- AI-synthesized faces are indistinguishable from real faces and more trustworthy, Sophie J. Nightingale, Hany Farid, 2022। डीपफ़ेक। इंसानी दर्शक बनाए गए चेहरे को असली चेहरे से भरोसेमंद ढंग से अलग नहीं कर पाते, और औसतन बनाए गए चेहरों को ज़्यादा भरोसे लायक तक मानते हैं।
- Datasheets for Datasets, Timnit Gebru, Jamie Morgenstern, Briana Vecchione, Jennifer Wortman Vaughan, Hanna Wallach, Hal Daumé III, Kate Crawford, 2018। डेटासेट। किसी डेटासेट का मूल, उसकी बनावट और उसे जुटाने का तरीका दर्ज करने के लिए एक मानकीकृत प्रस्ताव मौजूद है।
- Empowering Learners for the Age of AI: An AI Literacy Framework for Primary and Secondary Education (“AILit Framework”), OECD और यूरोपीय आयोग, 2026। आर्टिफिशियल इंटेलिजेंस साक्षरता। OECD और यूरोपीय आयोग का प्रकाशित साझा ढाँचा, प्राथमिक और माध्यमिक शिक्षा के लिए योग्यताओं के चार क्षेत्र।
- Quantifying Memorization Across Neural Language Models, Nicholas Carlini, Daphne Ippolito, Matthew Jagielski, Katherine Lee, Florian Tramer, Chiyuan Zhang, 2023। याद रख लेना। यह मॉडल के आकार, डेटा में किसी उदाहरण के दोहराव, और संदर्भ में दिए गए टेक्स्ट की लंबाई के साथ बढ़ती है।
- Man is to Computer Programmer as Woman is to Homemaker? Debiasing Word Embeddings, Tolga Bolukbasi, Kai-Wei Chang, James Zou, Venkatesh Saligrama, Adam Tauman Kalai, 2016। एम्बेडिंग। आम टेक्स्ट के बड़े कॉर्पस पर सीखी गई एम्बेडिंग नापे जा सकने वाले लैंगिक रूढ़िवाद दोहरा देती हैं।
- Content Credentials: C2PA Technical Specification (version 2.4), Coalition for Content Provenance and Authenticity (C2PA), 2026। उद्गम। एक सार्वजनिक तकनीकी मानक तय करता है कि किसी फ़ाइल से उसके मूल की जाँचे जा सकने वाली और हस्ताक्षरित जानकारी कैसे जोड़ी जाए।
- C2PA Frequently Asked Questions, Coalition for Content Provenance and Authenticity (C2PA), 2026। उद्गम। मानक खुद मानता है कि उसका मेनिफ़ेस्ट फ़ाइल से अलग हो सकता है, और इसलिए एक साधारण स्क्रीनशॉट पर खो जाता है।
- Distilling the Knowledge in a Neural Network, Geoffrey Hinton, Oriol Vinyals, Jeff Dean, 2015। तापमान। सॉफ़्टमैक्स फ़ॉर्मूले में तापमान का पैरामीटर मॉडल के निकाले संभावना-वितरण को नरम या सख़्त कर देता है।
- A New Algorithm for Data Compression, Philip Gage, 1994। टोकनाइज़ेशन। आज टोकनाइज़ेशन के लिए इस्तेमाल होने वाला एल्गोरिद्म मूल रूप से डेटा-संपीड़न की एक सामान्य विधि के तौर पर बनाया गया था, जिसका भाषा से कोई नाता नहीं था।
- Language Model Tokenizers Introduce Unfairness Between Languages, Aleksandar Petrov, Emanuele La Malfa, Philip H. S. Torr, Adel Bibi, 2023। टोकनाइज़ेशन। अलग-अलग भाषाओं में अनुवाद की गई एक ही सामग्री, भाषा के हिसाब से, पंद्रह गुना तक ज़्यादा टोकन माँग सकती है।
- Hierarchical Neural Story Generation, Angela Fan, Mike Lewis, Yann Dauphin, 2018। टॉप-k। टॉप-k नमूना-चयन, जो हर कदम पर दाँव को सबसे संभावित k शब्दों तक सीमित करता है, हमेशा एक ही तय चुनाव से ज़्यादा विविध टेक्स्ट बनाने के काम आता है।