यह कोर्स किस पर टिका है
The AI Manual में लगा हर आधिकारिक ढाँचा, हर वैज्ञानिक स्रोत, हर फ़ॉन्ट और हर कॉर्पस यहाँ दर्ज है, ऐसे पते के साथ जो खुलता है और जाँचा जा सकता है।
गलत श्रेय देना श्रेय न देने से बुरा होता। इस पन्ने का हर स्रोत यहाँ दर्ज करने से पहले अपने पते पर खोला गया था: यहाँ कुछ भी याद के भरोसे नहीं उतारा गया।
इस पन्ने पर
आधिकारिक ढाँचे
The AI Manual आर्टिफिशियल इंटेलिजेंस साक्षरता के चार ढाँचों को, जिनमें तीन अंतरराष्ट्रीय और एक राष्ट्रीय है, और उन दस्तावेज़ों को जो उन्हें साफ़ करते हैं या यूरोपीय कानून से जोड़ते हैं, एक रूप देता है। 13 अगस्त 2026 को ऑनलाइन जाँचे गए।
- Empowering Learners for the Age of AI: An AI Literacy Framework for Primary and Secondary Education (“AILit Framework”), OECD और यूरोपीय आयोग (DG शिक्षा / Digital Education Hub), CodeAI (पूर्व Code.org) के सहयोग से, 2026। ढाँचे का संदर्भ-पन्ना: प्राथमिक और माध्यमिक शिक्षा के लिए योग्यताओं के चार क्षेत्र और उन्नीस योग्यताएँ, 17 और 18 जून 2026 को प्रकाशित।
- Empowering Learners for the Age of AI (पूरी रिपोर्ट, PDF), OECD Publishing (पेरिस), यूरोपीय आयोग के साथ, 2026। वही ढाँचा, पूरी रिपोर्ट के रूप में, प्राथमिक और माध्यमिक शिक्षा के लिए कक्षा के उदाहरणों के साथ।
- AI Competency Framework for Students, UNESCO, 2024। विद्यार्थियों के लिए ढाँचा: तीन स्तरों में बारह योग्यताएँ, समझना, लागू करना, बनाना।
- AI Competency Framework for Teachers, UNESCO, 2024। शिक्षकों के लिए ढाँचा: पंद्रह योग्यताएँ, इस तरह का पहला वैश्विक ढाँचा।
- विनियम (EU) 2024/1689 (AI Act): समेकित पाठ, अनुच्छेद 4 “AI literacy”, यूरोपीय संघ, EUR-Lex, 2024, 27 जुलाई 2026 तक समेकित पाठ। आर्टिफिशियल इंटेलिजेंस साक्षरता की वह बाध्यता जो किसी सिस्टम के हर आपूर्तिकर्ता और हर तैनात करने वाले पर है, उसका जोखिम-स्तर कोई भी हो।
- विनियम (EU) 2026/1744, 8 जुलाई 2026 (“Digital Omnibus on AI”): अनुच्छेद 1(5), जो अनुच्छेद 4 में संशोधन करता है, यूरोपीय संघ, EUR-Lex, 2026। वह विनियम जिसने इस बाध्यता को नतीजे की बाध्यता से साधनों की बाध्यता बना दिया, 27 जुलाई 2026 से लागू।
- AI Literacy: Questions & Answers, यूरोपीय आयोग, AI Office, 2025, 27 जुलाई 2026 को ताज़ा किया गया। कोई नापी जाने वाली सीमा नहीं माँगी गई है: जितनी कोशिश की अपेक्षा है, वह उसे लागू करने वाले की भूमिका और जोखिम के अनुपात में है।
- AI4K12: Five Big Ideas in AI, AAAI और CSTA (Association for the Advancement of Artificial Intelligence / Computer Science Teachers Association), National Science Foundation के वित्तपोषण से (अनुदान DRL-1846073), 2018। एक अमेरिकी ढाँचा, इसलिए दिया गया कि यूरोपीय मॉड्यूल आधार के बगल में एक मॉड्यूल ही रहे, खुद आधार कभी न बने।
वैज्ञानिक और तकनीकी काम, विषय दर विषय
इस कोर्स का हर तकनीकी दावा एक ऐसा प्रकाशन साथ लिए चलता है जो 13 अगस्त 2026 को ऑनलाइन जाँचा गया, और जो यहाँ विषय के हिसाब से रखा गया है, एक अपठनीय लंबी सूची में नहीं। डेमो के पन्ने और ब्लॉग के लेख इसके अलावा अपने पन्ने के नीचे अपने विषय के प्रकाशन देते हैं।
टोकनाइज़ेशन
ये काम स्थापित करते हैं कि कोई टेक्स्ट शब्द से छोटी इकाइयों में कैसे बँटता है, और यह बँटवारा कुछ भाषाओं में दूसरों से महँगा क्यों पड़ता है।
- Neural Machine Translation of Rare Words with Subword Units, Rico Sennrich et al., 2016।
- A New Algorithm for Data Compression, Philip Gage, 1994।
- Language Model Tokenizers Introduce Unfairness Between Languages, Aleksandar Petrov et al., 2023।
अनुमान और नमूना-चयन
ये काम दिखाते हैं कि कोई मॉडल किसी संभावना-वितरण में से एक शब्द कैसे चुनता है, और तापमान तथा टॉप-k या टॉप-p की कटाई इस चुनाव को कैसे बदल देती है।
- The Curious Case of Neural Text Degeneration, Ari Holtzman et al., 2020।
- Distilling the Knowledge in a Neural Network, Geoffrey Hinton et al., 2015।
- Hierarchical Neural Story Generation, Angela Fan et al., 2018।
गढ़ा हुआ जवाब
ये काम समझाते हैं कि कोई मॉडल पूरे आत्मविश्वास के साथ क्यों गढ़ लेता है: यह उसके प्रशिक्षण और मूल्यांकन के ढंग का नतीजा है, कोई अलग-थलग खराबी नहीं।
- A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions, Lei Huang et al., 2023।
- Why Language Models Hallucinate, Adam Tauman Kalai et al., 2025।
- Hallucination is Inevitable: An Innate Limitation of Large Language Models, Ziwei Xu et al., 2024। बहस के घेरे में: यह काम दलील देता है कि सामान्य समस्या-समाधक की तरह इस्तेमाल होने वाले मॉडल के लिए गढ़ने की एक दर गणितीय रूप से अटल है; बाद के काम इस पर सवाल उठाते हैं कि उसकी औपचारिक मान्यताएँ मॉडलों के असल और सीमित इस्तेमालों पर लागू होती हैं या नहीं।
पूर्वाग्रह
ये काम नापते हैं कि प्रशिक्षण-कॉर्पस में मौजूद इंसानी पूर्वाग्रह उनसे निकले मॉडलों में, नापे जा सकने वाले रूप में, लौट आते हैं।
- Man is to Computer Programmer as Woman is to Homemaker? Debiasing Word Embeddings, Tolga Bolukbasi et al., 2016।
- Semantics derived automatically from language corpora contain human-like biases, Aylin Caliskan et al., 2017।
- Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification, Joy Buolamwini, Timnit Gebru, 2018।
- Datasheets for Datasets, Timnit Gebru et al., 2018।
डेटा का याद रख लेना
ये काम साबित करते हैं कि कोई मॉडल अपने प्रशिक्षण-डेटा के टुकड़े शब्द दर शब्द लौटा सकता है, जिनमें निजी जानकारी भी हो सकती है, और यह सिर्फ़ सवाल पूछकर होता है।
- Extracting Training Data from Large Language Models, Nicholas Carlini et al., 2021।
- Quantifying Memorization Across Neural Language Models, Nicholas Carlini et al., 2023।
- Scalable Extraction of Training Data from (Production) Language Models, Milad Nasr et al., 2023।
बनाई गई तस्वीर
ये काम उन तकनीकी निशानों को पहचानते हैं जो किसी बनाई गई तस्वीर को खोल देते हैं, और यह भी दर्ज करते हैं कि नए बनाए गए चेहरों में इंसानी आँख उन्हें नहीं देख पाती।
- Leveraging Frequency Analysis for Deep Fake Image Recognition, Joel Frank et al., 2020।
- Detecting and Simulating Artifacts in GAN Fake Images, Xu Zhang et al., 2019।
- AI-synthesized faces are indistinguishable from real faces and more trustworthy, Sophie J. Nightingale, Hany Farid, 2022।
बनाई गई आवाज़
ये काम बनाई गई आवाज़ की पहचान और उसकी सीमाओं की जगह तय करते हैं, और एक सरकारी प्राधिकरण नकल की गई आवाज़ के एक असली ठगी-इस्तेमाल को दर्ज करता है।
- WaveFake: A Data Set to Facilitate Audio Deepfake Detection, Joel Frank, Lea Schönherr, 2021।
- ASVspoof 2021: Towards Spoofed and Deepfake Speech Detection in the Wild, Xuechen Liu et al., 2021।
- FCC Makes AI-Generated Voices in Robocalls Illegal (FCC 24-17 वक्तव्य), Federal Communications Commission (FCC), 2024।
वॉटरमार्क और उद्गम
ये काम मूल के सबूत के दोनों परिवारों का ब्यौरा देते हैं, यानी फ़ाइल से जुड़ा एक मेनिफ़ेस्ट और बनाए गए टेक्स्ट में डाला गया एक सांख्यिकीय वॉटरमार्क, और दोनों की अपनी-अपनी सीमाएँ।
- Content Credentials: C2PA Technical Specification (version 2.4), Coalition for Content Provenance and Authenticity (C2PA), 2026।
- C2PA Frequently Asked Questions, Coalition for Content Provenance and Authenticity (C2PA), 2026। मानक खुद मानता है कि उद्गम का मेनिफ़ेस्ट फ़ाइल से अलग हो सकता है, और इसलिए एक साधारण स्क्रीनशॉट पर खो जाता है।
- A Watermark for Large Language Models, John Kirchenbauer et al., 2023।
- Scalable watermarking for identifying large language model outputs, Sumanth Dathathri et al., 2024। SynthID-Text, एक सांख्यिकीय वॉटरमार्क जो Nature पत्रिका में प्रकाशित और सहकर्मी-समीक्षित हुआ।
डिटेक्टर
ये काम दिखाते हैं कि AI से बने टेक्स्ट के डिटेक्टर गलती करते हैं, और उनमें अंग्रेज़ी के गैर-मूल बोलने वालों के खिलाफ़ एक दर्ज पूर्वाग्रह है, इस हद तक कि एक कंपनी ने अपना डिटेक्टर हटा लिया।
- GPT detectors are biased against non-native English writers, Weixin Liang et al., 2023।
- OpenAI scuttles AI-written text detector over 'low rate of accuracy', Devin Coldewey, TechCrunch, OpenAI के एक आधिकारिक परिशिष्ट के हवाले से, 2023।
- Testing of detection tools for AI-generated text, Debora Weber-Wulff et al., 2023।
भौतिक कीमत
ये काम तेज़ी से बढ़ती ऊर्जा खपत को आंकड़ों में रखते हैं, जो किसी खास सिस्टम को सौंपे गए बराबर के काम के मुक़ाबले बेतुकी है।
- Energy and AI, अंतरराष्ट्रीय ऊर्जा एजेंसी (International Energy Agency, IEA), 2025।
- Power Hungry Processing: Watts Driving the Cost of AI Deployment?, Alexandra Sasha Luccioni et al., 2024।
फ़ॉन्ट
सिस्टम के दोनों फ़ॉन्ट woff2 रूप में site/assets/css/fonts/ में भीतर ही रखे हैं: किसी फ़ॉन्ट सेवा को कोई रिक्वेस्ट नहीं, कोई CDN नहीं। उनका लाइसेंस 14 अगस्त 2026 को उसी फ़ाइल के पते पर दोबारा पढ़ा गया जो उसे लिए चलती है।
- Source Serif 4, SIL Open Font License, version 1.1, Adobe, 2014 से 2023, आरक्षित नाम “Source”। भीतर रखे woff2 फ़ॉन्ट, वेट 500 और 600, इटैलिक 400: ये साइट के शीर्षक उठाते हैं।
- Public Sans, SIL Open Font License, version 1.1, The Public Sans Project Authors, 2015। भीतर रखे woff2 फ़ॉन्ट, वेट 400, 600 और 700, इटैलिक 400: ये मुख्य टेक्स्ट उठाते हैं। यह अमेरिकी लोक-सेवा डिज़ाइन सिस्टम USWDS का फ़ॉन्ट है।
SIL Open Font License दोनों फ़ॉन्ट के इस्तेमाल, बदलाव और आगे बाँटने की इजाज़त देता है, बस दो शर्तों पर: उन्हें अलग से बेचा न जाए, और लाइसेंस उनके साथ बना रहे।
डेमो के कॉर्पस
डेमो में किसी बाहरी लेखक की सिर्फ़ एक ही रचना भीतर रखी गई है, और वह सार्वजनिक डोमेन में है। दो और टेक्स्ट पूरी तरह ODERSA के ही हैं: एक यह तुलना करने के काम आता है कि एक ही सामग्री भाषा के हिसाब से कितनी बदलती है, और दूसरा यह दिखाने के काम आता है कि किसी कॉर्पस की बनावट किसी मॉडल को कैसे एक तरफ़ झुका देती है।
सार्वजनिक डोमेन का एक टेक्स्ट
Le Tour du monde en quatre-vingts jours (“अस्सी दिन में दुनिया की सैर”), Jules Verne, 1873। सार्वजनिक डोमेन: Jules Verne का निधन 24 मार्च 1905 को हुआ, और उनकी फ़्रेंच रचना हर जगह बहुत पहले से कॉपीराइट-मुक्त है। इस उपन्यास के पहले 623 अनुच्छेद, यानी लगभग 25,288 शब्द, वह कॉर्पस बनाते हैं जिस पर इस कोर्स का खिलौना मॉडल प्रशिक्षित होता है। जो थोड़े बदलाव किए गए, वे सब पलटे जा सकने वाले हैं और कॉर्पस की फ़ाइल में दर्ज हैं, और सिर्फ़ टाइपोग्राफ़ी के हैं: एपोस्ट्रोफ़ टाइपोग्राफ़िक कर दिए गए, प्रतिलिपि के डैश और उद्धरण-चिह्न हटा दिए गए, इटैलिक के निशान हटा दिए गए, और अध्याय-शीर्षक तथा विषय-सूची अलग रख दी गई। जिस मॉडल ने 1873 के इस टेक्स्ट के सिवा कुछ नहीं पढ़ा, वह उसके बाद हुई किसी बात के बारे में कुछ नहीं जान सकता: डेमो ठीक यही सामने रखता है।
घर का एक टेक्स्ट
वही एक वाक्य, उन 7 भाषाओं में जिन्हें ODERSA का बेड़ा परोसने की तैयारी में है, यह तुलना करने के काम आता है कि एक ही अर्थ भाषा के हिसाब से कितनी इकाइयाँ माँगता है। यह टेक्स्ट खुद ODERSA के भरोसे के बैनर का है, जो पहले से CC BY 4.0 लाइसेंस के तहत प्रकाशित है: यह किसी बाहरी लेखक का कॉर्पस नहीं है, और इसलिए इस पर अधिकारों का कोई सवाल नहीं उठता।
आपकी आँखों के सामने बनता एक कॉर्पस
पूर्वाग्रह कहाँ से आते हैं, इस पर बना डेमो कोई टेक्स्ट कहीं से उधार नहीं लेता: वह अपना कॉर्पस खुद बनाता है, दो नमूना वाक्यों, आठ पेशों के नाम और आठ शहरों के नाम से। उसकी बनावट आप तय करते हैं, और यही इस पन्ने का पूरा मक़सद है: कोई मॉडल वह नहीं लौटा सकता जो उसने कभी पढ़ा ही नहीं। यह कॉर्पस फ़्रेंच में लिखा है, ठीक 1873 के उपन्यास की तरह, और अनुवाद वाले छह पन्नों में से हर एक यह बात अपनी भाषा में कहता है। यह ODERSA का ही है: यह किसी बाहरी लेखक का कॉर्पस नहीं है, और इसलिए इस पर अधिकारों का कोई सवाल नहीं उठता।
वह इंजन जो इन डेमो को चलाता है, इन कॉर्पस में से चुनाव करता है और संभावनाओं का हिसाब लगाता है, ODERSA का लिखा कोड है: यह किसी बाहरी लाइब्रेरी का नहीं है, और यह साइट कोई बाहरी लाइब्रेरी भीतर नहीं रखती।
चित्र
इस साइट का हर चित्र ODERSA का हाथ से बनाया SVG है, जिसमें कोई तस्वीर नहीं और किसी तीसरे डोमेन से मँगाई गई कोई इमेज नहीं। हर एक बाकी साइट की तरह CC BY 4.0 लाइसेंस के तहत दोबारा इस्तेमाल किया जा सकता है, और उसका कैप्शन यही बात लिए चलता है।
यही चीज़ भरोसे के बैनर को यह वादा करने देती है कि इस साइट को खोलने वाले डिवाइस से कोई रिक्वेस्ट बाहर नहीं जाती: कोई तस्वीर, कोई फ़ॉन्ट और कोई स्क्रिप्ट दूर से नहीं मँगाई जाती।
तस्वीरें
The AI Manual की हर तस्वीर एक तय पन्ने को सजाती है, और इमेज के नीचे उसका कैप्शन उसके लेखक का नाम पहले से लिए चलता है। यह तालिका हर तस्वीर को उसके पूरे लाइसेंस, Wikimedia Commons पर उसे साबित करने वाले पते, और उसे परोसने वाले पन्ने के साथ एक जगह रखती है।
| वह क्या दिखाती है | लेखक | लाइसेंस | Wikimedia Commons पर सबूत | कहाँ परोसी गई |
|---|---|---|---|---|
| बैकलिट कीबोर्ड वाला एक लैपटॉप, ज़्यादातर उँगलियाँ होम रो पर टिकी हैं, U कुंजी दबी हुई है | Colin | CC BY-SA 4.0 | फ़ाइल का पन्ना | होम |
| पेरिस की Sainte-Geneviève लाइब्रेरी का वाचनालय, उसकी लंबी मेज़ें और मेहराब के नीचे उसकी अलमारियाँ | JOHN TOWNER heytowner | CC0 | फ़ाइल का पन्ना | पूर्वाग्रह कहाँ से आते हैं |
| एक तकनीकी कमरा जहाँ पैच पैनल में लगी दर्जनों नेटवर्क केबल एक जगह मिलती हैं | Brian Hankins (Bhankins) | Public domain | फ़ाइल का पन्ना | हम उसे क्या देते हैं |
| फ़ुटबॉल के मैदान के किनारे उकड़ूँ बैठा एक फ़ोटोग्राफ़र, हाथ में एक लंबा टेलीफ़ोटो लेंस | Ximeg | CC BY-SA 3.0 | फ़ाइल का पन्ना | बनाई गई तस्वीर |
| एक रिकॉर्डिंग स्टूडियो में, ड्रम सेट के चारों तरफ़ स्टैंड पर लगे कई माइक्रोफ़ोन | dan paluska | CC BY 2.0 | फ़ाइल का पन्ना | बनाई गई आवाज़ |
| एक खाली व्याख्यान-कक्ष, उसकी सीटों और लिखने की तख्तियों की कतारें कमरे के पिछले हिस्से से दिखती हैं | Yinan Chen | Public Domain | फ़ाइल का पन्ना | पढ़ाने के लिए |
इनमें से दो तस्वीरें, होम वाला कीबोर्ड और बनाई गई तस्वीर वाले पन्ने का फ़ोटोग्राफ़र, एक ही शर्त पर साझा करने वाले लाइसेंस CC BY-SA के तहत हैं। The AI Manual का टेक्स्ट CC BY 4.0 के तहत है, जैसा लाइसेंस बताता है; ये दो तस्वीरें अपना ही लाइसेंस रखती हैं, वे उस पर नहीं चली जातीं। इन्हें लिए चलने वाला पन्ना लेने पर तस्वीर को उसी शर्त वाले लाइसेंस के तहत, उसके श्रेय के साथ, आगे बाँटना पड़ता है, बाकी साइट की शर्तों के तहत नहीं।
इस पन्ने की सारी तस्वीरें इसी भंडार में रखी हैं और साइट के ही डोमेन से परोसी जाती हैं, किसी बाहरी पते से कभी नहीं मँगाई जातीं, ठीक फ़ॉन्ट और चित्रों की तरह। यही चीज़ भरोसे के बैनर को यह वादा करने देती है कि इस साइट को खोलने वाले डिवाइस से कोई रिक्वेस्ट बाहर नहीं जाती।
यह साइट किसी और की क्या उधार नहीं रखती
- कोई निर्भरता नहीं: किसी बाहरी लाइब्रेरी से कोड की एक लाइन भी नहीं ली गई।
- कोई CDN नहीं: फ़ॉन्ट, स्क्रिप्ट और तस्वीरें, सब इसी भंडार में हैं।
- किसी आर्टिफिशियल इंटेलिजेंस सेवा को कोई कॉल नहीं: डेमो निश्चित नतीजे देते हैं, वे पूरी तरह उसी डिवाइस पर चलते हैं जो उन्हें खोलता है।
- इन पन्नों में कोई मापने वाला औज़ार नहीं, कोई कुकी नहीं, कोई खाता नहीं: कुछ भी नहीं जो बताए कि यह पन्ना कौन खोल रहा है।
यह कुछ सेकंड में जाँचा जा सकता है, ब्राउज़र के Network टैब में, पन्ना लोड होते वक़्त: उससे कोई रिक्वेस्ट बाहर नहीं जाती।
ये क्रेडिट कैसे बनाए रखे जाते हैं
कोई पुराना पड़ चुका स्रोत, कोई पता जो बदल गया, कोई गलत लगा श्रेय: यह सब बताया जा सकता है, बिना खाते और बिना फ़ॉर्म। इस साइट के दोबारा इस्तेमाल की शर्तें लाइसेंस में बताई गई हैं।