यह ODERSA की एक आधिकारिक वेबसाइट है। यह कैसे जानें

आधिकारिक डोमेन

इस साइट का पता odersa.org पर खत्म होता है। संस्था की हर सेवा odersa.org के किसी उपडोमेन पर ही होती है, और कहीं नहीं। अगर आपके ब्राउज़र की पता-पट्टी में दिख रहा पता odersa.org पर खत्म नहीं होता, तो यह साइट हमारी नहीं है।

मुफ़्त, और बिना खाते

सब कुछ पहले पल से खुला है: कोई रजिस्ट्रेशन नहीं, कोई खाता नहीं, कोई पासवर्ड नहीं, कोई सब्सक्रिप्शन नहीं, कोई विज्ञापन नहीं। पैसे देने वालों के लिए अलग से कुछ नहीं रखा गया, क्योंकि यहाँ कुछ भी पैसे से नहीं मिलता।

कोई डेटा इकट्ठा नहीं

यह साइट आपका पीछा नहीं करती: न कोई ट्रैकर, न कोई ट्रैकिंग कुकी, न इन पन्नों में जड़ा कोई मापने वाला औज़ार, और न आपके उपकरण पर कुछ मापा जाता है। हमारा होस्ट अनुरोधों की गिनती कुल जोड़ के रूप में रखता है, जैसा जवाब देने वाला हर सर्वर रखता है: एक कुल योग, कभी कोई प्रोफ़ाइल नहीं। हमारी बात मान लेने की ज़रूरत नहीं: अपने ब्राउज़र के डेवलपर टूल खोलिए, Network टैब में जाइए, और पन्ना दोबारा लोड कीजिए। साइट जो कुछ माँगती है, उसकी पूरी सूची आपके सामने आ जाएगी। सब कुछ odersa.org से आता है, कुछ भी कहीं और नहीं जाता।

खुला कंटेंट

कंटेंट CC BY 4.0 लाइसेंस के तहत प्रकाशित है। आप इसे कॉपी कर सकते हैं, अनुवाद कर सकते हैं, छाप सकते हैं और आगे बाँट सकते हैं, अपनी कक्षा के लिए भी और अपने घर-परिवार के लिए भी। बस एक शर्त: ODERSA का नाम दें।

हम उसे क्या देते हैं, और वह उसका क्या लौटा सकता है

किसी आर्टिफिशियल इंटेलिजेंस सेवा में कोई टेक्स्ट, कोई तस्वीर या कोई फ़ाइल डालने से चार अलग-अलग चीज़ें शुरू होती हैं, जिन्हें इस्तेमाल की शर्तें अक्सर एक ही वाक्य में समेट देती हैं। यह अध्याय उन्हें अलग करता है, क्योंकि हर एक का जोखिम एक जैसा नहीं है।

एक तकनीकी कमरा जहाँ पैच पैनल में लगी दर्जनों नेटवर्क केबल एक जगह मिलती हैं
किसी ऑनलाइन सेवा में हम जो डालते हैं, वह केबलों से होकर उन मशीनों तक जाता है जो हमारी नहीं हैं। फ़ोटोग्राफ़: Brian Hankins (Bhankins), फ़ाइल पृष्ठ, लाइसेंस Public domain.

“क्या आर्टिफिशियल इंटेलिजेंस मेरी जासूसी करती है?” यह सवाल जाँचा नहीं जा सकता: वह इतना अस्पष्ट है कि उसका कोई जवाब सही या गलत नहीं ठहरता। जो सवाल जाँचा जा सकता है, वह इससे तंग है। मैंने अभी जो डाला, वह किसी दिन किसी और के सामने बाहर आ सकता है? इस सवाल का एक नापा हुआ जवाब है, और वह चार कामों पर टिका है जिन्हें पहले अलग करना पड़ता है।

“देना” किन चार चीज़ों को एक साथ समेट लेता है

एक ही फ़ाइल डालने से चार तक काम शुरू हो जाते हैं। उनका न अनिवार्य होना एक जैसा है, न उनके नतीजे।

अभी जवाब देने के लिए पढ़ना
सामग्री इकाइयों में बाँटी जाती है और मॉडल के संदर्भ में रखी जाती है, जहाँ से वह अपना जवाब निकालता है। यह काम टाला नहीं जा सकता: सेवा से माँगा भी यही जाता है। यह जवाब के साथ ही खत्म हो जाता है।
सेवा के सर्वरों पर सहेजना
सामग्री और जवाब दर्ज कर लिए जाते हैं, बातचीत का इतिहास रखने के लिए, शिकायतों को निपटाने के लिए, निगरानी के लिए। कितने वक़्त तक सहेजा जाएगा, यह सेवा का फ़ैसला है, मॉडल का गुण नहीं।
इस सामग्री को दूसरों के साथ लेकर दोबारा प्रशिक्षण
सामग्री उस भंडार में शामिल हो जाती है जो मॉडल का अगला संस्करण प्रशिक्षित करने के काम आएगा। यहीं से फ़ाइल डालना एक लेन-देन नहीं रह जाता और एक टिकाऊ योगदान बन जाता है, अक्सर बिना यह कि उस व्यक्ति ने ऐसा चाहा हो।
बाद में, किसी और को लौटाना
किसी सामग्री पर प्रशिक्षित मॉडल उसे किसी दूसरे व्यक्ति के पूछे आम सवाल के जवाब में शब्द दर शब्द दोहरा सकता है। यह कोई अनुमान नहीं: यह नीचे दिए कामों का नापा हुआ नतीजा है।

पहले दो काम सेवा की नीति से जुड़े हैं, जिसे पढ़ा और तुलना किया जा सकता है। आखिरी दो एक मॉडल के काम करने के ढंग से जुड़े हैं, और यही यह अध्याय समझाता है।

एक मॉडल याद रखता है, और यह नापा जा सकता है

किसी मॉडल में ऐसा कोई डेटाबेस नहीं होता जहाँ उसके पढ़े हुए टेक्स्ट मिल जाएं। उसका प्रशिक्षण-डेटा उसके भीतर कहीं रखा नहीं होता: उसने उसके पैरामीटर बदल दिए होते हैं। इसीलिए “याद” शब्द गुमराह करता है। फिर भी पूरे-पूरे हिस्से बाहर आते हैं, और शोध जानता है कि किन हालात में।

2021 में Nicholas Carlini की अगुवाई वाली एक टीम एक भाषा मॉडल से सैकड़ों ऐसी कतारें निकाल लेती है जो उसके प्रशिक्षण-डेटा से शब्द दर शब्द दोहराई गई थीं, जिनमें पहचान बताने वाली निजी जानकारी भी थी। इस तरीके में कोई चोर-रास्ता नहीं है: ये आम सवाल हैं। मिली हुई कुछ कतारें मूल डेटा में सिर्फ़ एक ही बार आई थीं।

2023 में एक दूसरा अध्ययन नापता है कि यह परिघटना किन वजहों से बढ़ती है। तीन कारक, हर एक अलग से स्थापित।

  1. मॉडल का आकार। उसके पैरामीटर जितने ज़्यादा, उतना ही ज़्यादा वह याद रखता है।
  2. डेटा में किसी उदाहरण का दोहराव। कई बार मौजूद सामग्री एक बार मौजूद सामग्री से ज़्यादा आसानी से बाहर आती है।
  3. आगे बढ़ाने को कहने से पहले संदर्भ में दिए गए टेक्स्ट की लंबाई। शुरुआती टुकड़ा जितना लंबा, लौटाए जाने की संभावना उतनी ज़्यादा।

इस मोड़ पर एक आपत्ति खुली रहती है: ये प्रयोग शायद प्रयोगशाला के मॉडलों पर हैं, असल में इस्तेमाल हो रही किसी सेवा से इनका कोई नाता नहीं। उसी साल का एक तीसरा अध्ययन इसका जवाब देता है, और उन मॉडलों को निशाना बनाता है जो पहले से उत्पादन में तैनात हैं, जिनमें एक आम जनता वाला मॉडल भी है जिसके जवाबों पर पहरा है, और सिर्फ़ सवाल पूछकर उनसे गीगाबाइटों में प्रशिक्षण-डेटा निकाल लेता है। मॉडल पर लगा पहरा यह जोखिम घटाता है। वह उसे खत्म नहीं करता।

ये काम एक ऐसे लौटाए जाने को नापते हैं जो बाद में, किसी तीसरे के सामने मुमकिन है। वे यह दर्ज नहीं करते कि आप लिखते वक़्त जो पढ़ा जा रहा है, वह उसी पल किसी को भेजा जा रहा है। दोनों को मिला देने पर यहाँ की एक ही काम की चीज़ हाथ से निकल जाती है, यानी यह जानना कि कौन सा जोखिम किस पल उठाया जा रहा है।

कोई सेवा असल में क्या कह रही है, यह पढ़ना

इस्तेमाल की नीति तीन खास वाक्य-रूप खोजकर पढ़ी जाती है, गंभीरता का कोई सामान्य आभास देखकर नहीं।

वाक्य किस बात को ढँक लेता है

“अपनी सेवाओं को बेहतर बनाने के लिए” वह वाक्य है जो सबसे अक्सर दोबारा प्रशिक्षण को ढँक लेता है, उसका नाम लिए बिना। वह न झूठा है, न जानकारी देने वाला। काम का टेक्स्ट उसकी जगह यह बताता है कि सामग्री का क्या किया जाता है, और किसके द्वारा।

विकल्प, और उसकी खामी

दोबारा प्रशिक्षण से इनकार का रास्ता कभी होता है, और उसका रूप उसके होने से ज़्यादा मायने रखता है। जो इनकार डिफ़ॉल्ट रूप से लागू होता है, वह सबको बचाता है। जो इनकार किसी सेटिंग में ढूँढ़ने जाना पड़ता है, वह सिर्फ़ उन लोगों को बचाता है जिन्हें पता है कि वह वहाँ है, यानी लगभग किसी को नहीं। नीति उसके डिफ़ॉल्ट से आँकी जाती है, उसके विकल्पों से नहीं।

अवधि, और उसके बाद जो बचा रहता है

सहेजने की अवधि पहले से प्रशिक्षित मॉडल के बारे में कुछ नहीं कहती। कोई बातचीत मिटाने से किसी सर्वर से एक दर्ज प्रविष्टि हटती है; इससे मॉडल में से वह नहीं हटता जो उस सामग्री ने उसके भीतर पहले ही बदल दिया है। प्रशिक्षित मॉडल किसी खाते के मिटने से किसी सामग्री का प्रशिक्षण नहीं भूलता।

कोई फ़ाइल डालने से पहले

तीन सवाल, इसी क्रम में। इनमें से किसी एक का जवाब न मिलना अपने आप में एक जवाब है।

  1. क्या यह सेवा साफ़-साफ़ और बिना लपेटे वाले वाक्य के बताती है कि डाली गई सामग्री किस काम आती है?
  2. दोबारा प्रशिक्षण से इनकार डिफ़ॉल्ट व्यवहार है, या ढूँढ़ने जाने वाली एक सेटिंग?
  3. क्या यह सामग्री किसी और की है? कोई दफ़्तरी फ़ाइल, किसी विद्यार्थी का होमवर्क, कोई मेडिकल दस्तावेज़, परिवार की कोई तस्वीर, ये उन लोगों को शामिल कर लेती हैं जिन्होंने कुछ भी मंज़ूर नहीं किया।

यह आखिरी बात सबसे अक्सर भुलाई जाती है, और यही एक ऐसी है जो सुधरती नहीं। अपने लिए शर्तें मंज़ूर करना एक चुनाव है। किसी गैर-हाज़िर तीसरे के लिए उन्हें मंज़ूर करना चुनाव नहीं है।

क्या डाला जाता है, क्या नहीं

कोई सार्वभौमिक सूची नहीं है, क्योंकि जोखिम दाँव पर लगी चीज़ पर टिका है। यह बाँट उस सेवा के लिए ठीक है जिसकी दोबारा प्रशिक्षण की नीति साफ़ नहीं है।

  • कोई टेक्स्ट जो पहले से सार्वजनिक है, या होने ही वाला है।
  • कोई सामग्री जिससे सिर्फ़ आप जुड़े हैं और जिसके सामने आने से आपका कुछ नहीं बिगड़ता।
  • कोई दोबारा गढ़ा गया उदाहरण, जिसमें नाम, तारीखें और रकमें डालने से पहले बदल दी गई हैं।
  • कोई लॉगिन, कोई पासवर्ड, कोई की, कोई एक्सेस टोकन।
  • कोई सेहत का ब्यौरा, कोई पहचान-पत्र, कोई बैंक विवरण।
  • कोई दस्तावेज़ जो पेशेवर गोपनीयता के दायरे में है, गोपनीयता की शर्त वाला कोई करार, मानव संसाधन की कोई फ़ाइल।
  • किसी नाबालिग का काम, जो स्कूल के दायरे में सौंपा गया है।
  • कोई सामग्री जिसे डालने से कोई ऐसा व्यक्ति शामिल हो जाता है जिसने आपसे कुछ नहीं कहा।

याद रखने लायक आदत

भेजने से पहले बदल दीजिए। किसी मॉडल के ज़्यादातर दफ़्तरी इस्तेमालों को असली नाम, असली तारीखें या असली रकमें नहीं चाहिए: उन्हें समस्या का ढाँचा चाहिए। बदली हुई जानकारी के साथ फिर से लिखी गई फ़ाइल वही मदद पाती है और भंडार में कुछ नहीं जोड़ती। इस अध्याय की यही एक आदत है जो किसी भी सेवा की नीति पर निर्भर नहीं करती।

आगे पढ़ने के लिए

वह मशीनरी जिसकी वजह से एक मॉडल कुछ न जानते हुए भी जवाब देता है, वह क्यों गढ़ लेता है अध्याय में ली गई है। डेटा की बनावट और उसके असर पूर्वाग्रह कहाँ से आते हैं अध्याय में लिए गए हैं। जिन हालात में यह औज़ार बंद हो जाता है, वे कब इस्तेमाल न करें में एक जगह हैं। इसी विषय पर एक छोटा पाठ ब्लॉग पर प्रकाशित है: डाली गई फ़ाइल का क्या होता है। कोर्स की सूची समझें वाले पन्ने पर है।

स्रोत