यह ODERSA की एक आधिकारिक वेबसाइट है। यह कैसे जानें

आधिकारिक डोमेन

इस साइट का पता odersa.org पर खत्म होता है। संस्था की हर सेवा odersa.org के किसी उपडोमेन पर ही होती है, और कहीं नहीं। अगर आपके ब्राउज़र की पता-पट्टी में दिख रहा पता odersa.org पर खत्म नहीं होता, तो यह साइट हमारी नहीं है।

मुफ़्त, और बिना खाते

सब कुछ पहले पल से खुला है: कोई रजिस्ट्रेशन नहीं, कोई खाता नहीं, कोई पासवर्ड नहीं, कोई सब्सक्रिप्शन नहीं, कोई विज्ञापन नहीं। पैसे देने वालों के लिए अलग से कुछ नहीं रखा गया, क्योंकि यहाँ कुछ भी पैसे से नहीं मिलता।

कोई डेटा इकट्ठा नहीं

यह साइट आपका पीछा नहीं करती: न कोई ट्रैकर, न कोई ट्रैकिंग कुकी, न इन पन्नों में जड़ा कोई मापने वाला औज़ार, और न आपके उपकरण पर कुछ मापा जाता है। हमारा होस्ट अनुरोधों की गिनती कुल जोड़ के रूप में रखता है, जैसा जवाब देने वाला हर सर्वर रखता है: एक कुल योग, कभी कोई प्रोफ़ाइल नहीं। हमारी बात मान लेने की ज़रूरत नहीं: अपने ब्राउज़र के डेवलपर टूल खोलिए, Network टैब में जाइए, और पन्ना दोबारा लोड कीजिए। साइट जो कुछ माँगती है, उसकी पूरी सूची आपके सामने आ जाएगी। सब कुछ odersa.org से आता है, कुछ भी कहीं और नहीं जाता।

खुला कंटेंट

कंटेंट CC BY 4.0 लाइसेंस के तहत प्रकाशित है। आप इसे कॉपी कर सकते हैं, अनुवाद कर सकते हैं, छाप सकते हैं और आगे बाँट सकते हैं, अपनी कक्षा के लिए भी और अपने घर-परिवार के लिए भी। बस एक शर्त: ODERSA का नाम दें।

डाली गई फ़ाइल का क्या होता है

आर्टिफिशियल इंटेलिजेंस इस्तेमाल करने वाली किसी सेवा में कोई फ़ाइल डालने से पहले एक ठीक-ठीक सवाल उठता है: क्या यह सामग्री बाद में, किसी और के सामने, बाहर आ सकती है?

आर्टिफिशियल इंटेलिजेंस इस्तेमाल करने वाली किसी सेवा में कोई फ़ाइल डालने पर कम ही साफ़-साफ़ बताया जाता है कि उस फ़ाइल का आगे क्या होता है। पूछने वाला सवाल “क्या AI मेरी जासूसी करेगी” नहीं है, यह वाक्य जाँचे जाने के लिए बहुत अस्पष्ट है। शोध ने जो सवाल दर्ज किया है, वह ज़्यादा ठीक-ठीक है: क्या यह सामग्री बाद में, किसी और के सामने, बाहर आ सकती है? स्कूल का कोई होमवर्क, परिवार की कोई तस्वीर, दफ़्तर की कोई फ़ाइल: कोई फ़ाइल डाल देना अब आम बात हो गई है, उसका आगे क्या होता है यह सवाल आम नहीं हुआ।

कोई मॉडल पूरे-पूरे हिस्से याद रख सकता है

2021 में Nicholas Carlini और उनकी टीम एक सीधा प्रयोग प्रकाशित करते हैं। GPT-2 से, यानी आज के बातचीत करने वाले सहायकों से पहले के एक भाषा मॉडल से, सिर्फ़ सवाल पूछकर वे उसमें से टेक्स्ट की सैकड़ों कतारें निकाल लेते हैं जो उसके प्रशिक्षण-डेटा से शब्द दर शब्द दोहराई गई थीं: नाम, फ़ोन नंबर, ईमेल पते, बातचीत के अंश, कंप्यूटर कोड। इनमें से कुछ कतारें मूल डेटा में सिर्फ़ एक ही बार आई थीं। अध्ययन का एक और नतीजा: बड़े मॉडल छोटे मॉडलों से ज़्यादा याद रखते हैं। इनमें से कोई जानकारी किसी चोर-रास्ते से नहीं खोजी गई थी: वे सिर्फ़ आम सवालों के जवाब में बाहर आ गईं, ऐसे सवालों के जो मॉडल के किसी भी रोज़मर्रा इस्तेमाल जैसे थे।

यह जोखिम किन वजहों से बढ़ता है

2023 में उसी टीम के एक हिस्से का प्रकाशित दूसरा अध्ययन ठीक-ठीक नापता है कि याद रखना किन वजहों से बढ़ता है। तीन कारक, हर एक अलग से नापा गया: मॉडल का आकार, प्रशिक्षण-डेटा में एक ही उदाहरण का दोहराव, और आगे बढ़ाने को कहने से पहले संदर्भ में दिए गए टेक्स्ट की लंबाई। मॉडल जितना बड़ा, कोई उदाहरण जितना दोहराया गया, दिया गया संदर्भ जितना लंबा, याद रखे गए किसी टुकड़े के मिल जाने की संभावना उतनी ही बढ़ती है। लेखक एक ऐसे याद रखने का ब्यौरा देते हैं जो सोचे गए से ज़्यादा फैला हुआ है, और जो और बड़े मॉडलों के साथ बिगड़ता ही जाएगा, अगर उसे रोकने के लिए कुछ न किया जाए।

जोखिम सिर्फ़ सैद्धांतिक नहीं है

एक आपत्ति मुमकिन रहती है: ये प्रयोग कहीं प्रयोगशाला के मॉडलों पर तो नहीं, जिनका असल में इस्तेमाल हो रही किसी सेवा से कोई नाता ही न हो? 2023 का एक अध्ययन, जिसकी अगुवाई Milad Nasr ने की, पहले से तैनात मॉडलों को निशाना बनाकर इसका जवाब देता है: Pythia या GPT-Neo जैसे खुले मॉडल, LLaMA या Falcon जैसे आधे-खुले, और एक बंद मॉडल जो सिर्फ़ किसी ऑनलाइन सेवा के ज़रिए मिलता है, ChatGPT। वह उनसे गीगाबाइटों में प्रशिक्षण-डेटा निकाल लेता है। ChatGPT के लिए, जिसके जवाबों पर आम तौर पर पहरा होता है, लेखक एक तकनीक तैयार करते हैं जो मॉडल को उसके आम बरताव से हटा देती है: यह तकनीक प्रशिक्षण-डेटा को उस दर से 150 गुना ज़्यादा बाहर ले आती है जो मॉडल के आम तरह जवाब देते वक़्त दिखती है। मॉडल पर लगा पहरा यह जोखिम घटाता है, वह उसे खत्म नहीं करता। गीगाबाइटों में निकाल लेने के लिए मॉडल तक कोई खास पहुँच नहीं चाहिए: अध्ययन सिर्फ़ सवाल पूछकर आगे बढ़ता है, उन्हीं हालात में जिनमें सेवा का कोई भी रोज़मर्रा इस्तेमाल होता है।

कोई फ़ाइल डालने से पहले पूछने वाला सवाल

ये अध्ययन मिलकर जो नापते हैं, वह शुरू का सवाल ही हटा देता है। बात यह जानने की नहीं है कि कोई मॉडल फ़ाइल मिलते वक़्त उसे पढ़ता है या नहीं, यह तो आम इस्तेमाल पहले से मान लेता है। बात यह जानने की है कि यह सामग्री आगे किसी मॉडल को प्रशिक्षित या दोबारा प्रशिक्षित करने के काम आ सकती है या नहीं, और इसलिए उस भंडार में शामिल हो सकती है जिसका कोई टुकड़ा, ऊपर नापे गए हालात में, किसी दिन बाहर आ सकता है। AI इस्तेमाल करने वाली किसी सेवा में कोई फ़ाइल डालने से पहले दो सवाल उठते हैं: क्या यह सेवा साफ़-साफ़ बताती है कि डाला गया डेटा किस काम आता है? और क्या वह यह मना करने का कोई असली विकल्प देती है कि वह डेटा कुछ भी प्रशिक्षित करने के काम आए? इनमें से किसी एक का जवाब न मिलना अपने आप में एक जानकारी है।

किसी सेवा को सौंपी गई सामग्री का क्या होता है, और वह सेवा उस बारे में असल में क्या कहती है, इसका ब्यौरा कोर्स के उसी अध्याय में है जो इसी पर है।

शोध ने क्या नापा है, और वह क्या नहीं कहता:

  • असल में तैनात किसी मॉडल से सवाल पूछकर याद रखे गए प्रशिक्षण-डेटा का, जिसमें निजी जानकारी भी थी, निकाल लिया जाना।
  • एक ऐसा याद रखना जो मॉडल के आकार, किसी उदाहरण के दोहराव और दिए गए संदर्भ की लंबाई के साथ बढ़ता है।
  • जो लिखा जा रहा है उस पर उसी पल की निगरानी: ये अध्ययन बाद में मुमकिन एक बाहर आ जाने को दर्ज करते हैं, किसी तीसरे को उसी पल पहुँचाई गई पढ़त को नहीं।

स्रोत

यह लेख CC BY 4.0 लाइसेंस के तहत प्रकाशित है: इसे कॉपी कीजिए, अनुवाद कीजिए, दोबारा प्रकाशित कीजिए, ODERSA का नाम देकर।

ब्लॉग पर वापस