এটি ODERSA-র একটি অফিসিয়াল সাইট। কীভাবে বুঝবেন

অফিসিয়াল ডোমেইন

এই সাইটের ঠিকানা odersa.org দিয়ে শেষ হয়। সংস্থার প্রতিটি সেবা odersa.org-এর কোনো সাবডোমেইনেই থাকে, আর কোথাও নয়। আপনার ব্রাউজারের ঠিকানার ঘরে দেখানো ঠিকানা যদি odersa.org দিয়ে শেষ না হয়, তবে এই সাইট আমাদের নয়।

বিনামূল্যে, অ্যাকাউন্ট ছাড়াই

সবকিছু প্রথম মুহূর্ত থেকেই খোলা: কোনো নিবন্ধন নেই, কোনো অ্যাকাউন্ট নেই, কোনো পাসওয়ার্ড নেই, কোনো সাবস্ক্রিপশন নেই, কোনো বিজ্ঞাপন নেই। যাঁরা টাকা দেন তাঁদের জন্য আলাদা কিছু রাখা নেই, কারণ এখানে কিছুই টাকার বিনিময়ে নয়।

কোনো তথ্য সংগ্রহ নয়

এই সাইট আপনার পিছু নেয় না: কোনো ট্র্যাকার নেই, ট্র্যাকিং কুকি নেই, এই পাতাগুলোতে বসানো কোনো মাপার সরঞ্জামও নেই, আর আপনার যন্ত্রে কিছুই মাপা হয় না। আমাদের হোস্ট সমষ্টিগতভাবে অনুরোধ গোনে, উত্তর দেওয়া যেকোনো সার্ভার যেমন গোনে: একটি মোট সংখ্যা, কখনও কোনো প্রোফাইল নয়। আমাদের কথা বিশ্বাস করার দরকার নেই: আপনার ব্রাউজারের ডেভেলপার টুল খুলুন, নেটওয়ার্ক ট্যাবে যান, আর পাতাটি আবার লোড করুন। সাইট যা যা চায়, তার পুরো তালিকা আপনি দেখতে পাবেন। সবই odersa.org থেকে আসে, কিছুই অন্য কোথাও যায় না।

মুক্ত কনটেন্ট

কনটেন্ট CC BY 4.0 লাইসেন্সে প্রকাশিত। আপনি তা কপি করতে, অনুবাদ করতে, ছাপতে ও আবার বিতরণ করতে পারেন, আপনার ক্লাসের জন্যও, আপনার আপনজনের জন্যও, একটিমাত্র শর্তে: ODERSA-র নাম উল্লেখ করুন।

একটি ভাষার দাম

একই বাক্য, কোন ভাষায় লেখা তার উপরে, 15 গুণ পর্যন্ত বেশি টোকেন তৈরি করতে পারে। এটি লেখার ঢঙের খুঁটিনাটি নয়: এটি একটি কৌশলগত সিদ্ধান্ত, যার পরিণাম মেপে দেখা যায়।

একটি ভাষা-মডেলকে একই প্রশ্ন দুটি আলাদা ভাষায় করলে হিসাবের দাম এক হয় না। এটি শব্দের দৈর্ঘ্য বা ভদ্রতার প্রশ্ন নয়: এটি একটি মাপা আর নথিবদ্ধ ফারাক, আর তা আসে এমন একটি কৌশলগত সিদ্ধান্ত থেকে, যা কেউ কোনো প্রশ্ন করার বহু আগেই নেওয়া হয়ে গেছে।

মডেলের ভেতরে ঢোকার আগে একটি লেখা কী হয়ে যায়

একটি ভাষা-মডেল শব্দ পড়ে না। সে টোকেন পড়ে: লেখার টুকরো, একটি শব্দের চেয়ে ছোট বা মাঝেমধ্যে বড়, যেগুলি লেখাটি হিসাবে ঢোকার আগেই টোকেনাইজার নামের একটি প্রোগ্রাম কেটে দেয়। এই ভাগের খুঁটিনাটি দাঁড়িয়ে আছে একটি স্থির শব্দভাণ্ডারের উপরে, যা লেখার একটি খুব বড় কর্পাসে একবারের জন্যই শেখা। প্রতিটি শব্দ নিজের একটি টোকেন-সংখ্যা বহন করে, আর এই সংখ্যাটিই মডেল বিল করে, হিসাবের সময়েও, আর তার কাজের স্মৃতিতে জায়গা নেওয়াতেও।

একই বিষয়বস্তু, খুব আলাদা যোগফল

2023 সালের একটি গবেষণা এই ফারাকটি মেপেছে ভাষা-মডেলগুলি সত্যিই যে টোকেনাইজারগুলি ব্যবহার করে, তাদের একটি সমষ্টিতে। তার পর্যবেক্ষণ: একই একটি বিষয়বস্তু, আলাদা আলাদা ভাষায় অনূদিত, সবচেয়ে সুবিধাবঞ্চিত ভাষায় সবচেয়ে সুবিধাপ্রাপ্ত ভাষার চেয়ে 15 গুণ পর্যন্ত বেশি টোকেন তৈরি করতে পারে। এমনকি যে টোকেনাইজারগুলি অক্ষর বা বাইটের স্তরে ভাগ করে, যাদের এই সমস্যা এড়ানোর কথা, তারাও ভাষার জোড়া অনুযায়ী 4 গুণেরও বেশি একটি মাপা ফারাক ধরে রাখে।

15×

একই একটি বিষয়বস্তুর জন্য সবচেয়ে সুবিধাপ্রাপ্ত আর সবচেয়ে কম সুবিধাপ্রাপ্ত ভাষার মধ্যে মাপা টোকেনের ফারাক, সবচেয়ে প্রতিকূল ক্ষেত্রে (Petrov et al., 2023)।

একই কথা বলতে বেশি টোকেন লাগা কোনো সৌন্দর্যের খুঁটিনাটি নয়। এর মানে প্রতিটি উত্তরে বেশি হিসাব, তাই তৈরি হতে বেশি ধীর আর টোকেন ধরে বিল করা একটি পরিষেবার জন্য চালাতে বেশি খরচের। এর মানে আরও একটি প্রসঙ্গের জানালা, অর্থাৎ একটি মডেলের সীমিত কাজের স্মৃতি, যা আরও দ্রুত ভরে যায়: একই সংখ্যক অনুমোদিত টোকেনের জন্য, সুবিধাবঞ্চিত একটি ভাষার লেখা সত্যিই কাজে লাগে এমন কম বিষয়বস্তুই ধরতে পারে।

এই সিদ্ধান্তটি কেন নিরপেক্ষ নয়

সবচেয়ে ছড়ানো ভাগ করার পদ্ধতিটির নাম BPE, byte pair encoding। সে ভাষার জন্য বানানো হয়নি। Philip Gage 1994 সালে তার বর্ণনা দেন কম্পিউটার ফাইল সংকোচনের একটি সাধারণ পদ্ধতি হিসেবে: সে তথ্যে সবচেয়ে ঘন ঘন আসা বাইটজোড়াটি খুঁজে নেয়, তাকে একটি অব্যবহৃত বাইট দিয়ে বদলে দেয়, আর লাভ শেষ হওয়া পর্যন্ত কাজটি আবার আবার করে। মূলে, কোনো মানুষের ভাষার সঙ্গে তার কোনো সম্পর্কই ছিল না।

2016 সালে Rico Sennrich, Barry Haddow আর Alexandra Birch ভাবনাটি স্বয়ংক্রিয় অনুবাদের একটি নির্দিষ্ট সমস্যার জন্য তুলে নেন: একটি মডেলের শেখা শব্দভাণ্ডারে নেই এমন একটি বিরল শব্দ নিয়ে কী করা যায়? তাঁদের উত্তর শব্দটিকে আরও চলতি, মডেলের আগেই চেনা টুকরোয় ভাগ করে দেয়। পদ্ধতিটি ভালোই কাজ করে, আর তার পর থেকে প্রায় সব বড় ভাষা-মডেলই তা তুলে নিয়েছে।

উপ-শব্দের একটি শব্দভাণ্ডার একটি কর্পাসে শেখা হয়, একবার, মডেলের নিজের প্রশিক্ষণের আগে। বেশির ভাগটাই ইংরেজিতে এমন একটি কর্পাস ইংরেজির জন্য সাজানো একটি শব্দভাণ্ডারই শেখে: এই ভাষায় সবচেয়ে চলতি টুকরোগুলি হয়ে যায় একক, ছোট আর কম সংখ্যক টোকেন। এই কর্পাসে কম হাজির থাকা একটি ভাষার একটি শব্দ আরও বেশি টুকরোয় ভাগ হয়ে যায়, কেবল এই কারণে যে শব্দভাণ্ডার শেখার সময় তার নিজের ঘন ঘন পুনরাবৃত্তিগুলি দেখা পাওয়ার একই সুযোগ পায়নি। এটি ভাষার কোনো ধর্ম নয়। এটি একটি কর্পাসের দাগ।

এতে হাতে-কলমে কী বদলায়

টোকেন ধরে বিল করা একটি পরিষেবার দাম, একটি সমান বিষয়বস্তুর জন্য, তাঁর কাছেই বেশি পড়ে যিনি টোকেনাইজারের কাছে সুবিধাবঞ্চিত একটি ভাষায় লেখেন। উত্তরটি পর্দায় ফুটে উঠতেও বেশি সময় নেয়, কারণ একটি মডেল নিজের টোকেনগুলি একের পর এক তৈরি করে, প্রায় স্থির একটি গতিতে: তৈরি করার মতো বেশি টোকেন, মানে বেশি অপেক্ষা। আর প্রসঙ্গের জানালা, অর্থাৎ একটি মডেল একবারে যতগুলি টোকেন পড়তে বা লিখতে পারে সেই স্থির সংখ্যাটি, কম কাজের লেখা ধরে রাখে: একটি নথি, একটি আলাপের ইতিহাস, একটি লম্বা নির্দেশ তাতে কম ভালোভাবে ধরে যায়।

এই প্রভাবগুলির একটিও একটি ভাষা অন্যটির চেয়ে বেশি জটিল হওয়া থেকে আসে না। সেগুলি আসে একটি শব্দভাণ্ডার থেকে, যা একবার, একটি নির্দিষ্ট কর্পাসে শেখা, আর তার পর কে তা ব্যবহার করবে সেটি ধরে কখনও আবার হিসাব করা হয়নি। 2023 সালের গবেষণাটির লেখকরা একটি পথ দেখান: শুরু থেকেই এমন টোকেনাইজার বানানো, যারা গঠনগতভাবেই একটি ভাষাকে অন্যটির চেয়ে এগিয়ে দেয় না।

উৎস

এই লেখাটি প্রকাশিত CC BY 4.0 লাইসেন্সে: ODERSA-র নাম উল্লেখ করে তা কপি করুন, অনুবাদ করুন, আবার প্রকাশ করুন।

ব্লগে ফিরে যান