هذا موقع رسمي تابع لـ ODERSA. إليكم كيف تتأكّدون

النطاق الرسمي

عنوان هذا الموقع ينتهي بـ odersa.org. كل خدمة من خدمات الجمعية توجد على نطاق فرعي من odersa.org، ولا في أي مكان آخر. وإذا كان العنوان الظاهر في شريط متصفّحكم لا ينتهي بـ odersa.org، فهذا الموقع ليس موقعنا.

مجاني، وبلا حساب

كل شيء متاح من اللحظة الأولى: لا تسجيل، ولا حساب، ولا كلمة مرور، ولا اشتراك، ولا إعلانات. ولا شيء محجوز لمن يدفع، لأن لا شيء هنا يُدفع.

لا جمع لأي بيانات

هذا الموقع لا يتعقّبكم: لا أدوات تتبّع، ولا ملفات تعريف ارتباط للتتبّع، ولا أي أداة قياس مدمجة في هذه الصفحات، ولا شيء يُقاس على جهازكم. مُضيفنا يَعُدّ الطلبات بشكل إجمالي، كما يفعل أي خادم يستجيب: مجموع، لا ملف شخصي. ولا حاجة أن تصدّقونا: افتحوا أدوات المطوّر في متصفّحكم، تبويب الشبكة، وأعيدوا تحميل الصفحة. سترون القائمة الكاملة لما يطلبه الموقع. كل شيء يأتي من odersa.org، ولا شيء يذهب إلى مكان آخر.

محتوى حر

المحتوى منشور برخصة CC BY 4.0. يمكنكم نسخه وترجمته وطبعه وإعادة توزيعه، في دروسكم كما بين من حولكم، بشرط واحد: ذكر ODERSA.

ثمن اللغة

الجملة الواحدة قد تنتج حتى 15 ضعف الرموز حسب اللغة التي كُتبت بها. وهذا ليس تفصيلًا في الأسلوب: إنه اختيار هندسي، له نتائج قابلة للقياس.

طرح السؤال نفسه على نموذج لغوي، بلغتين مختلفتين، لا يكلّف الثمن نفسه في الحساب. وليست المسألة مسألة طول الكلمات ولا مسألة تأدّب: إنها فارق مقيس وموثَّق، وهو يأتي من اختيار هندسي اتُّخذ قبل أن يطرح أحدٌ سؤالًا بزمن طويل.

ما يصير إليه النصّ قبل أن يدخل النموذج

النموذج اللغوي لا يقرأ كلمات. إنه يقرأ رموزًا (tokens): شُذرات نصّ، أقصر من الكلمة أو أطول منها أحيانًا، يقطّعها برنامج يُسمّى المقطّع قبل أن يدخل النصّ في الحساب. وتفصيل هذا التقطيع يعود إلى معجم ثابت، متعلَّم مرة واحدة على متن نصوص كبير جدًا. ولكل كلمة عددُ رموز خاصّ بها، وهذا العدد هو ما يفوتره النموذج، في زمن الحساب كما في الحجم داخل ذاكرته العاملة.

المحتوى الواحد، وجُموع مختلفة جدًا

دراسة من 2023 قاست هذا الفارق على مجموعة مقطّعات مستخدَمة فعلًا في النماذج اللغوية. وملاحظتها: المحتوى الواحد، مترجَمًا إلى لغات مختلفة، قد ينتج حتى 15 ضعف الرموز في اللغة الأكثر حظًّا سيّئًا مقارنةً بالأكثر حظًّا. وحتى المقطّعات التي تقطّع على مستوى المحرف أو البايت، والمفترض أنها تجنّب هذه المشكلة، تحفظ فارقًا مقيسًا يزيد على 4 أضعاف حسب أزواج اللغات.

15×

فارق الرموز المقيس للمحتوى الواحد، بين اللغة الأكثر حظًّا والأقلّ حظًّا، في أسوأ الحالات (Petrov وآخرون، 2023).

وزيادة الرموز لقول الشيء نفسه ليست تفصيلًا جماليًا. إنها حسابٌ أكثر في كل جواب، فهي إذن أبطأ في التوليد وأكثر كلفة في التشغيل لخدمة تُفوتَر بالرمز. وهي أيضًا نافذة سياق، أي الذاكرة العاملة المحدودة للنموذج، تمتلئ أسرع: فلعدد الرموز المسموح نفسه، يقع نصّ بلغة قليلة الحظّ على محتوى مفيد أقلّ.

لماذا ليس هذا الاختيار حياديًا

طريقة التقطيع الأكثر شيوعًا تُسمّى BPE، أي byte pair encoding. وهي لم تُخترَع للغة. فقد وصفها Philip Gage في 1994 كطريقة عامة لضغط الملفّات الحاسوبية: ترصد زوج البايتات الأكثر تكرارًا في بيانات، وتستبدله ببايت غير مستعمل، وتكرّر العملية حتى ينتهي الكسب. ولا علاقة لها، في الأصل، بلغة بشرية.

وفي 2016، أخذ Rico Sennrich وBarry Haddow وAlexandra Birch الفكرة لمسألة بعينها في الترجمة الآلية: ما يُفعَل بكلمة نادرة، غائبة عن المعجم الذي تعلّمه نموذج؟ وجوابهم يقطّع الكلمة إلى شُذرات أكثر شيوعًا، معروفة للنموذج سلفًا. والطريقة تعمل جيدًا، وقد أخذت بها منذ ذلك الحين شبه كل النماذج اللغوية الكبيرة.

ومعجم أجزاء الكلمة يُتعلَّم على متن، مرة واحدة، قبل تدريب النموذج نفسه. والمتن الغالب عليه الإنجليزية يعلّم معجمًا مُحسَّنًا للإنجليزية: فالشُذرات الأكثر شيوعًا في هذه اللغة تصير رموزًا مفردة، قصيرة، قليلة العدد. أما كلمة من لغة أقلّ تمثيلًا في هذا المتن فتجد نفسها مقطّعة إلى شُذرات أكثر، لمجرّد أن تكراراتها الخاصة المتواترة لم تحظَ بالفرصة نفسها لتُرى أثناء تعلّم المعجم. وهذه ليست خصيصةً في اللغة. إنها أثر متن.

ما يغيّره ذلك، عمليًا

الخدمة المفوترة بالرمز تكلّف، لمحتوى مكافئ، أكثر على من يكتب بلغة قليلة الحظّ عند المقطّع. والجواب يستغرق كذلك وقتًا أطول ليظهر، لأن النموذج ينتج رموزه واحدًا بعد آخر، بسرعة شبه ثابتة: فزيادة الرموز المُنتَجة زيادةٌ في الانتظار. ونافذة السياق، وهي ذلك العدد الثابت من الرموز الذي يستطيع النموذج قراءته أو كتابته في مرة واحدة، تحتوي نصًّا مفيدًا أقلّ: فمستندٌ، أو سجلّ محادثة، أو تعليمة طويلة، تقع فيها بصورة أسوأ.

ولا واحد من هذه الآثار يأتي من كون لغةٍ أعقد من أخرى. إنها تأتي من معجم تُعلَّم مرة واحدة، على متن معطًى، ولا يُعاد حسابه أبدًا بحسب من يستعمله بعد ذلك. وأصحاب دراسة 2023 يقترحون مسارًا: أن تُصمَّم، من البداية، مقطّعات لا ترجّح لغةً على أخرى ترجيحًا بنيويًا.

المصادر

هذا المقال منشور برخصة CC BY 4.0: انسخه، وترجمه، وأعد نشره مع ذكر ODERSA.

العودة إلى المدوّنة