كواشف الذكاء الاصطناعي في المدرسة
كاشف النصّ المولَّد بالذكاء الاصطناعي يوعد بجواب بسيط. والبحث المنشور عن هذه الأدوات يقيس أخطاءً، وهي لا تقع عشوائيًا على الجميع.
كاشف النصّ المولَّد بالذكاء الاصطناعي يوعد بجواب بسيط عن سؤال بسيط: هل كتب هذا النصّ شخصٌ أو آلة؟ لكن البحث المنشور عن هذه الأدوات يقول شيئًا آخر: إنها تخطئ، وأخطاؤها لا تقع عشوائيًا على الجميع. ومع ذلك تُدمِج مؤسّسات مدرسية هذه الأدوات سلفًا في إجراءات التصحيح لديها، غالبًا دون معرفة ما تعنيه الدرجة فعلًا.
ما يقيسه الكاشف فعلًا
الكاشف لا يتعرّف على بصمة تركتها آلة، كما تُتعرَّف بصمة الإصبع. إنه يقارن الانتظام الإحصائي لنصّ، أي قابلية توقّع كلماته المتتالية، بما يميّز عادةً نصًّا ينتجه نموذج لغوي. والنتيجة درجةُ احتمال، لا دليل: فالأداة نفسها قد تغيّر حكمها على النصّ نفسه إذا أُعيدت صياغته قليلًا.
خطآن، وهما لا يكلّفان في الموضع نفسه
الكاشف قد يخطئ بطريقتين: أن يتّهم نصًّا بشريًا خطأً بأنه مولَّد، أو أن يمرّر نصًّا مولَّدًا كأنه بشري. ودراسة من 2023، بقيادة Weixin Liang وشاركوه، تقيس الخطأ الأول على نقطة بعينها: فمقالات كتبها غير الناطقين الأصليين بالإنجليزية تُصنَّف بانتظام على أنها مولَّدة بالذكاء الاصطناعي، في حين تُعرَف مقالات الناطقين الأصليين، في موضوع مماثل، على أنها بشرية بشكل صحيح. والسبب يعود إلى المفردات: صياغات أقلّ تنوّعًا، وأكثر قابلية للتوقّع، تشبه إحصائيًا ما ينتجه نموذج، دون أن يكون نموذج قد مسّها أبدًا.
وأوسع تقييم مستقلّ في الموضوع، أجرته في 2023 Debora Weber-Wulff مع 7 مشاركين، يختبر 14 أداة: 12 متاحة للجمهور واثنتان تجاريتان تستخدمهما سلفًا مؤسّسات مدرسية. والخلاصة: لا واحدة من الـ14 موثوقة ودقيقة في الوقت نفسه. والتحيّز الغالب ينقلب هنا بالنسبة إلى الدراسة السابقة: فهذه الأدوات تميل إلى تصنيف النصّ بشريًا بدل كشف النصّ المولَّد بشكل صحيح، وتعديلٌ خفيف للنصّ يكفي غالبًا لخداعها.
صانعٌ يسحب أداته الخاصة
أطلقت OpenAI في يناير 2023 مصنِّفًا لتمييز نصّ بشري من نصّ تنتجه نماذجها هي. وبعد ستة أشهر، سحبته الشركة. وفي 20 يوليو 2023، حدّثت صفحة عرض الأداة لتعلن سحبها بسبب معدّل دقّتها المنخفض، وهي واقعة نقلها في 25 يوليو موقع TechCrunch، الذي كان قد اختبر الأداة بنفسه عند إطلاقها.
الصانع الذي يعرف نموذجه أكثر من غيره لم يتمكّن من صناعة كاشف موثوق له.
وإذا كانت الشركة الأقدر على معرفة نموذجها لم تصل إلى ذلك، فالصعوبة لا تعود إلى نقص جهد عارض: بل تعود إلى طبيعة المهمة نفسها.
من يدفع ثمن الخطأ
واتّجاها الخطأ لا يثقلان على الأشخاص أنفسهم. فالكاشف المفرط في الحذر يعاقب أولًا تلميذًا يكتب بلغة ليست لغته، أو يكتب ببساطة كتابةً هادئة ومنتظمة. والكاشف المفرط في الثقة يمرّر نصًّا مولَّدًا دون أن يشير إليه لأحد. وفي الحالتين، تبدو الدرجة المعروضة كأنها قياس موضوعي، مع أن لا واحدة من الدراسات العامة المذكورة هنا تصدّقها كموثوقة على مستوى مؤسّسة. وحين يُبنى قرار على هذه الدرجة، ينتقل عبء الإثبات غالبًا إلى التلميذ المتّهم، الذي يصير عليه أن يبرّر عملًا لا تستطيع أي أداة مصدَّقة، من جانبها، تأكيده أو نفيه بيقين.
ما تتيحه درجة الكشف، وما لا تتيحه:
- فتح محادثة مع تلميذ عن طريقة إنتاج واجب.
- أن تخدم مؤشّرًا بين غيره، يُقاطَع بمعرفة العمل المعتاد للتلميذ.
- أن تُشكِّل، وحدها، دليلًا على غشّ: فلا واحدة من الأدوات الـ14 المختبَرة في 2023 صُدِّقت كموثوقة على هذا المستوى.
- أن تعامل كل التلاميذ بالطريقة نفسها: فالخطأ الموثَّق يصيب أكثر من يكتب بلغة ليست لغته.
ومسارات The AI Manual المصمَّمة لمن يعلّم تعود إلى طريقة التعامل مع شكّ، دون تحويل درجة إحصائية إلى حكم.
المصادر
- GPT detectors are biased against non-native English writers Weixin Liang، Mert Yuksekgonul، Yining Mao، Eric Wu، James Zou، 2023.
- OpenAI scuttles AI-written text detector over ‘low rate of accuracy’ Devin Coldewey، TechCrunch، 2023.
- Testing of detection tools for AI-generated text Debora Weber-Wulff وآخرون، 2023.
هذا المقال منشور برخصة CC BY 4.0: انسخه، وترجمه، وأعد نشره مع ذكر ODERSA.