学校里的 AI 检测器
AI 生成文本检测器承诺一个简单的答案。关于这些工具已发表的研究测出的是一堆错误,而这些错误并不是随机落在每个人身上的。
AI 生成文本检测器对一个简单的问题承诺一个简单的答案:这段文字是人写的还是机器写的?关于这些工具已发表的研究说的是另一回事:它们会出错,而且它们的错误不是随机落在每个人身上的。然而已经有学校把这些工具放进了自己的批改流程,往往并不知道一个分数究竟意味着什么。
检测器真正测的是什么
检测器认出的不是机器留下的某个签名,不像指纹那样。它比较的是一段文字的统计规律性,也就是它相继出现的词的可预测程度,与语言模型产出的文本通常具有的特征之间的接近程度。得到的结果是一个概率分数,不是一个证据:同一个工具,对同一段文字稍作改写,就可能改变结论。
两种错误,而它们不落在同一处
检测器可能有两种出错方式:把人写的文字错指为机器生成,或者把机器生成的文字当成人写的放过去。2023 年由 Weixin Liang 及其合作者做的一项研究,在一个具体点上测量了第一种错误:英语非母语者写的作文被系统性地判为 AI 生成,而母语者在相近题目上写的作文则被正确识别为人写。原因在词汇:句式变化更少、更可预测,在统计上像模型产出的东西,而其实根本没有模型碰过它。
这个题目上最大规模的独立评测,由 Debora Weber-Wulff 与 7 位合作者在 2023 年完成,测试了 14 款工具:12 款面向公众,2 款商业工具已经在学校里使用。结论是:14 款里没有一款同时做到可靠和精确。而占主导的偏向和前一项研究相反:这些工具倾向于把文本判为人写,而不是正确地检出一段生成文本,而且对文本稍作改动往往就足以骗过它们。
一家厂商撤掉了自己的工具
OpenAI 在 2023 年 1 月推出一个分类器,用来把人写的文本和它自己模型产出的文本区分开。六个月后,这家公司把它撤了。2023 年 7 月 20 日,它更新了这个工具的介绍页面,宣布因为精确率过低而撤下,这件事在 7 月 25 日由 TechCrunch 网站转述,而该网站在这个工具上线时自己测过它。
最了解自己模型的那家厂商,没能把它做成一个可靠的检测器。
如果连最有条件了解自己模型的那家公司都没做到,那这个难处就不是一时努力不够:它出在这项任务本身的性质上。
谁来为错误付账
两个方向的错误并不压在同一批人身上。一个过于多疑的检测器,首先惩罚的是用一门不属于自己的语言写作的学生,或者仅仅是写得朴素、规整的学生。一个过于轻信的检测器,则会把一段生成文本放过去,谁也不提醒。两种情况下,显示出来的那个分数都长着一副客观测量的样子,而这里引用的任何一项公开研究,都没有把它验证为在一所学校的层面上可靠。当一个决定建立在这个分数上时,举证责任往往就转移到了被指控的学生身上,而他要为自己的作业作出解释,可另一边并没有任何经过验证的工具能确凿地肯定或否定它。
一个检测分数能用来做什么,不能用来做什么:
- 就一份作业是怎么完成的,和一个学生开启一次谈话。
- 作为若干线索之一,和对这个学生平时作业的了解交叉印证。
- 单凭它构成作弊的证据:2023 年被测的 14 款工具,没有一款被验证为在这个层面上可靠。
- 对所有学生一视同仁:有据可查的错误更常落在用一门不属于自己的语言写作的人身上。
The AI Manual 为上课的人准备的那条路线,回到了面对一次怀疑该怎么反应这个问题,而不把一个统计分数变成判决。
来源
- GPT detectors are biased against non-native English writers Weixin Liang, Mert Yuksekgonul, Yining Mao, Eric Wu, James Zou,2023 年。
- OpenAI scuttles AI-written text detector over ‘low rate of accuracy’ Devin Coldewey,TechCrunch,2023 年。
- Testing of detection tools for AI-generated text Debora Weber-Wulff 等,2023 年。
本文以 CC BY 4.0 许可协议发布: 欢迎复制、翻译、再发布,署名 ODERSA 即可。