本站是 ODERSA 的官方网站。 如何确认这一点

官方域名

本站的网址以 odersa.org 结尾。协会的每一项服务都放在 odersa.org 的子域名下,别处一概没有。如果浏览器地址栏里的网址不是以 odersa.org 结尾,这个站点就不是我们的。

免费,也不用账号

所有内容一开始就全部开放:不用注册,不用账号,不用密码,不用订阅,也没有广告。没有什么是留给付费的人的,因为这里什么都不收费。

不收集任何数据

本站不跟踪您:没有跟踪代码,没有跟踪 cookie,这些页面里没有内嵌任何统计工具,也不在您的设备上测量任何东西。我们的主机会以汇总方式统计请求,就像任何会应答的服务器一样:只是一个总数,绝不是一份个人档案。您不必相信我们的话:打开浏览器的开发者工具,切到“网络”标签页,然后刷新页面。您会看到本站请求的完整清单。所有内容都来自 odersa.org,没有任何东西发往别处。

内容自由使用

内容以 CC BY 4.0 许可协议发布。您可以复制、翻译、打印并再分发,用于课堂或身边的人都可以,唯一的条件是署名 ODERSA。

什么时候不要用它

这一章为课程收尾,而它最有用。模型产出的是一个说得通的回答,从来不是一个核对过的回答。所以全部的判断力都落在一个问题上,而这个问题要在开口提问之前就问:如果回答是错的,而且没人发现,会发生什么?

前面几章展示了一套机理:模型切分,算出一个分布,从里面抽,然后重新开始。这套机理里没有任何东西去核对任何事情。一个回答出来,是因为它概率高,不是因为它正确,而模型手里也没有任何关于自己无知的可靠信号。本章把这件事的实际后果讲出来。

该问的问题从来不是“我能不能用”。而是“如果它错了,谁来付账”。

三个检验

三个问题就够了,而且要按这个顺序问。第一个不通过的,就把门关上。

出错的代价

一个错误还补得回来吗?一份写歪了的草稿,两分钟就能重写。一种药、一个纳税期限、一次诊断、一个剂量、一条已经发给客户的消息,都很难补回来,或者根本补不回来。一个错误越是不可逆,模型在这个决定里就越没有位置。

可核查性

你能不能自己在合理的时间内,到来源那里去核对这个回答?如果能,模型是一个可以接受的起点,而核对仍然是必须的。如果不能,这个回答就不可用,不管它有多笃定。一个无法核查的回答不是半份信息:它是零信息。

小心那种假核对。问模型它是否确定,什么也核对不了:这句确认和那个回答是同一套机理算出来的,它和回答一样只是“说得通”。索要它的来源同样什么也核对不了,除非那些来源被一条一条打开过,因为一处编出来的出处,形式上可以完美无缺。

正当性

这个情形是否需要一个负责的人?一个针对某个人、针对他的权利、他的工作或他的分数的决定,牵涉到一个必须能为它作出交代、也能被人向他提出异议的人。没有机器承担这份责任,而把决定交给机器并不会让责任消失:它只是让责任变得找不到人。

该把这个工具收起来的情形

  • 在没有医疗专业人员参与的情况下,决定一种治疗、一个剂量、一次诊断。
  • 把一份法律行为、一份合同、一次申报、一次申诉,建立在一个没有到官方来源核对过的回答上。
  • 对针对某个人的决定下结论:招聘、评分、处罚、补助的发放。
  • 依据一个检测器或一种印象去指控某人。
  • 处理自己无权交出去的内容:见我们交给它什么那一章。
  • 用一次预测去代替一次精确计算:语言模型不做计数,它预测的是像一次计数的东西。
  • 写一份反正要重写的初稿。
  • 把自己写的、而且会自己再读一遍的文本换个说法。
  • 拿到一些待核查的线索,同时明白其中没有一条是已经成立的。
  • 解释一个自己有能力在别处交叉印证的概念。
  • 为了看懂而翻译,绝不在没有懂这门语言的人校读的情况下发布。

检测器这个陷阱

有一种情形值得单独讲,因为它造成真实的损害,而且它把自己摆成解决方案:那些声称能判断一段文本是否由人工智能写成的工具。本站不提供任何这类工具,而这不是一处缺失。

有三项已发表的结论支持这个立场。一项针对十四款检测工具(其中包括卖给教育机构的商业工具)的独立评测得出结论:没有一款同时做到可靠和精确。另一项研究确立:几款使用很广的检测器,会把英语非母语者写的文本中的大多数错判为机器生成,而对母语者的文本却处理得当:这个错误不是随机分布的,它落在本来就已经处于不利地位的人身上。最后,发布了最知名那款检测器的公司,在上线六个月后自己把它撤了,理由由它自己给出:可靠率太低。

注意

一个检测器的结果不是证据,也不能成为任何处罚的依据。对一份作业的疑问,要靠一次谈话、一个关于所用方法的问题、一次口头说明、一次要求提交的中间稿来处理。绝不靠一个百分比。

这个案卷的细节,以及一所学校可以用什么来代替,讲在博客上:学校里的 AI 检测器。

物质代价,这也算

还有最后一个该弃用的理由,和准确性毫无关系。用一个多用途的生成式系统去做一件专用工具做得更好的事,就同一件事而言,会多花一个数量级的能源和排放。在一份文件里查一个精确字符串、给一份清单排序、把一列数字加起来、转换一种格式:这些任务都有能精确完成它们的工具,而且更快,也不会编造。在全球范围内,与人工智能相关的数据中心用电量增长速度大约是电力总需求的四倍,并且预计在 2024 年到 2030 年间会翻一倍以上。

这里的动作很简单:先问这件事有没有一个精确答案。如果有,就存在一个精确的工具。

整门课总结成一条规则

模型用来产出你接着要去核对的东西,从不用来决定你不会去核对的东西。

剩下的都能推出来。如果核对不可能,这次使用就不该发生。如果核对可能而你不去做,那就不再是模型的问题了。

想再往下走

编造的机理,讲在为什么它会编造那一章。核查这个动作一步一步怎么做,发在博客上:核查这个动作。某个地区特有的义务,作为模块摆在课程旁边,绝不作为地基:见欧盟的那项义务和官方框架。课程目录在理解页面。

来源