本站是 ODERSA 的官方网站。 如何确认这一点

官方域名

本站的网址以 odersa.org 结尾。协会的每一项服务都放在 odersa.org 的子域名下,别处一概没有。如果浏览器地址栏里的网址不是以 odersa.org 结尾,这个站点就不是我们的。

免费,也不用账号

所有内容一开始就全部开放:不用注册,不用账号,不用密码,不用订阅,也没有广告。没有什么是留给付费的人的,因为这里什么都不收费。

不收集任何数据

本站不跟踪您:没有跟踪代码,没有跟踪 cookie,这些页面里没有内嵌任何统计工具,也不在您的设备上测量任何东西。我们的主机会以汇总方式统计请求,就像任何会应答的服务器一样:只是一个总数,绝不是一份个人档案。您不必相信我们的话:打开浏览器的开发者工具,切到“网络”标签页,然后刷新页面。您会看到本站请求的完整清单。所有内容都来自 odersa.org,没有任何东西发往别处。

内容自由使用

内容以 CC BY 4.0 许可协议发布。您可以复制、翻译、打印并再分发,用于课堂或身边的人都可以,唯一的条件是署名 ODERSA。

ODERSA 的一项服务

什么时候可以信任人工智能,什么时候干脆不要用它

The AI Manual 讲的是:人工智能怎么造出它的答案,它的错误藏在哪里,以及什么时候不该用它。课程免费,青少年、在职者和教师都能用,每一个演示都在这台设备上运行,不向外发送任何东西。

  • 免费,不用账号
  • 不收集任何数据
  • CC BY 4.0
一台笔记本电脑的背光键盘,大部分手指停在基准键位上,U 键被按下
一切都从敲下的文字开始。机器接着拿它做了什么,就是这门课要讲的事。 照片:Colin, 文件页面,许可协议 CC BY-SA 4.0 (许可协议文本).
1 文本,被切成 一个个词元 2 482 19 3305 77 640 12 每个词元,变成 一个数字 3 ? 下一个词元, 被预测出来 4 文本, 呈现在屏幕上
ODERSA 示意图,可依 CC BY 4.0 许可协议再利用。

一共四步:问题的文本先被切成词元,也就是比整个词更小的单位。每个词元变成一个数字。模型再根据这些数字,算出最有可能接下去的那个词元,然后一个词元接一个词元地重复这个动作。这些预测串起来的文本,就是屏幕上给出的答案。

课程

一章一章地理解

01

被切碎的词

一个不断合并最高频字符对、直到得出一份词表的算法,当场用在一句话上,并在几种语言之间做比较。

打开

02

下一个词

一个参数一个参数地看着模型算出下一个词的概率分布,再从里面抽一个。

打开

03

为什么它会编造

给同一个模型一个语料里的开头,再给一个语料里没有的开头,会发现它的回答里没有任何东西能分出是哪一种,只有它从不展示的那个计数能分。

打开

04

偏见从哪里来

一个由你亲手扭动语料构成的演示,你会看到模型把这个扭曲一丝不差地还回来,也会看到一份数据的缺失让什么变成不可能。

打开

05

我们交给它什么

交给某个服务的内容会遇到的四件不同的事,研究对它被还原输出测出了什么,以及在放上一个文件之前该问的问题。

打开

06

一张被造出来的图片

一个造出两张图片的演示,在它们的频谱里显出上采样留下的规律痕迹,再让这个痕迹消失在噪声之下。

打开

07

一段被造出来的声音

同一段语音造两遍,先粗糙后精细,用来比较耳朵听到什么、频谱显出什么,以及一点普通噪声能把它抹到什么程度。

打开

08

水印

一个加在文本上的绿名单水印,一条藏进图片像素里、随后当着你的面被毁掉的信息:两种标记机制,以及它们和“声明出来的出处”之间的区别。

打开

09

什么时候不要用它

三个检验,用来判断一个模型在某个情形里有没有位置;它完全没有位置的那些情形;以及为什么 AI 检测器什么都证明不了。

打开

用数字说话

231

个已发布页面,每次构建网站时重新清点

7

个可动手的演示,都在这台设备上运行

5

篇博客文章

53

条外部来源,每一条都可以逐一核查

先把界限说清楚

这门课不做的事

  • 不调用任何人工智能服务:所有演示都是确定性的,完全在这台设备上运行。
  • 不自制 AI 检测器:检测器会出错,这门课教的是它们的线索和它们的限度。
  • 不推荐任何产品,也不批判任何产品:这门课解释的是原理,不给任何品牌排名。