本站是 ODERSA 的官方网站。 如何确认这一点

官方域名

本站的网址以 odersa.org 结尾。协会的每一项服务都放在 odersa.org 的子域名下,别处一概没有。如果浏览器地址栏里的网址不是以 odersa.org 结尾,这个站点就不是我们的。

免费,也不用账号

所有内容一开始就全部开放:不用注册,不用账号,不用密码,不用订阅,也没有广告。没有什么是留给付费的人的,因为这里什么都不收费。

不收集任何数据

本站不跟踪您:没有跟踪代码,没有跟踪 cookie,这些页面里没有内嵌任何统计工具,也不在您的设备上测量任何东西。我们的主机会以汇总方式统计请求,就像任何会应答的服务器一样:只是一个总数,绝不是一份个人档案。您不必相信我们的话:打开浏览器的开发者工具,切到“网络”标签页,然后刷新页面。您会看到本站请求的完整清单。所有内容都来自 odersa.org,没有任何东西发往别处。

内容自由使用

内容以 CC BY 4.0 许可协议发布。您可以复制、翻译、打印并再分发,用于课堂或身边的人都可以,唯一的条件是署名 ODERSA。

看懂人工智能到底在做什么

这门课一章一章地讲清楚:一个人工智能模型是怎么造出一段回答、一张图片或一段声音的,它为什么会一脸笃定地出错,以及什么时候完全不该信它。

这门课只有一个顺序,而这个顺序是有讲究的。它从最基础的一步开始:一段文本,在模型眼里怎么变成一串单位,再变成一串数字。后面的一切都得靠这第一步才讲得通,无论是下一个词的预测、一脸笃定的编造,还是语料悄悄传下来的偏见。接下来的几章再看:交给它的内容后来怎么样了,一张被造出来的图片或一段被造出来的声音会露出什么马脚,以及一道水印能撑到哪一步。走完这条路,课程才收尾:机理已经从里面看过一遍,这时候才谈得上判断一个“听起来合理”的答案什么时候不够用,以及干脆不用它。这也是为什么收尾的是这一章,而不是别的一章:判断力从来不走在理解前面,它跟在理解后面。

各章

01

被切碎的词

一个不断合并最高频字符对、直到得出一份词表的算法,当场用在一句话上,并在几种语言之间做比较。

打开

02

下一个词

一个参数一个参数地看着模型算出下一个词的概率分布,再从里面抽一个。

打开

03

为什么它会编造

给同一个模型一个语料里的开头,再给一个语料里没有的开头,会发现它的回答里没有任何东西能分出是哪一种,只有它从不展示的那个计数能分。

打开

04

偏见从哪里来

一个由你亲手扭动语料构成的演示,你会看到模型把这个扭曲一丝不差地还回来,也会看到一份数据的缺失让什么变成不可能。

打开

05

我们交给它什么

交给某个服务的内容会遇到的四件不同的事,研究对它被还原输出测出了什么,以及在放上一个文件之前该问的问题。

打开

06

一张被造出来的图片

一个造出两张图片的演示,在它们的频谱里显出上采样留下的规律痕迹,再让这个痕迹消失在噪声之下。

打开

07

一段被造出来的声音

同一段语音造两遍,先粗糙后精细,用来比较耳朵听到什么、频谱显出什么,以及一点普通噪声能把它抹到什么程度。

打开

08

水印

一个加在文本上的绿名单水印,一条藏进图片像素里、随后当着你的面被毁掉的信息:两种标记机制,以及它们和“声明出来的出处”之间的区别。

打开

09

什么时候不要用它

三个检验,用来判断一个模型在某个情形里有没有位置;它完全没有位置的那些情形;以及为什么 AI 检测器什么都证明不了。

打开

怎么跟着走

这门课可以从头读到尾,就按上面排好的章节顺序。已经知道自己要找什么的人,还有另一个入口:路线页面按青少年、工作中的人或教师,给出三条不同的路。第三个入口直接通向动手:演示页面把课里所有可操作的工具集中在一起,不必先读解释它们的文字。

不需要任何基础

这门课不假设你懂数学,不需要写一行代码,也不用注册任何账号。每个技术词都在它真正用得上的那一刻才定义,绝不提前。会读一个网页,就足够把它整个读完。

这门课不做的事

这门课解释的是原理,不是某个产品。

它给的是另一样东西:机理从里面看过一遍之后,你自己就能判断。

方法

这门课的每一句技术论断都带着来源,而且在写下它的那一刻是可以打开的。研究上还有争议的,就按有争议来讲,绝不当成定论。逐个主题的明细,集中在鸣谢与来源页面。

演示

课里每一个可动手的演示都完全在这台设备上运行,不用联网,也不用账号:演示跑起来的时候,可以打开浏览器的“网络”标签页,亲眼确认没有任何请求发出去。每一个演示还会把自己的方法讲明白,好让人能不用它、用手在纸上把同样的事再做一遍。