ODERSA 的一项服务
什么时候可以信任人工智能,什么时候干脆不要用它
The AI Manual 讲的是:人工智能怎么造出它的答案,它的错误藏在哪里,以及什么时候不该用它。课程免费,青少年、在职者和教师都能用,每一个演示都在这台设备上运行,不向外发送任何东西。
- 免费,不用账号
- 不收集任何数据
- CC BY 4.0
一共四步:问题的文本先被切成词元,也就是比整个词更小的单位。每个词元变成一个数字。模型再根据这些数字,算出最有可能接下去的那个词元,然后一个词元接一个词元地重复这个动作。这些预测串起来的文本,就是屏幕上给出的答案。
课程
一章一章地理解
01
被切碎的词
一个不断合并最高频字符对、直到得出一份词表的算法,当场用在一句话上,并在几种语言之间做比较。
打开02
下一个词
一个参数一个参数地看着模型算出下一个词的概率分布,再从里面抽一个。
打开03
为什么它会编造
给同一个模型一个语料里的开头,再给一个语料里没有的开头,会发现它的回答里没有任何东西能分出是哪一种,只有它从不展示的那个计数能分。
打开04
偏见从哪里来
一个由你亲手扭动语料构成的演示,你会看到模型把这个扭曲一丝不差地还回来,也会看到一份数据的缺失让什么变成不可能。
打开05
我们交给它什么
交给某个服务的内容会遇到的四件不同的事,研究对它被还原输出测出了什么,以及在放上一个文件之前该问的问题。
打开06
一张被造出来的图片
一个造出两张图片的演示,在它们的频谱里显出上采样留下的规律痕迹,再让这个痕迹消失在噪声之下。
打开07
一段被造出来的声音
同一段语音造两遍,先粗糙后精细,用来比较耳朵听到什么、频谱显出什么,以及一点普通噪声能把它抹到什么程度。
打开08
水印
一个加在文本上的绿名单水印,一条藏进图片像素里、随后当着你的面被毁掉的信息:两种标记机制,以及它们和“声明出来的出处”之间的区别。
打开09
什么时候不要用它
三个检验,用来判断一个模型在某个情形里有没有位置;它完全没有位置的那些情形;以及为什么 AI 检测器什么都证明不了。
打开用数字说话
231
个已发布页面,每次构建网站时重新清点
7
个可动手的演示,都在这台设备上运行
5
篇博客文章
53
条外部来源,每一条都可以逐一核查
先把界限说清楚
这门课不做的事
- 不调用任何人工智能服务:所有演示都是确定性的,完全在这台设备上运行。
- 不自制 AI 检测器:检测器会出错,这门课教的是它们的线索和它们的限度。
- 不推荐任何产品,也不批判任何产品:这门课解释的是原理,不给任何品牌排名。