这些演示展示什么,又永远不替你下结论
每个演示都在这台设备上设置和重跑,不用任何人工智能服务,页面打开之后也不用联网。一个看得见的随机种子让每个结果都可复现,一份写出来的方法则准确说明这个演示算的是什么。
本页汇集了 7 个演示,课程里的每一套机理各一个。每个都能设置、能重跑,而且立刻给出结果:没有一个要等服务器,没有一个要账号。
演示
被切碎的词
一个不断合并最高频字符对、直到得出一份词表的算法,当场用在一句话上,并在几种语言之间做比较。
打开下一个词
一个参数一个参数地看着模型算出下一个词的概率分布,再从里面抽一个。
打开为什么它会编造
给同一个模型一个语料里的开头,再给一个语料里没有的开头,会发现它的回答里没有任何东西能分出是哪一种,只有它从不展示的那个计数能分。
打开偏见从哪里来
一个由你亲手扭动语料构成的演示,你会看到模型把这个扭曲一丝不差地还回来,也会看到一份数据的缺失让什么变成不可能。
打开一张被造出来的图片
一个造出两张图片的演示,在它们的频谱里显出上采样留下的规律痕迹,再让这个痕迹消失在噪声之下。
打开一段被造出来的声音
同一段语音造两遍,先粗糙后精细,用来比较耳朵听到什么、频谱显出什么,以及一点普通噪声能把它抹到什么程度。
打开水印
一个加在文本上的绿名单水印,一条藏进图片像素里、随后当着你的面被毁掉的信息:两种标记机制,以及它们和“声明出来的出处”之间的区别。
打开为什么一切都在这台设备上运行,以及为什么这不是一种局限
本页没有一个演示会调用人工智能服务。没有密钥,没有在幕后创建的账号,页面加载之后也没有一个字节出去。这是一个教学上的选择,不是技术上的退让。
本页顶部的信任横幅已经提出了这个动作:打开浏览器的“网络”标签页,随便动手玩上面任何一个演示,然后看着。不会有任何请求发出去。
在这里,是一个玩具模型
语料就装在页面上。统计表可以整张读完。把一次计数变成一个概率的公式一行就写得下,也能用手重做。一个演示给出什么,都能从设置推出来:这里没有任何东西是神秘的。
在别处,是一个线上服务
语料是封闭的,参数以十亿计,回答旁边也不会显示任何公式。把一套完整的机理看过一次,就学会了在恰当的地方怀疑一个黑箱从不展示的东西。
一个看得见的随机种子,一个不会变的结果
每个演示都会抽随机,但绝不是抽打开它的那台设备里那种不透明的随机。抽取从一个种子出发:一个词或一个数字,明文显示,你可以改。两个人输入同一个种子,会在两台不同的设备上得到完全相同的结果。
正因如此,一个演示才能在课堂上被引用,也能在作业里被复现。一个没法一模一样重跑的结果,既没法核对,也没法纠正。
这些演示都不声称能做的事
每个演示展示一套机理,并说清自己的限度。没有一个走得更远。
- 判定你带来的某份具体内容是不是造出来的。
- 做任何检测:每个演示都已经知道自己上演的那个答案,它什么也不猜。
- 给一份作品、一份答卷或一个人评分或排名。
- 测量某份内容由机器造出来的概率。
用它需要什么
一个浏览器
什么都不用装。每个演示都在页面里运行,用的是浏览器本来就提供的东西。
不要账号
不用注册,不用密码。没有任何东西识别是谁在动手玩这个演示。
页面打开后不用联网
页面加载完,一切都在设备上计算。一间没有网络的教室,或者一架飞机上,都够用。
每个演示还带着自己的方法,写得明明白白,可以在纸上用手跟着做:它做的那个计算,一步一步,直到结果。正因如此,才能在课堂上不用屏幕重做一遍,或者在没有 JavaScript 的时候照样进行。
想再往下走
完整课程按它的顺序读,在理解页面。要围绕这些演示备一次课,给上课的人这条路线给出了一个顺序和一次可以直接拿去上的课。要复制、翻译或打印一个演示,许可页面说明了条件。