本站完整地图,每次构建都会更新
本站服务的每一个页面都在这里,按主题归好。这份清单从不手抄:每次构建网站时都会重新清点。
本站包含:一门分章的课程和它的可动手演示,三条按你是谁通向课程的路线,一个跟着这个题目走的博客,还有像本页这样的服务页面。
想学,就从课程进。想按自己的处境被指路,无论是青少年、工作中的人还是教师,就从一条路线进。想一次看全,下面这份清单把每个页面按主题归好,每页配一句话。
首页
从哪里进入
- 理解 课程目录:模型怎么造出一个答案,为什么会编造,偏见从哪里来,以及什么时候不该用它。不需要任何基础。
- 演示 可动手的演示,完全在你的设备上运行:不向外发送请求,随机种子可复现,方法全部手写说明。
- 路线 一眼看完课程的三条路线:各自写给谁、能得到什么,不用把三条都打开就能选。
- 博客 延伸课程的文字:讲透一个技术点,逐句拆开一份公开来源,或者记下一次真实的用法。来源都经过核对,采用 CC BY 4.0 许可协议。
课程
- 被切碎的词 模型读到的既不是字母也不是词,而是靠统计学来的碎片。BPE 方法当场演示,以及它在不同语言上的代价。
- 下一个词 模型怎么给每一个可能的词算出一个概率,再从里面抽一个,以及温度、top-k 和 top-p 怎么改变这次抽取。
- 为什么它会编造 同一个玩具模型,面对语料里有的开头和语料里没有的开头,回答得一样笃定。答案本身没有任何东西能分出这两种情况。
- 偏见从哪里来 把一份数据集的构成扭一下,在它上面学出来的模型会把这个扭曲一丝不差地还回来。偏见是后果,不是意图。
- 我们交给它什么 一份文件交给人工智能服务后,会发生四件事:读取、保存、再训练、还原输出。
- 一张被造出来的图片 本页现场造两张图片,把它们的频谱并排放,看上采样留下的痕迹。再看它的限度:一点噪声就能把它抹掉。
- 一段被造出来的声音 同一段人声,先粗糙地造一遍,再精细地造一遍:听出差别,在频谱上看到它,也看懂它为什么在电话里就没了。
- 水印 一个文件声明出来的出处,毫不费力就会掉。统计水印在文本或图片里更耐折腾,但也不是无敌的。
- 什么时候不要用它 三个用来决定的检验:出错的代价、可核查性、正当性。以及为什么 AI 检测器永远不能用来指控一个人。
演示
- 被切碎的词 模型读到的既不是字母也不是词,而是靠统计学来的碎片。BPE 方法当场演示,以及它在不同语言上的代价。
- 下一个词 模型怎么给每一个可能的词算出一个概率,再从里面抽一个,以及温度、top-k 和 top-p 怎么改变这次抽取。
- 为什么它会编造 同一个玩具模型,面对语料里有的开头和语料里没有的开头,回答得一样笃定。答案本身没有任何东西能分出这两种情况。
- 偏见从哪里来 把一份数据集的构成扭一下,在它上面学出来的模型会把这个扭曲一丝不差地还回来。偏见是后果,不是意图。
- 一张被造出来的图片 本页现场造两张图片,把它们的频谱并排放,看上采样留下的痕迹。再看它的限度:一点噪声就能把它抹掉。
- 一段被造出来的声音 同一段人声,先粗糙地造一遍,再精细地造一遍:听出差别,在频谱上看到它,也看懂它为什么在电话里就没了。
- 水印 一个文件声明出来的出处,毫不费力就会掉。统计水印在文本或图片里更耐折腾,但也不是无敌的。
三条路线
- 给青少年 写给青少年的课程路线:十五岁该按什么顺序走完它,从一份交上去的作业,到一通模仿熟人声音的来电。
- 给工作中的人 把这门人工智能课程用在职业场景里该怎么走:什么最要紧、要先看,以及走完之后会做什么。
- 给上课的人 在课堂上讲这门课各个概念的顺序、一堂可以直接拿去上的课、这个题目的坑,以及备课要用的官方框架。
博客
- 上传的文件后来怎么样了 交给一个使用 AI 的服务之后,一份内容可能遭遇什么,以及在上传一个文件之前该问自己的那个问题。
- 学校里的 AI 检测器 AI 生成文本检测器承诺什么、实际上做什么,以及在学校里由谁来为它们的错误付账。
- 核查这个动作 怎么用三步去核查一份机器产出的摘要:重新打开来源、找回被抹掉的分寸、核对日期。
- 它不知道自己不知道 为什么语言模型能用和陈述一个准确事实同样的笃定去断言一个错误,以及它的训练奖励了什么。
- 一种语言的价钱 为什么同一个问题用两种不同的语言问,算起来价钱不一样:切成词元这件事改变了什么。
本服务
- 术语表 本课程用到的词,用大白话定义,每一条都用锚点连回它所属的章节:词元、幻觉、偏见、水印、黑箱。
- 官方框架 经合组织与欧盟委员会的框架、教科文组织的两份框架,以及一份非欧洲框架:它们要求知道什么,本课程在哪里给出。
- 模块:欧盟的那项义务 欧盟人工智能条例第 4 条在素养方面要求什么、不要求什么,以及本课程在哪里覆盖它。
- 订阅更新 不交出邮箱地址也能追新内容:什么是订阅源、怎么订阅,以及本站为什么宁愿用它而不发邮件通讯。
- 关于 本站是什么、不是什么,把每个事实系回它来源的那套方法,谁在负责,以及为什么不用向外发送任何东西就能核查它。
- 网站地图 本站所有页面,按板块归好,每一页配一句说明,另有 sitemap、博客订阅源和开放数据。
- 常见问题 对本站最常被问到的问题给出简短、可核查的回答:人工智能、价格、你的数据、语言、ODERSA。
- 许可与再利用 The AI Manual 的 CC BY 4.0 许可允许什么:复制、改编、翻译、打印、再发布,包括用在收费培训里,只要注明来源。
- 鸣谢与来源 The AI Manual 的鸣谢与来源:官方框架、按主题排列的科学来源、字体许可、演示所用语料,以及零第三方依赖。
- 联系 联系 The AI Manual:一个地址给服务,另一个给协会。用电子邮件,不用表单,也不用账号。
- 报告错误 在 The AI Manual 上报告一个错误:日期写错、链接失效、来源换了地址,用电子邮件,不用表单也不用账号。
换个方式浏览
这一页是给屏幕看的。同样的信息还有别的格式,供软件读取,也供不想再回访本站的人使用。
- sitemap,给搜索引擎和爬取本站的软件用:/sitemap.xml。
- 博客订阅源,不用回到这一页也能追文章:/flux.xml。订阅更新这一页讲的是怎么订阅。
- 开放数据,给想在网页之外拿到本站数字和语料的人:/data/impact.json 和 /data/pages.json。
本站服务的页面没有一个能漏出这份地图:地图和 sitemap 由同一次构建、同一次清点写出来。