这门课依据的东西
The AI Manual 里的每一份官方框架、每一条科学来源、每一款字体和每一份内嵌语料都登记在这里,并带一个能打开、能核对的网址。
署错来源比不署来源更糟。本页的每一条来源,在被引到这里之前都在它的网址上打开过:没有一条是凭记忆抄的。
本页内容
官方框架
The AI Manual 梳理了四份人工智能素养框架,其中三份是国际性的,一份是国家层面的,还有那些细化它们、或把它们接到欧盟法律上的文件。这些来源在 2026 年 8 月 13 日在线核对过。
- Empowering Learners for the Age of AI: An AI Literacy Framework for Primary and Secondary Education(“AILit Framework”),经合组织与欧盟委员会(教育总司 / Digital Education Hub),得到 CodeAI(原 Code.org)支持,2026 年。 该框架的参考页面:面向中小学的四个能力领域、十九项能力,2026 年 6 月 17 日和 18 日发布。
- Empowering Learners for the Age of AI(完整报告,PDF),OECD Publishing(巴黎),与欧盟委员会合作,2026 年。 同一份框架的完整报告,附中小学的课堂示例。
- AI Competency Framework for Students,联合国教科文组织,2024 年。 面向学生的框架:十二项能力,分三个层级,理解、应用、创造。
- AI Competency Framework for Teachers,联合国教科文组织,2024 年。 面向教师的框架:十五项能力,是第一份此类全球框架。
- Regulation (EU) 2024/1689(AI Act):合并版本,第 4 条“AI literacy”,欧盟,EUR-Lex,2024 年,合并至 2026 年 7 月 27 日。 压在任何系统提供者和部署者身上的人工智能素养义务,不论该系统属于哪个风险等级。
- Regulation (EU) 2026/1744,2026 年 7 月 8 日(“Digital Omnibus on AI”):第 1 条第 5 款修订第 4 条,欧盟,EUR-Lex,2026 年。 正是这份条例把那项结果义务改成了尽力义务,自 2026 年 7 月 27 日起生效。
- AI Literacy: Questions & Answers,欧盟委员会,AI Office,2025 年,2026 年 7 月 27 日更新。 不要求任何可测量的门槛:所要求的努力与执行方的角色和系统的风险相称。
- AI4K12: Five Big Ideas in AI,AAAI 与 CSTA(美国人工智能促进会 / 计算机科学教师协会),由美国国家科学基金会资助(资助号 DRL-1846073),2018 年。 一份美国框架,引用它是为了让欧盟那个模块始终只是摆在地基旁边的模块,绝不成为地基本身。
科学与技术工作,按主题
本课程的每一句技术论断都带着一篇在 2026 年 8 月 13 日在线核对过的论文,这里按主题归拢,而不是排成一张读不下去的长单子。演示页面和博客文章另外还在各自的页脚列出与自己主题相关的论文。
分词
这些工作确立了一段文本怎么被切成比词更小的单位,以及为什么这个切分在某些语言上比在另一些语言上更费钱。
- Neural Machine Translation of Rare Words with Subword Units,Rico Sennrich 等,2016 年。
- A New Algorithm for Data Compression,Philip Gage,1994 年。
- Language Model Tokenizers Introduce Unfairness Between Languages,Aleksandar Petrov 等,2023 年。
预测与采样
这些工作展示了模型怎么从一个概率分布里挑出一个词,以及温度和 top-k 或 top-p 截断怎么改变这次挑选。
- The Curious Case of Neural Text Degeneration,Ari Holtzman 等,2020 年。
- Distilling the Knowledge in a Neural Network,Geoffrey Hinton 等,2015 年。
- Hierarchical Neural Story Generation,Angela Fan 等,2018 年。
幻觉
这些工作解释了模型为什么会一脸笃定地编造:这是它被训练和被评测的方式带来的后果,不是一次孤立的故障。
- A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions,Lei Huang 等,2023 年。
- Why Language Models Hallucinate,Adam Tauman Kalai 等,2025 年。
- Hallucination is Inevitable: An Innate Limitation of Large Language Models,Ziwei Xu 等,2024 年。 有争议:这项工作主张,对一个被当作通用问题求解器使用的模型来说,一定比例的幻觉在数学上不可避免;后续工作质疑它的形式假设是否适用于模型有限的真实用法。
偏见
这些工作测出:训练语料里存在的人类偏见,会在由它们得出的模型里再次出现,而且可以测量。
- Man is to Computer Programmer as Woman is to Homemaker? Debiasing Word Embeddings,Tolga Bolukbasi 等,2016 年。
- Semantics derived automatically from language corpora contain human-like biases,Aylin Caliskan 等,2017 年。
- Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification,Joy Buolamwini, Timnit Gebru,2018 年。
- Datasheets for Datasets,Timnit Gebru 等,2018 年。
数据的记忆
这些工作证明:仅靠普通提问,模型就可能把它训练数据里的片段一字不差地还出来,其中包括个人信息。
- Extracting Training Data from Large Language Models,Nicholas Carlini 等,2021 年。
- Quantifying Memorization Across Neural Language Models,Nicholas Carlini 等,2023 年。
- Scalable Extraction of Training Data from (Production) Language Models,Milad Nasr 等,2023 年。
被造出来的图片
这些工作找出了会露出一张生成图片马脚的技术伪影,并指出人眼在近期的合成人脸上已经看不出它们。
- Leveraging Frequency Analysis for Deep Fake Image Recognition,Joel Frank 等,2020 年。
- Detecting and Simulating Artifacts in GAN Fake Images,Xu Zhang 等,2019 年。
- AI-synthesized faces are indistinguishable from real faces and more trustworthy,Sophie J. Nightingale, Hany Farid,2022 年。
被造出来的声音
这些工作给合成人声的检测及其限度定了位,还有一家公共机构记录了一起真实的克隆人声诈骗案。
- WaveFake: A Data Set to Facilitate Audio Deepfake Detection,Joel Frank, Lea Schönherr,2021 年。
- ASVspoof 2021: Towards Spoofed and Deepfake Speech Detection in the Wild,Xuechen Liu 等,2021 年。
- FCC Makes AI-Generated Voices in Robocalls Illegal(FCC 24-17 声明),美国联邦通信委员会(FCC),2024 年。
水印与出处
这些工作描述了证明来源的两大类做法:一份附在文件上的清单,和一个插进生成文本里的统计水印,以及各自的限度。
- Content Credentials: C2PA Technical Specification (version 2.4),Coalition for Content Provenance and Authenticity (C2PA),2026 年。
- C2PA Frequently Asked Questions,Coalition for Content Provenance and Authenticity (C2PA),2026 年。 这个标准自己承认,一份出处清单可以和文件分离,因此会因为一次简单的截屏而丢失。
- A Watermark for Large Language Models,John Kirchenbauer 等,2023 年。
- Scalable watermarking for identifying large language model outputs,Sumanth Dathathri 等,2024 年。 SynthID-Text,一个已在《自然》期刊发表并经过同行评议的统计水印。
检测器
这些工作表明 AI 生成文本检测器会出错,而且有据可查地对英语非母语者不利,以至于有一家厂商把自己的工具撤了。
- GPT detectors are biased against non-native English writers,Weixin Liang 等,2023 年。
- OpenAI scuttles AI-written text detector over 'low rate of accuracy',Devin Coldewey,TechCrunch,转述 OpenAI 的一份官方补充说明,2023 年。
- Testing of detection tools for AI-generated text,Debora Weber-Wulff 等,2023 年。
物质代价
这些工作用数字说明了一项快速增长的能耗,以及把同样一件任务交给专用系统时的巨大落差。
- Energy and AI,国际能源署(International Energy Agency, IEA),2025 年。
- Power Hungry Processing: Watts Driving the Cost of AI Deployment?,Alexandra Sasha Luccioni 等,2024 年。
字体
本设计系统的两款字体以 woff2 格式内嵌在 site/assets/css/fonts/ 里:不向任何字体服务发请求,也不用 CDN。它们的许可在 2026 年 8 月 14 日按承载许可的那个文件的网址在线重读过。
- Source Serif 4,SIL Open Font License 1.1 版,Adobe,2014 至 2023 年,保留名称“Source”。 内嵌的 woff2 字体,字重 500 和 600,斜体 400:它们承担本站的标题。
- Public Sans,SIL Open Font License 1.1 版,The Public Sans Project Authors,2015 年。 内嵌的 woff2 字体,字重 400、600 和 700,斜体 400:它们承担正文。这是美国公共服务设计系统 USWDS 的字体。
SIL Open Font License 允许使用、修改和再分发这两款字体,唯一的条件是不得把它们单独转售,并且要把许可随字体一起保留。
演示所用的语料
演示里只内嵌了一部第三方作品,而它属于公有领域。另外还有两段文本完全出自 ODERSA:一段用来比较同一份内容在不同语言下的情况,另一段用来显示一份语料的构成怎么把一个模型带偏。
一部公有领域的作品
《八十天环游地球》(Le Tour du monde en quatre-vingts jours),儒勒·凡尔纳,1873 年。属于公有领域:儒勒·凡尔纳于 1905 年 3 月 24 日去世,他的法文作品早已在各地不再受著作权限制。这部小说的前 623 段,约 25,288 个词,构成本课程玩具模型训练所用的语料。所有改动都是排印上的,都可逆,也都在语料文件里声明过:撇号统一为印刷体,转录里的破折号和引号去掉,斜体标记去掉,章节标题和目录剔除。一个只读过这段 1873 年文本的模型,不可能知道此后发生的任何事:这正是那个演示要显出来的东西。
一段自家的文本
同一句话,用 ODERSA 这支站群计划提供的 7 种语言写出来,用来比较同样一个意思在不同语言下需要多少个单位。这段文本就是 ODERSA 信任横幅本身的文字,已经以 CC BY 4.0 许可协议发布:它不是第三方语料,因此不带来任何权利问题。
一份在你眼前造出来的语料
讲偏见从哪里来的那个演示不借用任何文本:它的语料是自己造的,由两个句型、八个职业名和八个城市名拼出来。构成由你来调,而这正是那一页的全部用意:一个模型给不出它从没读过的东西。这份语料和 1873 年那部小说一样是用法语写的,句子形如“Elle est ingénieure.”(她是工程师。),另外六个语言版本的页面也各自用自己的语言说明了这一点。它出自 ODERSA:不是第三方语料,因此不带来任何权利问题。
让这些演示跑起来、在这些语料里抽取并计算概率的引擎,是 ODERSA 自己写的代码:它不是第三方库,而本站也没有内嵌任何第三方库。
示意图
本站的每一张示意图都是由 ODERSA 手工绘制的 SVG,里面没有照片,也没有向第三方域名请求的图片。每一张都和本站其他内容一样,可依 CC BY 4.0 许可协议再利用,它的图片说明里也写着这一点。
正因如此,信任横幅才能承诺没有任何请求从打开本站的设备发出去:和字体、脚本一样,没有任何图片是远程请求来的。
照片
The AI Manual 的每一张照片都用在一个具体的页面上,而图片下方的说明里已经写着作者。下面这张表把每一张连同它的完整许可、在 Wikimedia Commons 上能证明它的网址,以及使用它的页面汇总在一起。
| 它显示什么 | 作者 | 许可 | Wikimedia Commons 上的凭证 | 用在哪一页 |
|---|---|---|---|---|
| 一台笔记本电脑的背光键盘,大部分手指停在基准键位上,U 键被按下 | Colin | CC BY-SA 4.0 | 文件页面 | 首页 |
| 巴黎圣热纳维耶夫图书馆的阅览室,拱顶下是长桌和一排排书架 | JOHN TOWNER heytowner | CC0 | 文件页面 | 偏见从哪里来 |
| 一间技术机房,几十根网线汇集在配线架上 | Brian Hankins (Bhankins) | 公有领域 | 文件页面 | 我们交给它什么 |
| 一名摄影师蹲在足球场边,手里拿着一支长焦镜头 | Ximeg | CC BY-SA 3.0 | 文件页面 | 一张被造出来的图片 |
| 录音棚里,几支立在支架上的话筒围着一套架子鼓 | dan paluska | CC BY 2.0 | 文件页面 | 一段被造出来的声音 |
| 一间空的阶梯教室,从后排看过去是一排排座椅和写字板 | Yinan Chen | 公有领域 | 文件页面 | 给上课的人 |
这些照片里有两张,首页的键盘和“一张被造出来的图片”那一页的摄影师,采用相同方式共享的许可,即 CC BY-SA。The AI Manual 的文字采用 CC BY 4.0,许可页面已经说明;这两张照片保留它们自己的许可,不会跟着换。所以重用承载它们的那个页面时,必须以同一份相同方式共享的许可、连同它的署名一起再发布这张照片,而不是按本站其余内容的条款。
本页所有照片都内嵌在这个仓库里,从本站的域名提供,绝不向第三方地址请求,和字体、示意图一样。正因如此,信任横幅才能承诺没有任何请求从打开本站的设备发出去。
本站不欠任何别人的东西
- 没有依赖:没有一行代码是从第三方库借来的。
- 没有 CDN:字体、脚本和图片全都内嵌在这个仓库里。
- 不调用任何人工智能服务:所有演示都是确定性的,完全在打开它们的那台设备上运行。
- 这些页面里没有任何统计工具,没有 cookie,没有账号:没有任何东西识别是谁打开了这一页。
这一点几秒钟就能核实,在页面加载的时候看浏览器的“网络”标签页:没有任何请求出去。