术语表
本课程用到的每一个词,都在这里讲清楚,并带一个锚点,好让某一章直接链过来。
这个领域的日常词汇容易骗人,而弄清它为什么骗人,也是这门课的一部分。那些从人的心智借来的词,“理解”“知道”“学习”“幻觉”,在这里描述的是一次计算,绝不是一种内心状态。语言模型不理解任何东西,不知道任何东西,也不像一个人那样学习任何东西:它在一份语料上调整数值参数,然后根据收到的输入文本算出一段概率高的续写。说它“出现幻觉”并不是在描述一种病症:这是给一个说得通但错误的结果起名字,而产出它的正是那个也会产出正确回答的计算。这份术语表保留这些词,因为课程和研究都在用它们,但每一条定义都会把它们带回它们真正指的那次计算。
词条
词条按法语原文的字母顺序排列,每一条都带一个锚点:课程的某一章可以直接链到它上面。一条定义里带链接的词,在这份清单里、上面或下面,都有它自己的词条。
- 笃定
- 一个回答那种确信的口气,不管它对不对。模型编造的时候不会把口气压低:它的措辞里没有任何东西能把一个核对过的事实和一次幻觉区分开。所以,一个回答的笃定从来不是它正确的证据。
- 机器学习
- 一类方法:程序从例子出发调整自己的行为,而不是照着一条条手写的规则走。语言模型和图像生成器是它的两种应用。深度学习是它今天用得最多的分支。
- 深度学习
- 用一个由许多层叠起来的神经网络来做机器学习的方式。每一层都把上一层传来的信息再变换一点,从而找出手写规则抓不住的规律。这就是今天的语言模型和图像生成器背后的技术。
- 伪影
- 一张图片或一段声音在被造出来时留下的痕迹,眼睛或耳朵察觉不到,但可以用计算测出来。举例来说,生成过程中把图片放大的那些运算,会留下一个规律的印记,在文件的频率细节里找得到。伪影有助于发现一张被造出来的图片,但较新的模型留下的越来越少。
- 偏见
- 模型复现出来的一种系统性偏差,是从训练它的那份语料的规律里学到的,从来不是它自己形成的某种观点。如果数据把某个职业更常和某个性别关联在一起,模型就会还回同样的关联,程度也相同。代表性偏差是它的一种特殊形式:它来自数据里缺的东西,而不是数据里多出来的东西。
- 代表性偏差
- 这种偏差来自某个群体、某种情形或某种语言在训练数据里缺席或占比过低,而不是来自一种被扭曲的关联。比如一个图像分类系统,对深色皮肤女性的错误率高达 34.7%,对浅色皮肤男性则为 0.8%,这个差距与训练数据的构成有关。数据里没有的东西,模型给不出来:它不是在这上面弄错了,它是根本不知道。
- 黑箱
- 一个可以观察它的回答、却读不到它内部推理的系统,哪怕你是设计它的那个人。语言模型在这个意义上是黑箱:它的参数,也就是在训练中被调整的几十亿个数字,单个拿出来并没有一个人能逐个读懂的意义。这并不妨碍去测试这个系统实际上做了什么,只是无法解释它为什么恰好这么做。
- 声音克隆
- 一种从一段音频样本出发、复现某个特定人声的技术,用来让这个人说出他从没说过的话。美国的一家公共机构就曾记录并处罚过一起真实行动,其中用克隆出来的声音模仿一位政界人士,在选举前向选民播放。它是深度伪造专门用在声音上的一种形式。
- 语料
- 模型学习所用的那批文本、图片或声音,是它唯一的规律来源。数据集是为某个明确用途整理过、并有文档的语料;语料这个词指的是原始内容,在这项整理工作之前。不在语料里的东西,对模型来说以任何方式都不存在:既不作为罕见的东西,也不作为错误的东西。
- 检测器
- 一种声称能判断一段文本、一张图片或一段声音是否由模型产出的工具。一项针对十四款文本检测器(其中包括卖给教育机构的商业工具)的独立评测,没有找出任何一款同时做到可靠和精确。检测器从来给不出判决:最好的情况下,它给出一条需要交叉印证的线索。
- 概率分布
- 可以用来接下去写的词元清单,每个词元配一个零到一之间的数字表示它的概率,所有数字加起来等于一。模型每一步都算出这张清单,然后由一次采样从里面挑一个词元。温度、top-k 和 top-p 是在抽取之前修改这张清单的三种方式。
- 采样
- 从模型算出的概率分布里挑一个词元的那个动作,而不是一律拿概率最高的那个。一律拿最高的会产出平淡而重复的文本;按概率抽签,并且可以先用温度、top-k 或 top-p 重新框一下范围,产出的文本更自然。
- 训练
- 在对外提供之前进行一次的那次计算,它调整模型的参数,让它越来越好地还出它语料里的规律。训练一结束,这些参数就固定了:之后用它们去产出一个回答是另一项操作,叫推理。微调是第二次训练,更短,在一份更窄的语料上做。
- 训练数据提取
- 指通过向模型提一个普通的问题,拿到一段一字不差地存在于它训练语料里的文字。研究者就曾用一个简单的方法,从真正投入生产的模型里提取出数千兆字节的训练数据。这是记忆最直接的证据:它不再是一种理论上的可能,而是一段被找回来的文字。
- 误报与漏报
- 检测器出错的两种方式:误报把人写的内容指为模型产出,漏报把模型产出的内容放过去、说它是人写的。几款使用很广的文本检测器就把英语非母语者的文本中的大多数错判为机器生成,而对母语者的文本却识别正确:这种误报不是随机分布的。一个想减少这两种风险之一的工具,几乎总会把另一种加大。
- 上下文窗口
- 模型为算出一个回答,一次最多能纳入考虑的文本量,按词元计。写在这个窗口之前的东西,不再进入当前这次计算,完全就像它从未存在过一样。一份比窗口更长的文件,必须先切开或先摘要,才能整份交给模型。
- 水印
- 刻意放进生成内容里的一个信号,在日常使用中看不出来,而专门的工具能把它找回来。在文本里,它可以表现为每一步都对某些词略加偏袒,这种偏袒太不显眼,读的时候看不出来,但可以用计算检出,这套方法已经发表并经过同行评议。水印的前提是:放下它的那个工具,或者另一个知道这套方法的工具,还存在着,能去寻找它。
- 图像生成器
- 一种从文字描述出发产出一张新图片的系统。今天最常用的方法是扩散模型。和语言模型一样,图像生成器并没有见过某个真实场景去照抄:它是从训练语料的视觉规律里,拼出一张说得通的图片。
- 幻觉
- 一个编造出来的回答,但用和正确回答同样的笃定说出来。它出自和其他任何回答同一个计算:在模型的运作里,没有任何东西把一个核对过的事实和一次说得通的外推分开,而当前的训练和评测流程还奖励说得通的回答,而不是承认不确定。一项理论工作主张,对这类模型来说一定比例的幻觉在数学上不可避免;这个结论仍有争议,其他工作质疑它的假设是否适用于真实用法。
- 深度伪造(deepfake)
- 由模型造出或改动的图片、视频或声音,用来让人相信一件从未发生的事。声音克隆是它的一种形式,用在声音上。人类观察者已经无法可靠地把近期的合成人脸和真实人脸区分开,甚至平均而言觉得合成人脸更值得信任。
- 推理
- 用一个已经训练好的模型产出回答的那次计算,与之相对的是先前把它的参数固定下来的训练。每当一条提示词得到回答,发生的就是这件事:没有任何参数改变,只有一次计算在已经定好的数值上跑。
- 提示词(prompt)
- 作为输入给模型、用来得到一个回答的那段文字。它的写法会改变模型给出的东西,因为模型是根据这段确切的文字、而不是别的任何文字算出续写的。提示词仍然只是普通文字:它不像一个程序那样命令什么,它只是引导一次概率计算。
- 词元(token)
- 模型处理的最小文本单位,往往比一个完整的词更短。这样一来,一个罕见词或没见过的词就会被切成好几个由已知片段组成的词元,从而在从没见过它的情况下也能处理它。每个词元在任何计算之前都会被换成数字:模型从来不读字母,它读的是数字。
- 数据集
- 一份为明确用途整理过、并有文档的语料:它的构成、来源和收集方式应当是清楚的,而不只是它的内容清楚。为此,从 2018 年起就有一份标准化的文档提案,目的是在发现偏见时能回溯到源头,而不是等模型上线之后才发现。一份没有文档的数据集,实际上只是一份语料。
- 人工智能素养
- 那一整套知识、技能和态度,使人能够使用一个人工智能系统、对它提出质疑,并且对某些人群而言还能设计它,而不是盲目听从它。2026 年由经合组织与欧盟委员会发布的一份共同框架把它分成四个能力领域,为中小学教育设计。这份框架以及补充它的那些国际框架的细节,汇集在官方框架页面。
- 记忆
- 指模型有可能把它训练数据里的一个片段一字不差地还出来,而不是换个说法。这个现象会随模型规模、随同一份内容在数据里被重复的次数、以及随要求续写之前放进上下文的文本长度而增强。模型里没有一份卷宗可以从中找回这段文字:是这份内容改变了它的参数,而正是这次改变,在某些情况下能让它几乎原样重现。
- 元数据
- 附在一个文件上、而且讲的是这个文件本身的信息:它的来源、创建日期、经过的修改,而不是它显示的内容。一条出处数据就是元数据的一种。元数据可能因为一次简单的截屏、或者一次换格式保存就消失,所以它作为证据是脆弱的。
- 扩散模型
- 一种技术:从一片随机的视觉噪声出发,再一步一步把噪声去掉,直到显出一张说得通的图片,整个过程由一段文字描述引导。这是今天图像生成器背后最常用的方法。和任何生成图片一样,结果可能带着一个揭示它是被造出来的伪影,哪怕肉眼什么都看不出来。
- 语言模型
- 一个在文本上训练出来的系统,它根据前文算出最有可能接下去的那个词元。它一个词元接一个词元地重复这个计算,拼出一整个回答。除了这个计算,它不查任何事实库:它给出的一切都来自同一项操作,无论那是一个核对过的事实还是一次幻觉。
- 参数
- 模型内部的一个数字,在训练中被调整,会影响它的计算。它也叫权重。一个模型有几十亿个参数,而其中任何一个单独拿出来,都没有一个人能读懂的意义:产出有用计算的是它们的整体,从来不是某一个参数。
- 词嵌入(embedding)
- 把一个词或一个词元表示成一串数字,这串数字是在训练中构造出来的,目的是让在相近上下文里使用的两个词得到相近的数串。在大规模普通文本语料上学出来的词嵌入,就会复现可测量的性别刻板印象,例如把某些职业更强地关联到某一性别而不是另一性别。所以,词嵌入讲出的关于原始语料的信息,和它讲出的关于这些词本身的信息一样多。
- 出处
- 一个文件来源及其修改历史的可核验记录,它附在文件上,而不是藏在文件内容里。一份公开的技术规范 C2PA 定义了怎样以带签名、可核验的方式附上这项信息。这个标准自己也承认,这项信息可以和文件分离,因此会因为一次简单的截屏而丢失:出处保护的是原始文件,不是它的副本。
- 微调(fine-tuning)
- 第二次训练,更短,在一份更窄的语料上做,用来把一个已经训练好的模型调整到某项任务或某种风格上。它从第一次训练得到的参数出发,而不是从零开始。经过微调的模型仍然是一个语言模型:它的计算机理没有变,只是它的参数移动了一点。
- 神经网络
- 一种由若干层简单单元组成的计算结构,每个单元把收到的东西和它自己的参数结合起来。这个名字来自对生物神经元的一点遥远启发,但网络里的一个单元并不思考,就像一个孤立的神经元也不思考:产出有用计算的是通过训练对整体所做的调整。Transformer 是今天在文本上用得最多的这类架构。
- 开源
- 指一个模型的代码、参数或两者都被公开,好让别人能检视、复用或核验它,而不是只能通过一个封闭的服务去访问它。开放本身对所用的训练数据什么都没说:一个模型可以公开它的参数,却从不为它的语料写文档。所以“开源”和“有文档的数据集”仍然是两项不同的保证,而且很少同时具备。
- 温度
- 一个在采样之前,把模型算出的概率分布变软或变硬的参数。温度越高,各个可能词的概率就越靠近,选择就越难预料;温度越低,就越加大那个本来概率最高的词的优势。这不是一个物理量:这个词是从统计物理的一个公式里借来的,和真实的热没有关系。
- 分词
- 在任何计算之前把一段文本切成词元的那项操作。今天最常用的方法,最初来自 1994 年的一个数据压缩算法,在设计时和语言毫无关系。同一份内容翻成不同语言后,所需的词元数量最多可差到十五倍,这让某些语言比另一些处理起来更慢、也更费钱。
- Top-k
- 一种把每一步的抽取限制在概率最高的 k 个词元里的方法,k 是事先定好的一个数字。概率最低的那些词元因此在采样之前就被剔除,这样既避免了一个过于离谱的选择,又不会让结果完全可预料。
- Top-p
- 一种把抽取限制在“累计概率达到 p 的最小一组词元”里的方法,而不是像 top-k 那样限制在固定数量的词元里。所以这一组的大小会一步一步变化:当好几个词的概率都很接近时它很大,当一个词大幅领先其他词时它就很小。这种方法也叫核采样,它取代了一律挑概率最高的词那种更平淡、更重复的做法。
- Transformer
- 今天各种语言模型背后的神经网络架构。它不是严格按顺序一个词元一个词元地读文本,而是一次性把每个词元和上下文窗口里所有其他词元作比较,并给它们彼此之间的重要性加权。正是这套同时比较的机制,才使人们能在比过去大得多的语料上训练模型。
看这些概念动起来
这份术语表把词汇定下来。理解这门课一章一章地用它们,而演示让它们动起来:在那里可以调一个温度,可以扭一份语料,可以看着一个水印浮出来。
来源
凡是牵涉一个具体事实的定义,都在这里逐词条系上它的来源,免得每条定义本身被压得太重。
- Detecting and Simulating Artifacts in GAN Fake Images,Xu Zhang, Svebor Karaman, Shih-Fu Chang,2019 年。 伪影。生成图片所用的上采样部件会留下一个特征鲜明、可复现的频谱指纹。
- Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification,Joy Buolamwini, Timnit Gebru,2018 年。 代表性偏差。商用的图像性别分类系统对深色皮肤女性的错误率高达 34.7%,对浅色皮肤男性则为 0.8%。
- FCC Makes AI-Generated Voices in Robocalls Illegal(FCC 24-17 声明),美国联邦通信委员会(FCC),2024 年。 声音克隆。一家美国公共机构记录并处罚了一起真实的克隆人声欺诈行动,该行动在一次选举前模仿了一位政界人士。
- Testing of detection tools for AI-generated text,Debora Weber-Wulff 等,2023 年。 检测器。评测了十四款检测工具:没有一款同时做到可靠和精确。
- The Curious Case of Neural Text Degeneration,Ari Holtzman, Jan Buys, Li Du, Maxwell Forbes, Yejin Choi,2020 年。 采样与top-p。一律挑概率最高的词会产出平淡而重复的文本;把分布中不可靠部分截掉的核采样产出的文本更自然。
- Scalable Extraction of Training Data from (Production) Language Models,Milad Nasr 等,2023 年。 训练数据提取。通过一次简单的攻击,从真正投入生产的模型里提取出了数千兆字节的训练数据。
- GPT detectors are biased against non-native English writers,Weixin Liang, Mert Yuksekgonul, Yining Mao, Eric Wu, James Zou,2023 年。 误报与漏报。几款使用很广的检测器把英语非母语者的文本中的大多数错判为 AI 生成,而对母语者的文本却识别正确。
- A Watermark for Large Language Models,John Kirchenbauer, Jonas Geiping, Yuxin Wen, Jonathan Katz, Ian Miers, Tom Goldstein,2023 年。 水印。可以在生成的文本里插入一个人眼看不见的统计水印,之后用一个统计检验把它检出来。
- Scalable watermarking for identifying large language model outputs, Sumanth Dathathri, Abigail See, Sumedh Ghaisas, Po-Sen Huang, Rob McAdam, Johannes Welbl 等,2024 年。 水印。一个整合进文本生产过程的统计水印,已在《自然》期刊发表并经过同行评议。
- Why Language Models Hallucinate,Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, Edwin Zhang,2025 年。 幻觉。当前的训练和评测流程奖励的是产出一个说得通的回答,而不是承认不确定。
- Hallucination is Inevitable: An Innate Limitation of Large Language Models, Ziwei Xu, Sanjay Jain, Mohan Kankanhalli,2024 年。 幻觉。有争议:这项工作主张对这类模型而言一定比例的幻觉在数学上不可避免;后续工作质疑它的假设是否适用于模型有限的真实用法。
- AI-synthesized faces are indistinguishable from real faces and more trustworthy, Sophie J. Nightingale, Hany Farid,2022 年。 深度伪造。人类观察者已经无法可靠地把合成人脸和真实人脸区分开,甚至平均而言觉得合成人脸更值得信任。
- Datasheets for Datasets,Timnit Gebru, Jamie Morgenstern, Briana Vecchione, Jennifer Wortman Vaughan, Hanna Wallach, Hal Daumé III, Kate Crawford, 2018 年。 数据集。已有一套标准化提案,用来记录一份数据集的来源、构成和收集方式。
- Empowering Learners for the Age of AI: An AI Literacy Framework for Primary and Secondary Education(“AILit Framework”),经合组织与欧盟委员会, 2026 年。 人工智能素养。经合组织与欧盟委员会发布的共同框架,面向中小学的四个能力领域。
- Quantifying Memorization Across Neural Language Models,Nicholas Carlini, Daphne Ippolito, Matthew Jagielski, Katherine Lee, Florian Tramer, Chiyuan Zhang,2023 年。 记忆。它随模型规模、样本在数据里的重复次数,以及放进上下文的文本长度而增强。
- Man is to Computer Programmer as Woman is to Homemaker? Debiasing Word Embeddings, Tolga Bolukbasi, Kai-Wei Chang, James Zou, Venkatesh Saligrama, Adam Tauman Kalai,2016 年。 词嵌入。在大规模普通文本语料上学出来的词嵌入会复现可测量的性别刻板印象。
- Content Credentials: C2PA Technical Specification (version 2.4), Coalition for Content Provenance and Authenticity (C2PA),2026 年。 出处。一份公开的技术规范定义了怎样把关于一个文件来源的可核验、带签名的信息附在文件上。
- C2PA Frequently Asked Questions,Coalition for Content Provenance and Authenticity (C2PA),2026 年。 出处。这个标准自己承认它的清单可以和文件分离,因此会因为一次简单的截屏而丢失。
- Distilling the Knowledge in a Neural Network,Geoffrey Hinton, Oriol Vinyals, Jeff Dean,2015 年。 温度。softmax 公式里的温度参数会让模型算出的概率分布变软或变硬。
- A New Algorithm for Data Compression,Philip Gage,1994 年。 分词。今天用于分词的这个算法,最初被设计成一种通用的数据压缩方法,和语言没有关系。
- Language Model Tokenizers Introduce Unfairness Between Languages, Aleksandar Petrov, Emanuele La Malfa, Philip H. S. Torr, Adel Bibi,2023 年。 分词。同一份内容翻成不同语言后,所需的词元数量最多可差到十五倍。
- Hierarchical Neural Story Generation,Angela Fan, Mike Lewis, Yann Dauphin,2018 年。 Top-k。把每一步的抽取限制在概率最高的 k 个词里的 top-k 采样,用来生成比恒定挑选更多样的文本。