十二章候选稿 · 汇总于2026-10-08
第5章 AI怎样生成文字、图像和声音
样章 v0.1 | 2026年9月20日
同一只纸盒,还能怎样讲述
还记得第2章的收纳盒吗?旧纸盒里加了一块隔板,后格放铅笔,前面的浅格放橡皮。原来拿橡皮时,需要先取出几支铅笔;分格以后,可以直接拿到它。
把这段记录交给AI,可以得到一段作品介绍,也可以得到一句简短的使用说明。换一种要求,还可以请它写一段明确虚构的“纸盒独白”:一只原本准备被丢弃的盒子,怎样开始新的生活。
同一份材料,能够通向不同的表达。前两种表达需要忠实说明实物,最后一种则给想象留出了空间。我们提供的材料和要求,参与了这些内容的形成。
上一章研究图像与声音怎样进入计算机。本章转过来看:当AI写出一段原先没有出现在输入中的话,画出一幅图,或合成一句声音时,这些内容从哪里来?它怎样接着已有的内容继续生成?为什么再次提出相同要求,得到的结果有时会变化?
我们先从文字入手,看清其中的数字和计算,再了解训练怎样形成能力,以及图像、声音生成有哪些不同。最后,用同一段自己的说明做一次比较,分清表达的变化、材料以外的补充和有意的想象。
学完本章,你将能够:解释文字怎样转为模型能够处理的数字;说明一种常见的逐步生成过程;区分训练与日常对话;认识图像、声音生成的基本思路;结合自己的材料判断哪些变化可以保留,哪些内容还需要确认。
5.1 文字怎样一步步生成
5.1.1 把文字分成片段并用数字表示
“前格放橡皮,后格放铅笔。”我们一读就知道这句话在安排物品。计算机要处理它,需要先把文字变成数字。
第4章里,照片可以表示为像素数值,声音可以表示为一串采样值。处理文字时,一种常见做法是先把它分成较小的片段。每个片段称为词元(token)。词元不一定是语文课中的一个完整词语:它可能对应一个汉字、几个字、一段字母或标点,具体边界由所用的处理方法决定。[1]
下面用一种便于观察的划分作示例:
前格|放|橡皮|,|后格|放|铅笔|。
这句话在示例中共有8个词元。实际工具可能把“前格”分成更小的片段,也可能采用其他划分。因此,不能把汉字数直接当作所有模型的词元数。
负责划分文字并转换编号的程序,称为分词器(tokenizer)。它使用一份对应表,为各个词元安排编号。下面的编号只用于说明方法:[1]
| 词元 | 示例编号 | 词元 | 示例编号 |
|---|---|---|---|
| 前格 | 17 | 后格 | 18 |
| 放 | 6 | 铅笔 | 35 |
| 橡皮 | 42 | 。 | 4 |
| , | 3 |
于是,上面这句话可以写成:
17,6,42,3,18,6,35,4
“放”出现两次,在这个例子中使用同一个编号6。编号只负责标明片段,42大于35,并不表示橡皮比铅笔更重要。它也没有直接告诉模型,橡皮和铅笔都属于文具。
要让这些片段参与更丰富的计算,还需要把每个编号对应到一组数。这样一组按顺序排列的数称为向量,其中的数值可以通过训练逐渐形成。[2]
例如,可以用“0.2,-0.4,0.7”演示一组数的形式。真实模型通常使用更多数值,这些数值在训练中逐渐调整。它们共同参与表示,不能简单把第一项读成颜色、第二项读成用途。[2]
编号相当于找到对应的入口,一组数则能够进入神经网络的乘、加与变换。经过训练,模型可以利用这些数字之间的关系处理文字。第3章讲过的参数和计算,在这里继续发挥作用。
文字的先后位置也很重要。“前格放橡皮,后格放铅笔”与“前格放铅笔,后格放橡皮”,所用的词元相同,意思却不同。模型需要在计算中利用位置信息,才能区别这些排列。[3]
继续处理时,某个词元的表示还会受到上下文影响。例如,同一个“它”出现在不同句子中,可能指向不同的物品。初始数字表示只是起点,后面的计算还要结合周围内容。
先把这个过程连起来:文字被分成片段,片段转换成编号,编号对应到数字表示;模型再结合位置和上下文进行计算。到输出时,生成的词元编号会转换回文字,让我们读到回答。[1][3]
动手看一看:按本节示例中的划分和编号,把“后格放橡皮,前格放铅笔。”写成一串编号。与原来的数列相比,哪些位置变了?为什么只保留有哪些编号、丢掉它们的顺序,会漏掉重要信息?
5.1.2 利用上下文中的关联生成后续内容
文字变成数字以后,模型怎样决定接下来生成什么?先读两段尚未写完的话:
甲:盒子分成前后两格,铅笔和橡皮各放一格。前格放橡皮,后格放……
乙:盒子分成前后两格,铅笔和橡皮各放一格。前格放铅笔,后格放……
两段话最后都是“后格放”,但根据更前面的安排,甲应当接“铅笔”,乙应当接“橡皮”。决定后续内容时,需要利用前文的关系。
语言模型(language model)学习文字片段之间的关联。一种常见的文字生成方式,是结合已有上下文,为下一个词元的不同候选计算概率,再按一定方法选出一个。选中的词元加入已有内容以后,继续计算下一个,直到输出结束标记或达到程序规定的停止条件。[4][5]
在这种逐步生成方式中,后面的计算会使用前面已经生成的内容。这里先沿着这一条常见路线理解过程。
下面是一组演算数据。为了便于比较,把“铅笔”“橡皮”“尺子”分别看作一个词元,“其他”合并其余候选。
| 候选词元 | 接在甲后面的概率 | 接在乙后面的概率 |
|---|---|---|
| 铅笔 | 70% | 15% |
| 橡皮 | 15% | 70% |
| 尺子 | 5% | 5% |
| 其他 | 10% | 10% |
每一列合计100%。根据这组数,若每次都选概率最高的候选,甲会接“铅笔”,乙会接“橡皮”。上下文不同,候选的分配就可以不同。
还有一种选择方法:按概率进行抽样。可以把甲这一列想成100张小纸片,其中70张写“铅笔”,15张写“橡皮”,5张写“尺子”,10张写“其他”。混匀后抽一张,“铅笔”最有机会被抽到,但一次也可能抽到别的候选。程序用数字实现这种选择,不需要真的准备纸片。[5]
算一算:在这组演算数据中,抽到“铅笔”以外候选的概率是多少?如果连续抽取10次,每次都把纸片放回并混匀,会保证恰好7次抽到“铅笔”吗?
抽样保留了多种继续表达的可能。一个开头可以接出不同句子,前面选中的片段又会改变后面的条件,因此,即使输入相同,完整回答也可能出现差异。实际工具还会调整候选范围或选择方式,有时也会给出相同结果。[5]
要注意,表里的70%描述候选词元在这一步的概率,不能直接读成“这一整段介绍有70%的概率符合实物”。词元选择与事实核对,是需要分别理解的事情。
模型怎样联系较远的内容?
回看甲、乙两段话。仅记住最后的“后格放”还不够,模型需要把“两样东西各占一格”与“前格已经放了什么”联系起来。
注意力机制(attention mechanism)提供了一种利用上下文的计算方法。它根据当前数字表示,计算不同位置的信息应当怎样参与组合,让相关内容对当前结果产生不同程度的影响。[3]
可以先看一个简单的加权计算。假设两处信息中各取一个数,分别是2和6。给它们分配0.8与0.2的权重,组合后是:
0.8×2+0.2×6=2.8
若权重改成0.2与0.8,组合后则是:
0.2×2+0.8×6=5.2
两个输入没有改变,参与组合的程度改变了,结果就不同。实际注意力计算处理的是多组数字,相关权重由模型结合输入计算得到;这里的数值只帮助理解“怎样把不同信息按不同比重合起来”。
这样的计算可以把当前位置与较远的相关内容联系起来。文字生成时,模型利用已经提供的输入和已经生成的内容,不需要提前知道尚未生成的文字。[3]
Transformer是一类组织神经网络计算的结构,它将注意力计算与其他带有参数的变换组合起来,再多层处理信息。模型既利用片段之间的联系,也利用训练中形成的其他计算关系。注意力提供了联系信息的方法,效果还要通过实际任务检查。[3][4]
我们不必把每一层的公式都展开,仍然可以看清主要关系:提供的材料转为数字,模型结合上下文反复计算,输出候选概率,程序选择后续内容。参数来自训练,当前问题与材料则影响本次计算。
做一个很短的观察:把甲、乙两段话分别交给同一个AI对话工具,只要求补出省略号后的物品名称。比较实际结果,再指出自己是根据哪一句前文作出判断的。
若结果正确,可以说明模型在这两个输入中给出了符合安排的回答;若有不同,就回看材料和输出。单凭回答的变化,我们还不能知道内部某个注意力单元具体用了哪些信息。
5.2 大模型的能力怎样形成
5.2.1 从大量材料中进行训练
在第3章,我们用带有“杯子”“橡皮”标签的图片训练分类器。语言模型也需要训练,但文字本身就能提供许多学习目标。
仍然使用“前格放橡皮,后格放铅笔。”按照前面的示例划分,可以从一句话得到多处预测任务:
| 用来预测的前文 | 原文中紧接着的词元 |
|---|---|
| 前格 | 放 |
| 前格|放 | 橡皮 |
| 前格|放|橡皮 | , |
| 前格|放|橡皮|, | 后格 |
训练程序让模型根据前文计算候选概率,再与原文中的下一个词元比较。目标直接从文字的先后关系中取得,无需人为给每一个位置重新填写答案。这里的学习目标就来自数据本身。[4][6]
它与前面的补句体验有所不同。补句时,我们在使用已有模型;这里讨论的是训练程序怎样借助原文调整模型参数。
假设在“前格|放”之后,原文的目标词元是“橡皮”。模型起初只给它20%的概率,训练程序就可以据此计算损失,并调整参数。在后续某次比较中,它对这个目标的概率可能提高到60%。这些数用于说明变化方向,真实训练需要综合许多位置、许多材料的结果。[6]
第3章的“计算—比较—调整”在这里仍然成立。模型不用先完整写出一篇文章,才得到一次反馈;一段文字可以提供很多预测位置。训练中的计算还可以批量进行,但预测某个位置时,要限制模型直接利用目标词元及其后面的内容,避免把要预测的答案提前交给它。[4][6]
如果某个位置允许有多种合理说法,训练时为什么还用原文中的一种作目标?因为这一条材料只提供了实际出现的表达。其他材料会呈现不同说法,大量例子共同影响模型的概率分配。训练目标有助于学习语言规律,也需要结合更广泛的材料与评价理解其效果。
在大量、较广泛的材料上进行基础训练,通常称为预训练(pretraining)。经过这类训练,模型可能学到词语的搭配、句子之间的关系、不同文体的组织方式,以及材料中表达的许多知识与解题方法。[4]
人们将规模较大的这类语言模型称为大语言模型(large language model,LLM)。第3章讲过,参数参与神经网络计算;更多参数可以提供表达复杂关系的空间,但实际能力还与数据质量、训练方法和计算安排有关。仅看“大”或某个参数数量,无法代替实际检验。[4][7]
“预测后续片段”这个目标看起来很小,完成它却可能需要利用相当复杂的联系。前文说把橡皮从前格移到桌上,后文再问它在哪里,就需要处理位置随动作改变的关系;一段制作说明要保持前后顺序,也需要利用步骤之间的联系。通过很多这样的材料,网络有机会形成能够迁移到新输入的处理能力。
这些能力分布在训练后形成的计算关系中。模型使用时会利用它们组织内容,也可能重现某些在训练中记住的片段。因此,不能把每次回答都理解为从某篇文章中取出原句,也不能保证生成文字绝不会与已有材料重合。[9]
训练材料还会影响模型熟悉什么。若某类事物主要以广告形式出现,模型可能更容易生成宣传式表达;如果某种方言、专业名称或生活经验出现得较少,相关表现也需要另外检查。第3章关于数据覆盖范围的认识,在这里仍然适用。
因此,大量材料只是起点。材料怎样选择、怎样处理错误与重复、模型在新任务中表现如何,都需要研究。能够生成通顺的句子以后,还要继续解决一个问题:怎样让它更好地回应人的实际要求?
5.2.2 通过进一步训练改进回答与行为
设想一个善于继续写文章的模型看到“请给收纳盒写两句介绍”,它可能接着写出一串类似的要求。文字衔接得上,却没有完成使用者希望它做的事。
为了让模型更适合问答和协作,可以在预训练基础上安排进一步训练。这一阶段通常称为后训练(post-training),可以采用示范回答、回答之间的比较,以及对任务结果的反馈等材料。[7][8]
先看示范回答。开发者准备“要求与材料—合适回答”这样的例子,让模型学习如何依照要求组织输出。这种有针对性的进一步训练,是微调(fine-tuning)的一种用法。训练会调整参与其中的参数。[7]
例如,材料只说“前格放橡皮,后格放铅笔”,要求写两句真实介绍。示范回答应当交代分格和用途,控制长度,不随意增加尺寸和试用经历。很多不同任务的示范,可以帮助模型学习如何遵循要求,而不只是继续原来的文字。
还可以给同一个要求准备几个回答,比较哪一个更合适。下面是一段示例:
要求:根据现有记录,介绍这个纸盒的分格安排,不补写尺寸。
回答甲:前面的浅格放橡皮,后格放铅笔。两类物品分开放置。
回答乙:这款20厘米长的收纳盒广受欢迎,能让所有人迅速整理桌面。
比较时可以明确指出:甲保留了材料中的关系;乙增加了没有提供的长度和评价。把许多这样的比较用于训练,有助于改善回答与要求的匹配程度。训练程序可以利用这些反馈,继续调整模型参数,使它更倾向于产生符合评价要求的回答。[7]
反馈也可以来自可检查的任务结果。例如,一段程序能否通过规定的运行检查,一道计算题的答案是否符合已知结果。有些后训练方法会利用这样的反馈改进模型解决问题的表现。[8]
这并不意味着一种反馈能够检查所有方面。程序通过几个例子,还需要考虑其他输入;一段文字受到读者喜欢,也不自动保证事实准确。评价重视什么,会影响训练改进的方向。选择示范、制定比较标准和检查实际效果,仍然需要人的知识与判断。
再分清一次:补充材料与训练有什么不同?
你在对话中说“前格放的是橡皮,请把这里改正”,改变的是本次可参考的内容。普通对话生成通常使用当前参数,并不会因为这句话就在当场完成一次模型训练。[10]
开发者把成批任务和回答交给训练程序,计算损失、更新参数,则属于训练。前者帮助当前任务使用已有能力,后者改变模型计算本身。两种方式都可能让下一次看到的回答更合适,需要根据实际过程区分。
某些应用还会另外保存偏好,在后续对话中重新提供给模型。记下并再次提供一条信息,与更新模型参数也有区别。看到工具“记住了”某个要求,不能只凭这一点断定模型刚刚经过训练。
我们在第2章练习观察、提问和修改,现在能够进一步解释这些动作:清楚的语言把相关信息带入当前计算;训练则为模型处理这些信息提供能力基础。二者配合,才可能得到有用的结果。
5.3 生成内容有哪些共同问题
5.3.1 不同形式的内容怎样被生成
文字生成有了一个清楚的解释,接下来看看图像和声音。
我们把能够根据输入条件生成文字、图像、声音等内容的人工智能,通常称为生成式人工智能(generative artificial intelligence)。不同系统生成的数据形式不同,具体计算方法也不完全相同。
图像:从带噪数据中学习,逐步形成画面
你输入“一个分成前后两格的纸质收纳盒,前格放橡皮,后格放铅笔”,图像生成工具需要产生一整幅画面的数字表示,再将其显示为图像。文字说明给出对象与关系,画面还需要确定形状、颜色、位置和光影等细节。[11]
一种重要方法是扩散模型(diffusion model)。先从训练过程理解它:程序取一张训练图片,在它的数字表示中加入不同程度的随机噪声,让模型学习怎样估计应当去掉的噪声或较清楚的图像信息。这里的噪声可以想成随机扰动的数值;加得越多,原来的内容通常越难辨认。[11]
程序知道原来提供了什么,也知道加入噪声的过程,因此可以把模型的估计与相应目标比较,再调整参数。大量图片和不同噪声程度提供许多训练机会。若训练还配有描述文字,模型就能学习文字条件与图像内容之间的关系。[11][12]
生成时,一种典型做法是从随机噪声开始,结合文字条件和当前中间结果,反复估计并更新。许多步以后,逐渐得到一幅图像。可以把这条路线简记为:
文字要求+随机起点 → 多步计算与更新 → 生成的图像
这些计算利用训练学到的规律形成画面。随机起点里没有藏着一张已经拍好的收纳盒照片,生成过程也不必先找到某一张原图,再把它恢复出来。[11]
有些方法先把图片压缩成较小的数字表示,在这种表示中完成主要生成计算,最后再转换回像素。这可以减少直接处理大图的负担。还有方法把图像编码为一系列片段来生成。我们学习的逐步去噪路线是一种代表,不能据此推断每个图像工具内部都完全相同。[12][15]
想象一下,同样是“纸质收纳盒”,纸的颜色可以不同,盒沿也可以有不同形状。输入没有规定这些细节,生成时仍然要把画面填充完整。不同结果可能都符合这段文字,却未必与自己手上的实物一致。
这也说明,生成画面能够帮助探索“可以做成什么样”,而实物照片记录“当时拍到了什么”。两类材料都能用于交流,使用时应当让别人知道它们各自的用途。
声音:从文字或其他条件形成音频
第4章的语音识别把说话内容转成文字。现在把“前格放橡皮,后格放铅笔”转换成可以播放的声音,就是文本转语音(text-to-speech,TTS),也常称为语音合成。[13]
训练语音合成模型时,可以使用录音及其对应文字,让模型学习文字与发音、时长、语调等信息之间的联系。一种路线先根据文字生成声音的中间表示,例如声谱图,再通过另一个模型把它转换成声音波形;也有系统采用音频片段编码或其他生成路线。[13][14]
还记得第4章的声谱图吗?当时它是从已录下的声音计算出来的。在这里,它可以成为模型生成的中间结果,用来形成新的声音。表示方法相通,信息流动的方向发生了变化。
最后得到的音频同样包含随时间排列的数值,播放设备把它转为可以听到的声音。同一句话可以有不同语速、停顿和语调,因而对应不同波形。文字内容相同,并不要求每次合成的全部数值相同。
文字转语音通常以给定文字为内容基础;生成一段音乐或某种环境声,还需要决定旋律、节奏或声响变化等内容。它们都属于声音生成,任务要求却有所不同。一个只能朗读文字的工具,不一定能够直接生成各种声音作品。
三种形式放在一起看
| 希望得到的内容 | 一种代表性的生成路线 | 可以观察的结果 |
|---|---|---|
| 一小段介绍 | 将文字变成数字,结合上下文逐步生成词元 | 词句、信息与前后关系 |
| 一幅收纳盒设计图 | 将文字作为条件,从随机起点逐步更新图像表示 | 物体、分格、颜色与布局 |
| 一句语音介绍 | 根据文字生成声音表示,再形成可播放的音频 | 读了什么,怎样停顿和发音 |
共同点是利用训练形成的能力,结合本次条件计算新的内容。差别在于表示什么数据、怎样安排计算,以及最后怎样检查结果。实际应用也可能组合多个模型,让一个界面同时完成不同任务。
可以再选一种形式体验:把本章的一小段介绍交给语音合成工具,听听文字与读音是否对应;或者给图像生成工具一段简短外形说明,看看它确定了哪些文字没有写出的细节。选择一种即可,主要比较活动仍然围绕下面的文字材料进行。
5.3.2 生成结果中的变化、补充与不确定性
生成内容中的变化,可以帮助我们找到不同的表达和设计。关键在于分清:改变的是说法,还是对事实的陈述;新增的是允许的想象,还是没有依据却被写成真的细节。
以收纳盒为例,把“前面的浅格放橡皮”改成“橡皮放在前面的浅格”,主要改变了句式。写成“这个20厘米长的盒子经过全班试用”,则增加了尺寸与试用经历。现有记录中没有这些内容,就需要另外确认。
允许创作时,增加想象可以成为作品的一部分。请纸盒“说说自己新的生活”,可以写它看着铅笔每天被拿起又放回。读者知道这是虚构,就能按创作来理解。若同样的文字被当作真实试用记录,要求就不同了。
生成结果中,缺少依据或与材料、事实不符,却被表述得像可靠事实的内容,常被称为幻觉(hallucination)。[4]
这种问题可能与训练材料、输入不足、错误关联以及生成过程中的选择等因素有关。模型学到许多有用关系,也可能在信息不足时延续出貌似合适的细节。只看到一段错误文字,通常不足以确定唯一原因。
再生成几次并不能自动解决事实问题。几段文字完全一致,也可能共同重复一个错误;几段文字说法不同,却可能都准确表达同一份记录。检查时,应当回到具体内容与依据。
做一次比较:同一份材料,几次生成
先取出第2章的一段观察记录,也可以另写三五句话,介绍自己熟悉的物品或经历。选一份自己能够核对的短材料即可,不必重新制作作品。
本章示例继续使用下面这段记录:
我用旧纸盒改成了一个桌面收纳盒。后格放铅笔,前格较浅,放橡皮。没有分格时,拿橡皮需要先取出几支铅笔。加上隔板以后,一位同学试用时,伸手就拿起了前格的橡皮。
先生成一段真实介绍。打开AI对话工具,附上自己的材料,再提出要求:
请根据这段记录,写两三句给第一次看见作品的人读的介绍。可以调整说法,保留已有事实,不添加没有提供的尺寸、经历或效果。
读完第一份结果,找出一处表达变化,再看看它有没有增加事实。内容已经准确时,就按准确记录,不需要主动寻找错误。
保持要求,再生成一次。在同一工具中另开一段新对话,使用相同材料和相同要求,尽量不改变其他设置。这样可以减少上一份回答对下一次生成的影响。把第二份结果与第一份并排阅读。
两份结果可能不同,也可能很接近。前面学过,生成方式可以保留不同选择;实际工具还可能包含未显示的设置。这里观察的是这两次实际输出,不据此判断模型内部唯一采用了哪种选择方法。
明确换成创作任务。仍用同一份材料,另开一段对话,将要求改为:
请以这只纸盒为主角,写两三句明确虚构的独白。保留它被改成收纳盒、前格放橡皮和后格放铅笔的安排,其他情节可以想象。
这一次改变了任务性质。先看它是否保留指定安排,再找一处新增的想象。新增内容是否合适,要结合创作要求判断,不能因为材料里没有,就把所有新增句子都当作错误。
最后作出自己的选择。从几份结果中选出两三处值得说明的地方,可以简单写成“原文写了什么—生成内容怎样表达—我为什么保留或修改”。不必逐字给全文分类。下面是判断方式的示例:
| 生成内容 | 与原材料的关系 | 可以怎样处理 |
|---|---|---|
| 橡皮放在前面的浅格 | 保留位置关系,调整句式 | 根据表达需要保留 |
| 全班同学试用后都很满意 | 把一次试用扩大为全班的评价 | 在真实介绍中删去或另行核实 |
| 我这只旧纸盒又有了新工作 | 在明确虚构的独白中使用拟人表达 | 结合创作目的判断是否采用 |
保留自己的材料、两份介绍和一项有理由的选择,就可以结束基本练习。虚构独白也可以留作第7章创作时的材料。
如果某一项事实在不同回答中始终一致,并且与记录相符,可以说明本次生成较好地保持了它。若发现改写扩大了原意,就具体指出从“一位同学”变成了“全班”,而不只写“AI不可靠”。
同样的判断也适用于图像和声音。设计图中的新颜色可以启发下一次制作,却不能证明实物已经涂过这种颜色。合成声音可以朗读一段自己写的介绍,却不能作为某个人确实说过这段话的记录。展示这些材料时,用“设计设想”“合成旁白”等简短说明交代用途即可。
生成工具让我们更容易看到多种可能。真正值得保留的选择,仍然需要联系自己的意图、掌握的材料和作品的读者。它有没有把一个想法表达得更清楚?有没有让别人误会一件尚未发生的事?这两类问题可以放在同一次阅读中考虑。
本章回望
从同一只收纳盒出发,我们看见了文字、图像和声音的不同可能,也开始理解这些内容背后的计算。
文字先分成词元,再转为模型能够处理的数字。模型利用上下文和训练中形成的关系,计算候选内容。逐步生成时,已经产生的内容会继续影响后续结果;不同的选择可能带来不同表达。
能力的形成需要训练。预训练从大量材料中学习广泛的关系,后训练进一步改善回答、行动和解决任务的方式。日常对话补充材料,主要改变当前计算可以参考什么;训练则调整模型中的参数。
图像和声音也通过数字表示生成,但不必沿用同一种文字生成方法。逐步更新图像表示、根据文字形成声音等路线,各自需要适当的训练材料、计算过程和结果检查。
本章的比较让我们区分了三件事情:改换说法、补充事实、展开想象。表达可以有多种选择,事实需要相应依据,创作需要让读者理解作品的性质。
下一章将继续追问:当我们需要一个有根据的答案时,怎样寻找材料、检查引用,并把已经确认和仍然不确定的内容说清楚?
练习与继续探索
1. 解释数字表示。“前格放橡皮,后格放铅笔。”在本章示例中被划分为多少个词元?能否由此断定任何工具都会得到相同数量?编号、表示词元的一组数和词元的位置,分别起什么作用?
2. 看懂一次生成。在5.1.2的演算数据中,甲这一列每次都选最高概率时会选什么?按概率抽样时,又可能发生什么?为什么70%不能直接表示整段回答的事实准确率?
3. 比较两种改变。“在当前对话中补充一条实物记录”和“用一批任务与回答重新训练模型”,分别改变了什么?一个应用在下次对话中再次提供保存的记录,是否足以证明模型参数发生了改变?
4. 为生成材料找合适的用途。一张按文字说明生成的收纳盒图片,与一张实物照片,可以分别帮助回答什么问题?如果要介绍已经完成的作品,你准备怎样使用它们,让读者理解哪些是实物、哪些是设计设想?
5. 为文字选择声音。把一句作品介绍合成为语音,需要形成怎样的数据?两段语音读了同样的文字,是否必须有完全相同的波形?语速和停顿怎样影响你对介绍的理解?
6. 留下一项自己的判断。从本章生成的内容中,选一处你愿意保留的变化,再选一处需要修改或暂不采用的内容。说明理由;如果没有需要修改的地方,就说明你核对了什么,以及这些材料还不能回答哪个问题。
本章资料来源
[1] Hugging Face. Tokenizers. 用于核对文本划分、词元、编号与文字还原。访问日期:2026-09-20。https://huggingface.co/learn/llm-course/en/chapter2/4
[2] TensorFlow. Word embeddings. 用于核对整数编号、向量表示、嵌入与可训练参数之间的关系。访问日期:2026-09-20。https://www.tensorflow.org/text/guide/word_embeddings
[3] VASWANI A, SHAZEER N, PARMAR N, et al. Attention Is All You Need. 2017. arXiv:1706.03762. 用于核对注意力、位置、Transformer与生成时的因果约束。https://arxiv.org/abs/1706.03762
[4] Hugging Face. How do Transformers work?;Google for Developers. LLMs: What's a large language model? 用于核对语言建模、自监督训练、预训练与生成模型的基本概念。访问日期:2026-09-20。https://huggingface.co/learn/llm-course/en/chapter1/4 ;https://developers.google.com/machine-learning/crash-course/llm/transformers
[5] Hugging Face. Generation strategies. 用于核对逐步选择、最高概率选择与按概率抽样的区别。访问日期:2026-09-20。https://huggingface.co/docs/transformers/generation_strategies
[6] Hugging Face. Training a causal language model from scratch. 用于核对从文本取得预测目标、计算损失与训练参数。访问日期:2026-09-20。https://huggingface.co/learn/llm-course/en/chapter7/6
[7] OUYANG L, WU J, JIANG X, et al. Training language models to follow instructions with human feedback. 2022. arXiv:2203.02155. 用于核对示范回答、偏好比较及基于反馈的进一步训练。https://arxiv.org/abs/2203.02155
[8] DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. 2025. arXiv:2501.12948. 用于核对利用任务结果反馈改进推理表现的训练思路。https://arxiv.org/abs/2501.12948
[9] CARLINI N, TRAMÈR F, WALLACE E, et al. Extracting Training Data from Large Language Models. 2020. arXiv:2012.07805. 用于核对模型可能记忆并重现部分训练材料,避免将生成一概解释为逐句检索或完全不会重复原文。https://arxiv.org/abs/2012.07805
[10] Google for Developers. LLMs: Fine-tuning, distillation, and prompt engineering. 用于核对训练调整参数与提示输入使用已有参数的区别。访问日期:2026-09-20。https://developers.google.com/machine-learning/crash-course/llm/tuning
[11] HO J, JAIN A, ABBEEL P. Denoising Diffusion Probabilistic Models. 2020. arXiv:2006.11239;Hugging Face. Understanding pipelines, models and schedulers. 用于核对加噪训练、从随机噪声开始的多步生成与结果转换。访问日期:2026-09-20。https://arxiv.org/abs/2006.11239 ;https://huggingface.co/docs/diffusers/using-diffusers/write_own_pipeline
[12] ROMBACH R, BLATTMANN A, LORENZ D, et al. High-Resolution Image Synthesis with Latent Diffusion Models. 2022(CVPR). arXiv:2112.10752. 用于核对压缩表示中的图像生成与文字条件。https://arxiv.org/abs/2112.10752
[13] SHEN J, PANG R, WEISS R J, et al. Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions. 2017. arXiv:1712.05884;Google Research. Tacotron 2: Generating Human-like Speech from Text. 用于核对文字、声学表示与波形生成的一种代表路线,不将其视为全部语音合成系统的统一结构。访问日期:2026-09-20。https://arxiv.org/abs/1712.05884 ;https://research.google/blog/tacotron-2-generating-human-like-speech-from-text/
[14] WANG C, CHEN S, WU Y, et al. Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers. 2023. arXiv:2301.02111. 用于核对将音频表示为离散编码、通过语言建模进行语音合成的另一类方法。https://arxiv.org/abs/2301.02111
[15] ESSER P, ROMBACH R, OMMER B. Taming Transformers for High-Resolution Image Synthesis. 2021(CVPR). arXiv:2012.09841. 用于核对将图像转为离散表示并通过Transformer生成的代表方法。https://arxiv.org/abs/2012.09841