OpenKub 图书开发书单中职/技工版 · 十二章候选稿

十二章候选稿 · 汇总于2026-10-08

第5章 AI怎样生成文字、图像和声音

样章 v0.1 | 2026年9月20日

同一只纸盒,还能怎样讲述

还记得第2章的收纳盒吗?旧纸盒里加了一块隔板,后格放铅笔,前面的浅格放橡皮。原来拿橡皮时,需要先取出几支铅笔;分格以后,可以直接拿到它。

把这段记录交给AI,可以得到一段作品介绍,也可以得到一句简短的使用说明。换一种要求,还可以请它写一段明确虚构的“纸盒独白”:一只原本准备被丢弃的盒子,怎样开始新的生活。

同一份材料,能够通向不同的表达。前两种表达需要忠实说明实物,最后一种则给想象留出了空间。我们提供的材料和要求,参与了这些内容的形成。

上一章研究图像与声音怎样进入计算机。本章转过来看:当AI写出一段原先没有出现在输入中的话,画出一幅图,或合成一句声音时,这些内容从哪里来?它怎样接着已有的内容继续生成?为什么再次提出相同要求,得到的结果有时会变化?

我们先从文字入手,看清其中的数字和计算,再了解训练怎样形成能力,以及图像、声音生成有哪些不同。最后,用同一段自己的说明做一次比较,分清表达的变化、材料以外的补充和有意的想象。

学完本章,你将能够:解释文字怎样转为模型能够处理的数字;说明一种常见的逐步生成过程;区分训练与日常对话;认识图像、声音生成的基本思路;结合自己的材料判断哪些变化可以保留,哪些内容还需要确认。

5.1 文字怎样一步步生成

5.1.1 把文字分成片段并用数字表示

“前格放橡皮,后格放铅笔。”我们一读就知道这句话在安排物品。计算机要处理它,需要先把文字变成数字。

第4章里,照片可以表示为像素数值,声音可以表示为一串采样值。处理文字时,一种常见做法是先把它分成较小的片段。每个片段称为词元(token)。词元不一定是语文课中的一个完整词语:它可能对应一个汉字、几个字、一段字母或标点,具体边界由所用的处理方法决定。[1]

下面用一种便于观察的划分作示例:

前格|放|橡皮|,|后格|放|铅笔|。

这句话在示例中共有8个词元。实际工具可能把“前格”分成更小的片段,也可能采用其他划分。因此,不能把汉字数直接当作所有模型的词元数。

负责划分文字并转换编号的程序,称为分词器(tokenizer)。它使用一份对应表,为各个词元安排编号。下面的编号只用于说明方法:[1]

词元 示例编号 词元 示例编号
前格 17 后格 18
放 6 铅笔 35
橡皮 42 。 4
, 3

于是,上面这句话可以写成:

17,6,42,3,18,6,35,4

“放”出现两次,在这个例子中使用同一个编号6。编号只负责标明片段,42大于35,并不表示橡皮比铅笔更重要。它也没有直接告诉模型,橡皮和铅笔都属于文具。

要让这些片段参与更丰富的计算,还需要把每个编号对应到一组数。这样一组按顺序排列的数称为向量,其中的数值可以通过训练逐渐形成。[2]

例如,可以用“0.2,-0.4,0.7”演示一组数的形式。真实模型通常使用更多数值,这些数值在训练中逐渐调整。它们共同参与表示,不能简单把第一项读成颜色、第二项读成用途。[2]

编号相当于找到对应的入口,一组数则能够进入神经网络的乘、加与变换。经过训练,模型可以利用这些数字之间的关系处理文字。第3章讲过的参数和计算,在这里继续发挥作用。

文字的先后位置也很重要。“前格放橡皮,后格放铅笔”与“前格放铅笔,后格放橡皮”,所用的词元相同,意思却不同。模型需要在计算中利用位置信息,才能区别这些排列。[3]

继续处理时,某个词元的表示还会受到上下文影响。例如,同一个“它”出现在不同句子中,可能指向不同的物品。初始数字表示只是起点,后面的计算还要结合周围内容。

先把这个过程连起来:文字被分成片段,片段转换成编号,编号对应到数字表示;模型再结合位置和上下文进行计算。到输出时,生成的词元编号会转换回文字,让我们读到回答。[1][3]

动手看一看:按本节示例中的划分和编号,把“后格放橡皮,前格放铅笔。”写成一串编号。与原来的数列相比,哪些位置变了?为什么只保留有哪些编号、丢掉它们的顺序,会漏掉重要信息?

5.1.2 利用上下文中的关联生成后续内容

文字变成数字以后,模型怎样决定接下来生成什么?先读两段尚未写完的话:

甲:盒子分成前后两格,铅笔和橡皮各放一格。前格放橡皮,后格放……

乙:盒子分成前后两格,铅笔和橡皮各放一格。前格放铅笔,后格放……

两段话最后都是“后格放”,但根据更前面的安排,甲应当接“铅笔”,乙应当接“橡皮”。决定后续内容时,需要利用前文的关系。

语言模型(language model)学习文字片段之间的关联。一种常见的文字生成方式,是结合已有上下文,为下一个词元的不同候选计算概率,再按一定方法选出一个。选中的词元加入已有内容以后,继续计算下一个,直到输出结束标记或达到程序规定的停止条件。[4][5]

在这种逐步生成方式中,后面的计算会使用前面已经生成的内容。这里先沿着这一条常见路线理解过程。

下面是一组演算数据。为了便于比较,把“铅笔”“橡皮”“尺子”分别看作一个词元,“其他”合并其余候选。

候选词元 接在甲后面的概率 接在乙后面的概率
铅笔 70% 15%
橡皮 15% 70%
尺子 5% 5%
其他 10% 10%

每一列合计100%。根据这组数,若每次都选概率最高的候选,甲会接“铅笔”,乙会接“橡皮”。上下文不同,候选的分配就可以不同。

还有一种选择方法:按概率进行抽样。可以把甲这一列想成100张小纸片,其中70张写“铅笔”,15张写“橡皮”,5张写“尺子”,10张写“其他”。混匀后抽一张,“铅笔”最有机会被抽到,但一次也可能抽到别的候选。程序用数字实现这种选择,不需要真的准备纸片。[5]

算一算:在这组演算数据中,抽到“铅笔”以外候选的概率是多少?如果连续抽取10次,每次都把纸片放回并混匀,会保证恰好7次抽到“铅笔”吗?

抽样保留了多种继续表达的可能。一个开头可以接出不同句子,前面选中的片段又会改变后面的条件,因此,即使输入相同,完整回答也可能出现差异。实际工具还会调整候选范围或选择方式,有时也会给出相同结果。[5]

要注意,表里的70%描述候选词元在这一步的概率,不能直接读成“这一整段介绍有70%的概率符合实物”。词元选择与事实核对,是需要分别理解的事情。

模型怎样联系较远的内容?

回看甲、乙两段话。仅记住最后的“后格放”还不够,模型需要把“两样东西各占一格”与“前格已经放了什么”联系起来。

注意力机制(attention mechanism)提供了一种利用上下文的计算方法。它根据当前数字表示,计算不同位置的信息应当怎样参与组合,让相关内容对当前结果产生不同程度的影响。[3]

可以先看一个简单的加权计算。假设两处信息中各取一个数,分别是2和6。给它们分配0.8与0.2的权重,组合后是:

0.8×2+0.2×6=2.8

若权重改成0.2与0.8,组合后则是:

0.2×2+0.8×6=5.2

两个输入没有改变,参与组合的程度改变了,结果就不同。实际注意力计算处理的是多组数字,相关权重由模型结合输入计算得到;这里的数值只帮助理解“怎样把不同信息按不同比重合起来”。

这样的计算可以把当前位置与较远的相关内容联系起来。文字生成时,模型利用已经提供的输入和已经生成的内容,不需要提前知道尚未生成的文字。[3]

Transformer是一类组织神经网络计算的结构,它将注意力计算与其他带有参数的变换组合起来,再多层处理信息。模型既利用片段之间的联系,也利用训练中形成的其他计算关系。注意力提供了联系信息的方法,效果还要通过实际任务检查。[3][4]

我们不必把每一层的公式都展开,仍然可以看清主要关系:提供的材料转为数字,模型结合上下文反复计算,输出候选概率,程序选择后续内容。参数来自训练,当前问题与材料则影响本次计算。

做一个很短的观察:把甲、乙两段话分别交给同一个AI对话工具,只要求补出省略号后的物品名称。比较实际结果,再指出自己是根据哪一句前文作出判断的。

若结果正确,可以说明模型在这两个输入中给出了符合安排的回答;若有不同,就回看材料和输出。单凭回答的变化,我们还不能知道内部某个注意力单元具体用了哪些信息。

5.2 大模型的能力怎样形成

5.2.1 从大量材料中进行训练

在第3章,我们用带有“杯子”“橡皮”标签的图片训练分类器。语言模型也需要训练,但文字本身就能提供许多学习目标。

仍然使用“前格放橡皮,后格放铅笔。”按照前面的示例划分,可以从一句话得到多处预测任务:

用来预测的前文 原文中紧接着的词元
前格 放
前格|放 橡皮
前格|放|橡皮 ,
前格|放|橡皮|, 后格

训练程序让模型根据前文计算候选概率,再与原文中的下一个词元比较。目标直接从文字的先后关系中取得,无需人为给每一个位置重新填写答案。这里的学习目标就来自数据本身。[4][6]

它与前面的补句体验有所不同。补句时,我们在使用已有模型;这里讨论的是训练程序怎样借助原文调整模型参数。

假设在“前格|放”之后,原文的目标词元是“橡皮”。模型起初只给它20%的概率,训练程序就可以据此计算损失,并调整参数。在后续某次比较中,它对这个目标的概率可能提高到60%。这些数用于说明变化方向,真实训练需要综合许多位置、许多材料的结果。[6]

第3章的“计算—比较—调整”在这里仍然成立。模型不用先完整写出一篇文章,才得到一次反馈;一段文字可以提供很多预测位置。训练中的计算还可以批量进行,但预测某个位置时,要限制模型直接利用目标词元及其后面的内容,避免把要预测的答案提前交给它。[4][6]

如果某个位置允许有多种合理说法,训练时为什么还用原文中的一种作目标?因为这一条材料只提供了实际出现的表达。其他材料会呈现不同说法,大量例子共同影响模型的概率分配。训练目标有助于学习语言规律,也需要结合更广泛的材料与评价理解其效果。

在大量、较广泛的材料上进行基础训练,通常称为预训练(pretraining)。经过这类训练,模型可能学到词语的搭配、句子之间的关系、不同文体的组织方式,以及材料中表达的许多知识与解题方法。[4]

人们将规模较大的这类语言模型称为大语言模型(large language model,LLM)。第3章讲过,参数参与神经网络计算;更多参数可以提供表达复杂关系的空间,但实际能力还与数据质量、训练方法和计算安排有关。仅看“大”或某个参数数量,无法代替实际检验。[4][7]

“预测后续片段”这个目标看起来很小,完成它却可能需要利用相当复杂的联系。前文说把橡皮从前格移到桌上,后文再问它在哪里,就需要处理位置随动作改变的关系;一段制作说明要保持前后顺序,也需要利用步骤之间的联系。通过很多这样的材料,网络有机会形成能够迁移到新输入的处理能力。

这些能力分布在训练后形成的计算关系中。模型使用时会利用它们组织内容,也可能重现某些在训练中记住的片段。因此,不能把每次回答都理解为从某篇文章中取出原句,也不能保证生成文字绝不会与已有材料重合。[9]

训练材料还会影响模型熟悉什么。若某类事物主要以广告形式出现,模型可能更容易生成宣传式表达;如果某种方言、专业名称或生活经验出现得较少,相关表现也需要另外检查。第3章关于数据覆盖范围的认识,在这里仍然适用。

因此,大量材料只是起点。材料怎样选择、怎样处理错误与重复、模型在新任务中表现如何,都需要研究。能够生成通顺的句子以后,还要继续解决一个问题:怎样让它更好地回应人的实际要求?

5.2.2 通过进一步训练改进回答与行为

设想一个善于继续写文章的模型看到“请给收纳盒写两句介绍”,它可能接着写出一串类似的要求。文字衔接得上,却没有完成使用者希望它做的事。

为了让模型更适合问答和协作,可以在预训练基础上安排进一步训练。这一阶段通常称为后训练(post-training),可以采用示范回答、回答之间的比较,以及对任务结果的反馈等材料。[7][8]

先看示范回答。开发者准备“要求与材料—合适回答”这样的例子,让模型学习如何依照要求组织输出。这种有针对性的进一步训练,是微调(fine-tuning)的一种用法。训练会调整参与其中的参数。[7]

例如,材料只说“前格放橡皮,后格放铅笔”,要求写两句真实介绍。示范回答应当交代分格和用途,控制长度,不随意增加尺寸和试用经历。很多不同任务的示范,可以帮助模型学习如何遵循要求,而不只是继续原来的文字。

还可以给同一个要求准备几个回答,比较哪一个更合适。下面是一段示例:

要求:根据现有记录,介绍这个纸盒的分格安排,不补写尺寸。

回答甲:前面的浅格放橡皮,后格放铅笔。两类物品分开放置。

回答乙:这款20厘米长的收纳盒广受欢迎,能让所有人迅速整理桌面。

比较时可以明确指出:甲保留了材料中的关系;乙增加了没有提供的长度和评价。把许多这样的比较用于训练,有助于改善回答与要求的匹配程度。训练程序可以利用这些反馈,继续调整模型参数,使它更倾向于产生符合评价要求的回答。[7]

反馈也可以来自可检查的任务结果。例如,一段程序能否通过规定的运行检查,一道计算题的答案是否符合已知结果。有些后训练方法会利用这样的反馈改进模型解决问题的表现。[8]

这并不意味着一种反馈能够检查所有方面。程序通过几个例子,还需要考虑其他输入;一段文字受到读者喜欢,也不自动保证事实准确。评价重视什么,会影响训练改进的方向。选择示范、制定比较标准和检查实际效果,仍然需要人的知识与判断。

再分清一次:补充材料与训练有什么不同?

你在对话中说“前格放的是橡皮,请把这里改正”,改变的是本次可参考的内容。普通对话生成通常使用当前参数,并不会因为这句话就在当场完成一次模型训练。[10]

开发者把成批任务和回答交给训练程序,计算损失、更新参数,则属于训练。前者帮助当前任务使用已有能力,后者改变模型计算本身。两种方式都可能让下一次看到的回答更合适,需要根据实际过程区分。

某些应用还会另外保存偏好,在后续对话中重新提供给模型。记下并再次提供一条信息,与更新模型参数也有区别。看到工具“记住了”某个要求,不能只凭这一点断定模型刚刚经过训练。

我们在第2章练习观察、提问和修改,现在能够进一步解释这些动作:清楚的语言把相关信息带入当前计算;训练则为模型处理这些信息提供能力基础。二者配合,才可能得到有用的结果。

5.3 生成内容有哪些共同问题

5.3.1 不同形式的内容怎样被生成

文字生成有了一个清楚的解释,接下来看看图像和声音。

我们把能够根据输入条件生成文字、图像、声音等内容的人工智能,通常称为生成式人工智能(generative artificial intelligence)。不同系统生成的数据形式不同,具体计算方法也不完全相同。

图像:从带噪数据中学习,逐步形成画面

你输入“一个分成前后两格的纸质收纳盒,前格放橡皮,后格放铅笔”,图像生成工具需要产生一整幅画面的数字表示,再将其显示为图像。文字说明给出对象与关系,画面还需要确定形状、颜色、位置和光影等细节。[11]

一种重要方法是扩散模型(diffusion model)。先从训练过程理解它:程序取一张训练图片,在它的数字表示中加入不同程度的随机噪声,让模型学习怎样估计应当去掉的噪声或较清楚的图像信息。这里的噪声可以想成随机扰动的数值;加得越多,原来的内容通常越难辨认。[11]

程序知道原来提供了什么,也知道加入噪声的过程,因此可以把模型的估计与相应目标比较,再调整参数。大量图片和不同噪声程度提供许多训练机会。若训练还配有描述文字,模型就能学习文字条件与图像内容之间的关系。[11][12]

生成时,一种典型做法是从随机噪声开始,结合文字条件和当前中间结果,反复估计并更新。许多步以后,逐渐得到一幅图像。可以把这条路线简记为:

文字要求+随机起点 → 多步计算与更新 → 生成的图像

这些计算利用训练学到的规律形成画面。随机起点里没有藏着一张已经拍好的收纳盒照片,生成过程也不必先找到某一张原图,再把它恢复出来。[11]

有些方法先把图片压缩成较小的数字表示,在这种表示中完成主要生成计算,最后再转换回像素。这可以减少直接处理大图的负担。还有方法把图像编码为一系列片段来生成。我们学习的逐步去噪路线是一种代表,不能据此推断每个图像工具内部都完全相同。[12][15]

想象一下,同样是“纸质收纳盒”,纸的颜色可以不同,盒沿也可以有不同形状。输入没有规定这些细节,生成时仍然要把画面填充完整。不同结果可能都符合这段文字,却未必与自己手上的实物一致。

这也说明,生成画面能够帮助探索“可以做成什么样”,而实物照片记录“当时拍到了什么”。两类材料都能用于交流,使用时应当让别人知道它们各自的用途。

声音:从文字或其他条件形成音频

第4章的语音识别把说话内容转成文字。现在把“前格放橡皮,后格放铅笔”转换成可以播放的声音,就是文本转语音(text-to-speech,TTS),也常称为语音合成。[13]

训练语音合成模型时,可以使用录音及其对应文字,让模型学习文字与发音、时长、语调等信息之间的联系。一种路线先根据文字生成声音的中间表示,例如声谱图,再通过另一个模型把它转换成声音波形;也有系统采用音频片段编码或其他生成路线。[13][14]

还记得第4章的声谱图吗?当时它是从已录下的声音计算出来的。在这里,它可以成为模型生成的中间结果,用来形成新的声音。表示方法相通,信息流动的方向发生了变化。

最后得到的音频同样包含随时间排列的数值,播放设备把它转为可以听到的声音。同一句话可以有不同语速、停顿和语调,因而对应不同波形。文字内容相同,并不要求每次合成的全部数值相同。

文字转语音通常以给定文字为内容基础;生成一段音乐或某种环境声,还需要决定旋律、节奏或声响变化等内容。它们都属于声音生成,任务要求却有所不同。一个只能朗读文字的工具,不一定能够直接生成各种声音作品。

三种形式放在一起看

希望得到的内容 一种代表性的生成路线 可以观察的结果
一小段介绍 将文字变成数字,结合上下文逐步生成词元 词句、信息与前后关系
一幅收纳盒设计图 将文字作为条件,从随机起点逐步更新图像表示 物体、分格、颜色与布局
一句语音介绍 根据文字生成声音表示,再形成可播放的音频 读了什么,怎样停顿和发音

共同点是利用训练形成的能力,结合本次条件计算新的内容。差别在于表示什么数据、怎样安排计算,以及最后怎样检查结果。实际应用也可能组合多个模型,让一个界面同时完成不同任务。

可以再选一种形式体验:把本章的一小段介绍交给语音合成工具,听听文字与读音是否对应;或者给图像生成工具一段简短外形说明,看看它确定了哪些文字没有写出的细节。选择一种即可,主要比较活动仍然围绕下面的文字材料进行。

5.3.2 生成结果中的变化、补充与不确定性

生成内容中的变化,可以帮助我们找到不同的表达和设计。关键在于分清:改变的是说法,还是对事实的陈述;新增的是允许的想象,还是没有依据却被写成真的细节。

以收纳盒为例,把“前面的浅格放橡皮”改成“橡皮放在前面的浅格”,主要改变了句式。写成“这个20厘米长的盒子经过全班试用”,则增加了尺寸与试用经历。现有记录中没有这些内容,就需要另外确认。

允许创作时,增加想象可以成为作品的一部分。请纸盒“说说自己新的生活”,可以写它看着铅笔每天被拿起又放回。读者知道这是虚构,就能按创作来理解。若同样的文字被当作真实试用记录,要求就不同了。

生成结果中,缺少依据或与材料、事实不符,却被表述得像可靠事实的内容,常被称为幻觉(hallucination)。[4]

这种问题可能与训练材料、输入不足、错误关联以及生成过程中的选择等因素有关。模型学到许多有用关系,也可能在信息不足时延续出貌似合适的细节。只看到一段错误文字,通常不足以确定唯一原因。

再生成几次并不能自动解决事实问题。几段文字完全一致,也可能共同重复一个错误;几段文字说法不同,却可能都准确表达同一份记录。检查时,应当回到具体内容与依据。

做一次比较:同一份材料,几次生成

先取出第2章的一段观察记录,也可以另写三五句话,介绍自己熟悉的物品或经历。选一份自己能够核对的短材料即可,不必重新制作作品。

本章示例继续使用下面这段记录:

我用旧纸盒改成了一个桌面收纳盒。后格放铅笔,前格较浅,放橡皮。没有分格时,拿橡皮需要先取出几支铅笔。加上隔板以后,一位同学试用时,伸手就拿起了前格的橡皮。

先生成一段真实介绍。打开AI对话工具,附上自己的材料,再提出要求:

请根据这段记录,写两三句给第一次看见作品的人读的介绍。可以调整说法,保留已有事实,不添加没有提供的尺寸、经历或效果。

读完第一份结果,找出一处表达变化,再看看它有没有增加事实。内容已经准确时,就按准确记录,不需要主动寻找错误。

保持要求,再生成一次。在同一工具中另开一段新对话,使用相同材料和相同要求,尽量不改变其他设置。这样可以减少上一份回答对下一次生成的影响。把第二份结果与第一份并排阅读。

两份结果可能不同,也可能很接近。前面学过,生成方式可以保留不同选择;实际工具还可能包含未显示的设置。这里观察的是这两次实际输出,不据此判断模型内部唯一采用了哪种选择方法。

明确换成创作任务。仍用同一份材料,另开一段对话,将要求改为:

请以这只纸盒为主角,写两三句明确虚构的独白。保留它被改成收纳盒、前格放橡皮和后格放铅笔的安排,其他情节可以想象。

这一次改变了任务性质。先看它是否保留指定安排,再找一处新增的想象。新增内容是否合适,要结合创作要求判断,不能因为材料里没有,就把所有新增句子都当作错误。

最后作出自己的选择。从几份结果中选出两三处值得说明的地方,可以简单写成“原文写了什么—生成内容怎样表达—我为什么保留或修改”。不必逐字给全文分类。下面是判断方式的示例:

生成内容 与原材料的关系 可以怎样处理
橡皮放在前面的浅格 保留位置关系,调整句式 根据表达需要保留
全班同学试用后都很满意 把一次试用扩大为全班的评价 在真实介绍中删去或另行核实
我这只旧纸盒又有了新工作 在明确虚构的独白中使用拟人表达 结合创作目的判断是否采用

保留自己的材料、两份介绍和一项有理由的选择,就可以结束基本练习。虚构独白也可以留作第7章创作时的材料。

如果某一项事实在不同回答中始终一致,并且与记录相符,可以说明本次生成较好地保持了它。若发现改写扩大了原意,就具体指出从“一位同学”变成了“全班”,而不只写“AI不可靠”。

同样的判断也适用于图像和声音。设计图中的新颜色可以启发下一次制作,却不能证明实物已经涂过这种颜色。合成声音可以朗读一段自己写的介绍,却不能作为某个人确实说过这段话的记录。展示这些材料时,用“设计设想”“合成旁白”等简短说明交代用途即可。

生成工具让我们更容易看到多种可能。真正值得保留的选择,仍然需要联系自己的意图、掌握的材料和作品的读者。它有没有把一个想法表达得更清楚?有没有让别人误会一件尚未发生的事?这两类问题可以放在同一次阅读中考虑。

本章回望

从同一只收纳盒出发,我们看见了文字、图像和声音的不同可能,也开始理解这些内容背后的计算。

文字先分成词元,再转为模型能够处理的数字。模型利用上下文和训练中形成的关系,计算候选内容。逐步生成时,已经产生的内容会继续影响后续结果;不同的选择可能带来不同表达。

能力的形成需要训练。预训练从大量材料中学习广泛的关系,后训练进一步改善回答、行动和解决任务的方式。日常对话补充材料,主要改变当前计算可以参考什么;训练则调整模型中的参数。

图像和声音也通过数字表示生成,但不必沿用同一种文字生成方法。逐步更新图像表示、根据文字形成声音等路线,各自需要适当的训练材料、计算过程和结果检查。

本章的比较让我们区分了三件事情:改换说法、补充事实、展开想象。表达可以有多种选择,事实需要相应依据,创作需要让读者理解作品的性质。

下一章将继续追问:当我们需要一个有根据的答案时,怎样寻找材料、检查引用,并把已经确认和仍然不确定的内容说清楚?

练习与继续探索

1. 解释数字表示。“前格放橡皮,后格放铅笔。”在本章示例中被划分为多少个词元?能否由此断定任何工具都会得到相同数量?编号、表示词元的一组数和词元的位置,分别起什么作用?

2. 看懂一次生成。在5.1.2的演算数据中,甲这一列每次都选最高概率时会选什么?按概率抽样时,又可能发生什么?为什么70%不能直接表示整段回答的事实准确率?

3. 比较两种改变。“在当前对话中补充一条实物记录”和“用一批任务与回答重新训练模型”,分别改变了什么?一个应用在下次对话中再次提供保存的记录,是否足以证明模型参数发生了改变?

4. 为生成材料找合适的用途。一张按文字说明生成的收纳盒图片,与一张实物照片,可以分别帮助回答什么问题?如果要介绍已经完成的作品,你准备怎样使用它们,让读者理解哪些是实物、哪些是设计设想?

5. 为文字选择声音。把一句作品介绍合成为语音,需要形成怎样的数据?两段语音读了同样的文字,是否必须有完全相同的波形?语速和停顿怎样影响你对介绍的理解?

6. 留下一项自己的判断。从本章生成的内容中,选一处你愿意保留的变化,再选一处需要修改或暂不采用的内容。说明理由;如果没有需要修改的地方,就说明你核对了什么,以及这些材料还不能回答哪个问题。

本章资料来源

[1] Hugging Face. Tokenizers. 用于核对文本划分、词元、编号与文字还原。访问日期:2026-09-20。https://huggingface.co/learn/llm-course/en/chapter2/4

[2] TensorFlow. Word embeddings. 用于核对整数编号、向量表示、嵌入与可训练参数之间的关系。访问日期:2026-09-20。https://www.tensorflow.org/text/guide/word_embeddings

[3] VASWANI A, SHAZEER N, PARMAR N, et al. Attention Is All You Need. 2017. arXiv:1706.03762. 用于核对注意力、位置、Transformer与生成时的因果约束。https://arxiv.org/abs/1706.03762

[4] Hugging Face. How do Transformers work?;Google for Developers. LLMs: What's a large language model? 用于核对语言建模、自监督训练、预训练与生成模型的基本概念。访问日期:2026-09-20。https://huggingface.co/learn/llm-course/en/chapter1/4 ;https://developers.google.com/machine-learning/crash-course/llm/transformers

[5] Hugging Face. Generation strategies. 用于核对逐步选择、最高概率选择与按概率抽样的区别。访问日期:2026-09-20。https://huggingface.co/docs/transformers/generation_strategies

[6] Hugging Face. Training a causal language model from scratch. 用于核对从文本取得预测目标、计算损失与训练参数。访问日期:2026-09-20。https://huggingface.co/learn/llm-course/en/chapter7/6

[7] OUYANG L, WU J, JIANG X, et al. Training language models to follow instructions with human feedback. 2022. arXiv:2203.02155. 用于核对示范回答、偏好比较及基于反馈的进一步训练。https://arxiv.org/abs/2203.02155

[8] DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. 2025. arXiv:2501.12948. 用于核对利用任务结果反馈改进推理表现的训练思路。https://arxiv.org/abs/2501.12948

[9] CARLINI N, TRAMÈR F, WALLACE E, et al. Extracting Training Data from Large Language Models. 2020. arXiv:2012.07805. 用于核对模型可能记忆并重现部分训练材料,避免将生成一概解释为逐句检索或完全不会重复原文。https://arxiv.org/abs/2012.07805

[10] Google for Developers. LLMs: Fine-tuning, distillation, and prompt engineering. 用于核对训练调整参数与提示输入使用已有参数的区别。访问日期:2026-09-20。https://developers.google.com/machine-learning/crash-course/llm/tuning

[11] HO J, JAIN A, ABBEEL P. Denoising Diffusion Probabilistic Models. 2020. arXiv:2006.11239;Hugging Face. Understanding pipelines, models and schedulers. 用于核对加噪训练、从随机噪声开始的多步生成与结果转换。访问日期:2026-09-20。https://arxiv.org/abs/2006.11239 ;https://huggingface.co/docs/diffusers/using-diffusers/write_own_pipeline

[12] ROMBACH R, BLATTMANN A, LORENZ D, et al. High-Resolution Image Synthesis with Latent Diffusion Models. 2022(CVPR). arXiv:2112.10752. 用于核对压缩表示中的图像生成与文字条件。https://arxiv.org/abs/2112.10752

[13] SHEN J, PANG R, WEISS R J, et al. Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions. 2017. arXiv:1712.05884;Google Research. Tacotron 2: Generating Human-like Speech from Text. 用于核对文字、声学表示与波形生成的一种代表路线,不将其视为全部语音合成系统的统一结构。访问日期:2026-09-20。https://arxiv.org/abs/1712.05884 ;https://research.google/blog/tacotron-2-generating-human-like-speech-from-text/

[14] WANG C, CHEN S, WU Y, et al. Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers. 2023. arXiv:2301.02111. 用于核对将音频表示为离散编码、通过语言建模进行语音合成的另一类方法。https://arxiv.org/abs/2301.02111

[15] ESSER P, ROMBACH R, OMMER B. Taming Transformers for High-Resolution Image Synthesis. 2021(CVPR). arXiv:2012.09841. 用于核对将图像转为离散表示并通过Transformer生成的代表方法。https://arxiv.org/abs/2012.09841