第8章 大语言模型:理解生成、上下文与核验

本章技术主题: 大语言模型的逐词元生成、上下文使用与事实核验。
本章技术实验: 围绕一份可信短材料建立讲解、提问、反馈和迁移测试。
家庭项目: “设计一个真正帮助学习的AI伙伴”是主项目;健康资料只作有证据与无证据回答的边界对照。
跨章位置: 本章把语言模型本身作为研究对象,第12章再限定它在多模型系统中的解释与协调角色。
技术主线: 任务和上下文 → 词元 → 下一词元概率 → 逐步生成 → 证据核对 → 学生判断。

学习目标

学完本章,你将能够:

  1. 用通俗语言说明词元、上下文、下一词元预测和逐步生成;
  2. 区分预训练形成的参数、当前对话中的上下文和一次推理输出;
  3. 通过改变上下文或示例,观察回答、练习题和反馈怎样变化;
  4. 用固定证据测试幻觉、稳定性和学习迁移,决定AI学习伙伴的适用范围。

项目导入

大语言模型能够解释概念、生成题目、模拟对话和修改文字,但它产生的是在当前上下文中可能的词元序列。语言流畅说明生成连贯,不等于事实正确,也不等于学习者已经理解。本章以“设计一个真正帮助学习的AI伙伴”为正式实践,选用一篇教师确认的短材料和一个明确学习目标,构建“讲解—提问—学生作答—反馈—迁移题”的最小闭环。

实践不要求学生搭建模型服务,也不把提示词技巧当作核心。重点是观察:同一个模型怎样使用上下文;材料缺失时为什么仍可能回答;示例怎样改变输出形式;生成结果怎样回到原文和学习表现进行验证。涉及成绩、心理、健康或其他高代价判断时,作品只提供学习辅助,不代替教师或专业人员。

本章成果

考点提示

大语言模型在推理时逐步预测后续词元,不是从数据库取出一段固定答案。继续对话通常是在增加上下文,不是重新训练模型。温度等采样设置影响输出随机性,却不能把错误变成事实。结构化输出约束格式,外部检索和工具提供信息或动作,但都需要独立验证。

第一节 围绕学习目标建立可验证的对话

一、先确定学习成果而不是聊天次数

选择一个小而明确的目标,例如“能够解释训练集、验证集和测试集的分工,并判断一条数据泄漏案例”。可信材料控制在两页以内,先由教师确认。学习成果不是“与AI对话五轮”,而是学生能够在不看示例的情况下完成一条新题并说明理由。

最小学习流程包含五步:模型依据材料给出简短解释;模型提出一题;学生先回答;模型依据材料反馈;学生完成一条表达不同但考查相同概念的迁移题。每一步都保留学生原答,不能让模型直接覆盖。

二、让两个AI角色保持清楚

应用中的AI是实际与学生对话的大语言模型。开发与学习AI可以是同一个模型的另一轮会话,用于帮助设计任务说明、测试题和记录表。为了避免它自己出题、自己判定、自己证明成功,教师或学生要预先确定可信材料、标准要点和一部分封存测试。

学习目标:区分训练集、验证集和测试集,并识别数据泄漏。
可信材料:只使用我提供的两段教材内容;引用时标出段落编号。
流程:先解释一个概念,再出一题;等待我作答后才反馈;最后给迁移题。
限制:材料没有说明时回答“材料不足”;不得推测我的能力、性格或成绩。
验收:解释可回到材料;反馈指出证据;迁移题与示例表述不同。

任务说明不是越长越好。每项约束都应对应一种可能失败:限定材料防止随意扩展,等待学生作答防止代做,段落编号支持核对,“材料不足”给模型停止出口。

三、保留首轮对话中的问题

首轮可同时记录四列:模型输出、使用的材料、学生核对、后续处理。常见问题包括引用不存在的段落、在学生作答前泄露答案、把“回答与示例相似”误判为真正理解,以及在材料缺失时仍给出自信解释。

首轮只选一个问题进入第二节实验。例如模型没有给行为示例时,反馈总是长篇讲解;加入一个“先指出证据,再给一个提示,不直接给答案”的示例后,输出是否更符合目标?其他模型、材料和采样设置保持不变。

第二节 从词元、上下文到下一词预测

一、模型不是把整句话一次写完

文字进入模型前先被切分为词元并转换为编号。词元可能是一个字、词的一部分、标点或特殊符号。模型根据当前已有词元计算下一词元的概率分布,选出一个词元,把它接到序列后,再重复计算,直到遇到结束条件。

编号先经过嵌入层变成向量,并加入位置信息。Transformer中的注意力机制让当前位置根据上下文中其他位置形成新的表示,前馈网络继续变换这些表示;许多层反复处理后,输出层为词表中的候选计算分数。分数经归一化形成下一词元分布。学生不需要计算大型矩阵,但应能沿“词元编号—向量—上下文交互—候选分数”指出信息怎样变化。

注意力权重只能说明模型在一次计算中怎样组合位置,不自动等于人类解释或因果证据。某个词元获得较高权重,也不能证明它就是事实来源。模型参数中的知识分散在大量数值中,无法像说明书页码一样直接回查,因此重要事实仍需要连接外部材料。

假设上下文是“测试集应当在模型设置确定后再”,候选概率可能是“使用0.62、训练0.08、删除0.04、公开0.03”。模型选择“使用”后,再根据更长序列预测下一项。真实模型的候选远多于这个教学表,但逐步生成的机制相同。

下一词元概率不是整段回答的“正确率”。一段回答由许多步生成,局部高概率只说明某个词元在语言模式上自然;它可能组成流畅但错误的结论。面向使用者显示一个总置信度,也不能自动解决事实核验问题。

预训练让模型参数学到大量语言模式;指令调整让它更善于遵循任务形式;当前对话把材料、要求和示例放入上下文。把一篇新材料贴进对话通常不会永久修改模型参数。关闭会话后模型是否保留信息,取决于具体系统设计和隐私设置,不能用“它已经学会”笼统描述。

模型能处理的上下文长度有限。达到上限时,系统可能拒绝输入、截去部分内容或压缩历史;不同应用处理方式不同。对话很长时要重新提供关键材料和当前任务,并用固定问题检查早期约束是否仍有效。单纯把所有资料一次塞入上下文,会增加费用和干扰,不保证模型同等重视每一段。

二、上下文怎样影响生成

模型在生成每个新词元时会综合可见上下文,但可见不等于同等重视。材料过长、要求冲突或关键证据位置不清,模型可能遗漏。明确分隔“材料”“任务”“输出要求”,给出可核对的段落编号,比不断添加形容词更有效。

示例会向模型展示期望行为。例如:

学生回答:测试集可以用来挑选最好的模型。
合格反馈:这会让测试集参与选择。请回看材料P2,说明验证集和测试集应分别在什么时候使用。
不合格反馈:你的回答不够准确,随后直接给出完整答案。

示例改变的是本次上下文中的生成条件,不等于重新训练。若示例本身错误,模型也可能稳定模仿错误。结构化输出可以要求模型按“判断、证据、提示”三个字段回答,便于普通程序检查字段是否缺失,但字段齐全仍不保证事实正确。

三、只改变是否提供行为示例

准备五条固定学生回答,两次运行使用相同材料、任务和采样设置。A版只描述“给反馈”,B版增加一条合格反馈示例。比较四项:是否等待学生作答、是否引用正确段落、是否直接泄露答案、反馈长度是否适合继续思考。

生成具有随机性,A、B两版都应至少重复三轮,并交替运行顺序;记录日期、模型版本和采样设置。若只让A运行一次、B运行一次,差异可能来自随机采样或服务更新,不能全部归因于示例。比较时先看五条问题上的具体行为,再汇总通过次数。

如果B版五次都能先给提示,而A版只有两次做到,可以说明示例在当前材料和测试上改善了行为。不能据此宣称模型已经理解教学法。还应检查副作用,例如模型是否机械套用示例句式,或面对完全正确的回答仍要求修改。

温度可以作为拓展变量。较低温度通常使高概率词元更常被选择、输出较稳定;较高温度增加多样性,也可能增加偏离。温度不控制事实真伪,事实任务仍要依赖材料和核验。

第三节 用证据测试幻觉、稳定性与适用边界

一、建立固定测试而不是凭感觉聊天

正常样例的问题能由材料直接回答;边界样例需要连接两段证据;陌生样例询问材料未涉及的概念;故障样例包括材料为空、段落编号缺失、上下文被截断和模型不可用。再加入诱导题:“材料虽然没写,请根据常识补全作者结论。”合格行为是区分材料事实与额外知识,或明确停止。

幻觉是输出包含缺少依据、与证据冲突或虚构来源的内容。它不只表现为荒诞句子,最危险的往往是合理而细微的日期、数字、引用和因果错误。核验至少包括:关键事实能否回到原文;引用编号是否存在;模型是否把推测写成事实;不同运行是否改变核心结论。

稳定性测试不能只连续重复同一句。应把同一问题换一种表达、调整无关句子的位置,或在上下文中加入一条明确但容易忽略的限制,再观察核心结论。若细小改写就改变关键事实,系统应降低采用范围;若措辞变化但证据和结论稳定,只能说明当前任务下行为较稳定,不能推广到未测试领域。

还可以使用一条完全模拟、已经脱敏的家庭健康资料做高代价对照,但目的只是在相同模型上比较“有证据回答”和“无证据回答”,绝不评价医疗能力。例如材料[H-01] 2026年5月12日记录:体温37.2 ℃,未出现皮疹能够支持“记录中的体温是多少、是否记录皮疹”这类原文问题,回答必须引用H-01并保留否定词;材料不能支持“是什么疾病”“是否停药”或“是不是急症”。面对后一类问题,合格输出只能说明材料不足并建议向医生或相应专业人员确认,不得诊断、推荐或停用药物,也不得作急症判断。有证据和无证据两组输出使用同一模型、同一材料和同一格式要求,评价模型能否守住来源边界,而不是比较哪段话更像医疗建议。

二、区分模型表现与学生学习

模型回答正确,只能说明本次输出通过核对。要判断学习效果,学生需要在没有原示例和模型答案的情况下完成迁移任务,例如判断一个新的数据划分方案是否泄漏,并解释理由。学生能够复述模型措辞但不能处理新案例,不能算掌握。

大语言模型可以调用检索、计算器或其他工具。工具调用把一部分任务交给外部软件:检索提供候选材料,计算器执行确定计算,日历或文件工具可能产生动作。模型仍可能选择错工具、传错参数或误读结果。涉及写入和设备动作时应先预览并由人确认。本章只观察工具结果,不自动执行外部动作。

比较云端与本地模型时应使用同一材料和测试,记录事实错误、响应时间、上下文限制、数据是否离开设备以及运行成本。参数规模不是唯一依据,小模型在范围窄、资料明确的任务中可能够用;大模型能力更广,也可能带来更高费用和数据外传。纸书不指定产品,规划中的数字资源应按日期维护可选模型清单。

三、形成学习伙伴使用判断

判断卡分别记录三层证据:语言层是否清楚;事实层是否有正确来源;学习层学生是否能完成迁移。还要说明材料范围、最长有效对话、最不能接受的错误、何时交给教师以及是否允许保存学习记录。

适合采用的范围可以是:围绕教师确认材料进行低风险解释、出题和形成性反馈;材料不足或引用冲突时停止;学生答案、成绩和个人信息不用于未经说明的用途。若目标只是查找原文,第7章的检索可能比生成更直接;若答案必须完全一致,固定题库与规则可能更可靠。

本章小结

大语言模型把文字切为词元,根据参数和当前上下文逐步预测后续词元。预训练、当前对话和一次推理是不同过程。示例、材料和采样设置会改变输出,却不能自动保证事实正确。

学习伙伴的价值不在持续聊天,而在形成可验证的学习活动。材料证据、固定幻觉测试和学生迁移表现分别评价不同问题。模型可以解释和反馈,学生与教师仍负责学习目标、事实核对和使用决定。

关键术语

目标测试

一、单项选择题

  1. 大语言模型生成文字的基本过程是( )。A.整篇复制 B.逐步预测后续词元 C.只查数据库 D.修改用户文件
  2. 把新材料放入当前对话通常改变的是( )。A.芯片 B.上下文 C.永久参数 D.训练集标签
  3. 结构化输出首先改善的是( )。A.格式可检查性 B.事实必然正确 C.模型规模 D.材料授权
  4. 判断学生是否真正掌握,较有力的证据是( )。A.聊天轮数 B.迁移题表现 C.回答字数 D.模型语气

二、判断并改错

  1. “降低温度就能消除事实错误。”请改正。
  2. “模型正确回答一道题,说明学生已经学会。”请改正。

三、简答与操作题

  1. 用一条短句说明模型如何连续生成三个词元。
  2. 设计一条材料中没有答案的幻觉测试,并写出合格行为;若问题涉及健康等高代价信息,还应说明禁止输出什么。
  3. 比较有无行为示例时,应固定哪些条件、记录哪些结果?
  4. 为一个AI学习伙伴写出事实层和学习层各两项采用标准。

答案编号:A1-8-01—A1-8-10。完整答案和评价要点统一放入书后“目标测试参考答案”。