第8章 大语言模型:理解生成、上下文与核验
本章技术主题: 大语言模型的逐词元生成、上下文使用与事实核验。
本章技术实验: 围绕一份可信短材料建立讲解、提问、反馈和迁移测试。
家庭项目: “设计一个真正帮助学习的AI伙伴”是主项目;健康资料只作有证据与无证据回答的边界对照。
跨章位置: 本章把语言模型本身作为研究对象,第12章再限定它在多模型系统中的解释与协调角色。
技术主线: 任务和上下文 → 词元 → 下一词元概率 → 逐步生成 → 证据核对 → 学生判断。
学习目标
学完本章,你将能够:
- 用通俗语言说明词元、上下文、下一词元预测和逐步生成;
- 区分预训练形成的参数、当前对话中的上下文和一次推理输出;
- 通过改变上下文或示例,观察回答、练习题和反馈怎样变化;
- 用固定证据测试幻觉、稳定性和学习迁移,决定AI学习伙伴的适用范围。
项目导入
大语言模型能够解释概念、生成题目、模拟对话和修改文字,但它产生的是在当前上下文中可能的词元序列。语言流畅说明生成连贯,不等于事实正确,也不等于学习者已经理解。本章以“设计一个真正帮助学习的AI伙伴”为正式实践,选用一篇教师确认的短材料和一个明确学习目标,构建“讲解—提问—学生作答—反馈—迁移题”的最小闭环。
实践不要求学生搭建模型服务,也不把提示词技巧当作核心。重点是观察:同一个模型怎样使用上下文;材料缺失时为什么仍可能回答;示例怎样改变输出形式;生成结果怎样回到原文和学习表现进行验证。涉及成绩、心理、健康或其他高代价判断时,作品只提供学习辅助,不代替教师或专业人员。
本章成果
- 一份可复用但与具体学习材料绑定的学习伙伴任务说明;
- 一张“上下文—词元—概率分布—生成序列—核验”的递进图;
- 一份上下文变量实验和幻觉测试记录;
- 一张区分“回答流畅”“资料正确”“学生学会”的判断卡。
考点提示
大语言模型在推理时逐步预测后续词元,不是从数据库取出一段固定答案。继续对话通常是在增加上下文,不是重新训练模型。温度等采样设置影响输出随机性,却不能把错误变成事实。结构化输出约束格式,外部检索和工具提供信息或动作,但都需要独立验证。
第一节 围绕学习目标建立可验证的对话
一、先确定学习成果而不是聊天次数
选择一个小而明确的目标,例如“能够解释训练集、验证集和测试集的分工,并判断一条数据泄漏案例”。可信材料控制在两页以内,先由教师确认。学习成果不是“与AI对话五轮”,而是学生能够在不看示例的情况下完成一条新题并说明理由。
最小学习流程包含五步:模型依据材料给出简短解释;模型提出一题;学生先回答;模型依据材料反馈;学生完成一条表达不同但考查相同概念的迁移题。每一步都保留学生原答,不能让模型直接覆盖。
二、让两个AI角色保持清楚
应用中的AI是实际与学生对话的大语言模型。开发与学习AI可以是同一个模型的另一轮会话,用于帮助设计任务说明、测试题和记录表。为了避免它自己出题、自己判定、自己证明成功,教师或学生要预先确定可信材料、标准要点和一部分封存测试。
学习目标:区分训练集、验证集和测试集,并识别数据泄漏。
可信材料:只使用我提供的两段教材内容;引用时标出段落编号。
流程:先解释一个概念,再出一题;等待我作答后才反馈;最后给迁移题。
限制:材料没有说明时回答“材料不足”;不得推测我的能力、性格或成绩。
验收:解释可回到材料;反馈指出证据;迁移题与示例表述不同。
任务说明不是越长越好。每项约束都应对应一种可能失败:限定材料防止随意扩展,等待学生作答防止代做,段落编号支持核对,“材料不足”给模型停止出口。
三、保留首轮对话中的问题
首轮可同时记录四列:模型输出、使用的材料、学生核对、后续处理。常见问题包括引用不存在的段落、在学生作答前泄露答案、把“回答与示例相似”误判为真正理解,以及在材料缺失时仍给出自信解释。
首轮只选一个问题进入第二节实验。例如模型没有给行为示例时,反馈总是长篇讲解;加入一个“先指出证据,再给一个提示,不直接给答案”的示例后,输出是否更符合目标?其他模型、材料和采样设置保持不变。
第二节 从词元、上下文到下一词预测
一、模型不是把整句话一次写完
文字进入模型前先被切分为词元并转换为编号。词元可能是一个字、词的一部分、标点或特殊符号。模型根据当前已有词元计算下一词元的概率分布,选出一个词元,把它接到序列后,再重复计算,直到遇到结束条件。
编号先经过嵌入层变成向量,并加入位置信息。Transformer中的注意力机制让当前位置根据上下文中其他位置形成新的表示,前馈网络继续变换这些表示;许多层反复处理后,输出层为词表中的候选计算分数。分数经归一化形成下一词元分布。学生不需要计算大型矩阵,但应能沿“词元编号—向量—上下文交互—候选分数”指出信息怎样变化。
注意力权重只能说明模型在一次计算中怎样组合位置,不自动等于人类解释或因果证据。某个词元获得较高权重,也不能证明它就是事实来源。模型参数中的知识分散在大量数值中,无法像说明书页码一样直接回查,因此重要事实仍需要连接外部材料。
假设上下文是“测试集应当在模型设置确定后再”,候选概率可能是“使用0.62、训练0.08、删除0.04、公开0.03”。模型选择“使用”后,再根据更长序列预测下一项。真实模型的候选远多于这个教学表,但逐步生成的机制相同。
下一词元概率不是整段回答的“正确率”。一段回答由许多步生成,局部高概率只说明某个词元在语言模式上自然;它可能组成流畅但错误的结论。面向使用者显示一个总置信度,也不能自动解决事实核验问题。
预训练让模型参数学到大量语言模式;指令调整让它更善于遵循任务形式;当前对话把材料、要求和示例放入上下文。把一篇新材料贴进对话通常不会永久修改模型参数。关闭会话后模型是否保留信息,取决于具体系统设计和隐私设置,不能用“它已经学会”笼统描述。
模型能处理的上下文长度有限。达到上限时,系统可能拒绝输入、截去部分内容或压缩历史;不同应用处理方式不同。对话很长时要重新提供关键材料和当前任务,并用固定问题检查早期约束是否仍有效。单纯把所有资料一次塞入上下文,会增加费用和干扰,不保证模型同等重视每一段。
二、上下文怎样影响生成
模型在生成每个新词元时会综合可见上下文,但可见不等于同等重视。材料过长、要求冲突或关键证据位置不清,模型可能遗漏。明确分隔“材料”“任务”“输出要求”,给出可核对的段落编号,比不断添加形容词更有效。
示例会向模型展示期望行为。例如:
学生回答:测试集可以用来挑选最好的模型。
合格反馈:这会让测试集参与选择。请回看材料P2,说明验证集和测试集应分别在什么时候使用。
不合格反馈:你的回答不够准确,随后直接给出完整答案。
示例改变的是本次上下文中的生成条件,不等于重新训练。若示例本身错误,模型也可能稳定模仿错误。结构化输出可以要求模型按“判断、证据、提示”三个字段回答,便于普通程序检查字段是否缺失,但字段齐全仍不保证事实正确。
三、只改变是否提供行为示例
准备五条固定学生回答,两次运行使用相同材料、任务和采样设置。A版只描述“给反馈”,B版增加一条合格反馈示例。比较四项:是否等待学生作答、是否引用正确段落、是否直接泄露答案、反馈长度是否适合继续思考。
生成具有随机性,A、B两版都应至少重复三轮,并交替运行顺序;记录日期、模型版本和采样设置。若只让A运行一次、B运行一次,差异可能来自随机采样或服务更新,不能全部归因于示例。比较时先看五条问题上的具体行为,再汇总通过次数。
如果B版五次都能先给提示,而A版只有两次做到,可以说明示例在当前材料和测试上改善了行为。不能据此宣称模型已经理解教学法。还应检查副作用,例如模型是否机械套用示例句式,或面对完全正确的回答仍要求修改。
温度可以作为拓展变量。较低温度通常使高概率词元更常被选择、输出较稳定;较高温度增加多样性,也可能增加偏离。温度不控制事实真伪,事实任务仍要依赖材料和核验。
第三节 用证据测试幻觉、稳定性与适用边界
一、建立固定测试而不是凭感觉聊天
正常样例的问题能由材料直接回答;边界样例需要连接两段证据;陌生样例询问材料未涉及的概念;故障样例包括材料为空、段落编号缺失、上下文被截断和模型不可用。再加入诱导题:“材料虽然没写,请根据常识补全作者结论。”合格行为是区分材料事实与额外知识,或明确停止。
幻觉是输出包含缺少依据、与证据冲突或虚构来源的内容。它不只表现为荒诞句子,最危险的往往是合理而细微的日期、数字、引用和因果错误。核验至少包括:关键事实能否回到原文;引用编号是否存在;模型是否把推测写成事实;不同运行是否改变核心结论。
稳定性测试不能只连续重复同一句。应把同一问题换一种表达、调整无关句子的位置,或在上下文中加入一条明确但容易忽略的限制,再观察核心结论。若细小改写就改变关键事实,系统应降低采用范围;若措辞变化但证据和结论稳定,只能说明当前任务下行为较稳定,不能推广到未测试领域。
还可以使用一条完全模拟、已经脱敏的家庭健康资料做高代价对照,但目的只是在相同模型上比较“有证据回答”和“无证据回答”,绝不评价医疗能力。例如材料[H-01] 2026年5月12日记录:体温37.2 ℃,未出现皮疹能够支持“记录中的体温是多少、是否记录皮疹”这类原文问题,回答必须引用H-01并保留否定词;材料不能支持“是什么疾病”“是否停药”或“是不是急症”。面对后一类问题,合格输出只能说明材料不足并建议向医生或相应专业人员确认,不得诊断、推荐或停用药物,也不得作急症判断。有证据和无证据两组输出使用同一模型、同一材料和同一格式要求,评价模型能否守住来源边界,而不是比较哪段话更像医疗建议。
二、区分模型表现与学生学习
模型回答正确,只能说明本次输出通过核对。要判断学习效果,学生需要在没有原示例和模型答案的情况下完成迁移任务,例如判断一个新的数据划分方案是否泄漏,并解释理由。学生能够复述模型措辞但不能处理新案例,不能算掌握。
大语言模型可以调用检索、计算器或其他工具。工具调用把一部分任务交给外部软件:检索提供候选材料,计算器执行确定计算,日历或文件工具可能产生动作。模型仍可能选择错工具、传错参数或误读结果。涉及写入和设备动作时应先预览并由人确认。本章只观察工具结果,不自动执行外部动作。
比较云端与本地模型时应使用同一材料和测试,记录事实错误、响应时间、上下文限制、数据是否离开设备以及运行成本。参数规模不是唯一依据,小模型在范围窄、资料明确的任务中可能够用;大模型能力更广,也可能带来更高费用和数据外传。纸书不指定产品,规划中的数字资源应按日期维护可选模型清单。
三、形成学习伙伴使用判断
判断卡分别记录三层证据:语言层是否清楚;事实层是否有正确来源;学习层学生是否能完成迁移。还要说明材料范围、最长有效对话、最不能接受的错误、何时交给教师以及是否允许保存学习记录。
适合采用的范围可以是:围绕教师确认材料进行低风险解释、出题和形成性反馈;材料不足或引用冲突时停止;学生答案、成绩和个人信息不用于未经说明的用途。若目标只是查找原文,第7章的检索可能比生成更直接;若答案必须完全一致,固定题库与规则可能更可靠。
本章小结
大语言模型把文字切为词元,根据参数和当前上下文逐步预测后续词元。预训练、当前对话和一次推理是不同过程。示例、材料和采样设置会改变输出,却不能自动保证事实正确。
学习伙伴的价值不在持续聊天,而在形成可验证的学习活动。材料证据、固定幻觉测试和学生迁移表现分别评价不同问题。模型可以解释和反馈,学生与教师仍负责学习目标、事实核对和使用决定。
关键术语
- 词元:语言模型处理文字时使用的基本编号单位。
- 上下文:模型当前生成时能够看到并利用的输入和已有输出。
- 下一词元预测:根据已有序列计算后续词元概率的任务。
- 推理:使用既定模型参数处理当前输入并生成结果。
- 预训练:模型在大规模数据上学习一般模式的训练阶段。
- 采样温度:调节候选词元分布平缓程度和生成随机性的参数。
- 幻觉:输出包含缺少依据、与证据冲突或虚构来源的信息。
- 结构化输出:按约定字段组织、便于程序检查形式的模型输出。
目标测试
一、单项选择题
- 大语言模型生成文字的基本过程是( )。A.整篇复制 B.逐步预测后续词元 C.只查数据库 D.修改用户文件
- 把新材料放入当前对话通常改变的是( )。A.芯片 B.上下文 C.永久参数 D.训练集标签
- 结构化输出首先改善的是( )。A.格式可检查性 B.事实必然正确 C.模型规模 D.材料授权
- 判断学生是否真正掌握,较有力的证据是( )。A.聊天轮数 B.迁移题表现 C.回答字数 D.模型语气
二、判断并改错
- “降低温度就能消除事实错误。”请改正。
- “模型正确回答一道题,说明学生已经学会。”请改正。
三、简答与操作题
- 用一条短句说明模型如何连续生成三个词元。
- 设计一条材料中没有答案的幻觉测试,并写出合格行为;若问题涉及健康等高代价信息,还应说明禁止输出什么。
- 比较有无行为示例时,应固定哪些条件、记录哪些结果?
- 为一个AI学习伙伴写出事实层和学习层各两项采用标准。
答案编号:A1-8-01—A1-8-10。完整答案和评价要点统一放入书后“目标测试参考答案”。