版本对照:左侧保留服务器原有 v1.7,右侧为当前中职修订稿。两栏可独立滚动。
旧版 v1.7原稿

第4章 数据、模型与预测:AI 为什么不能离开好数据

本章导读

第3章解决的是怎样让 AI 协同学习环境先跑起来的问题。到了第4章,我们要往前多走一步:当 AI 给出一个预测、一个判断、一个看起来很专业的结论时,它到底依据什么?

很多学习者第一次接触人工智能时,容易把它想成一种会自己思考的神奇机器。它能写文章、能回答问题、能总结资料,好像什么都懂。可是,只要进入一个具体任务,问题马上就会出现:同样是让 AI 判断一个学习者的体测情况,如果给它的数据是真实、完整、干净的,它可能给出有参考价值的分析;如果数据里混入了明显错误,比如一个学习者立定跳远 1800cm,AI 也可能被这条离谱数据带偏。

本章不从复杂公式讲起,也不要求你手写机器学习程序。我们从一个每个人都能理解的例子开始:根据一组虚拟体测数据,观察 Notebook 中的简单模型如何根据身高、体重估计立定跳远距离,并让 AI 伴学助手帮助解释结果。然后,我们故意加入一条错误数据,观察预测结果发生什么变化。

这件事看起来很小,却能说明人工智能最重要的一条底层逻辑:模型不是凭空变聪明的,它是在数据中寻找规律;数据错了,模型学到的规律也会跟着错。

本章的学习重点不是会不会写代码,而是学会三件事:第一,看懂数据、模型、预测之间的关系;第二,知道异常数据为什么会影响模型判断;第三,养成先查数据,再信结果的基本习惯。 *** > 《论语》说:君子求诸己。 > 面对 AI 的回答,不能只看它说得像不像对,还要追问依据是什么。把输入、过程和结果拆开看,判断才会回到自己手里。

学习目标

  • 知识目标:
    1. 能用自己的话说明数据 → 模型 → 预测这条人工智能基本链路。
    2. 能解释什么是特征、标签、趋势线和误差。
    3. 能说明为什么错误数据会影响模型判断。
  • 能力目标:
    1. 能运行本章配套 Notebook 中的预置小实验,观察正常数据和异常数据下预测结果的变化。
    2. 能填写一张简单的数据观察表,记录模型预测值、误差变化和异常原因。
    3. 能借助 AI 伴学助手,用通俗语言解释一次模型结果是否可信。
  • 素养目标:
    1. 建立 AI 输出需要检查依据的意识,不盲信模型结果。
    2. 认识到涉及学生评价、身体数据、成绩判断等场景时,AI 只能辅助分析,不能替代专业人员和人的判断。
    3. 初步形成数据安全与隐私保护意识。

先修要求与环境清单

  • 先修知识:已完成第3章,能打开 VS Code 和配套 Notebook;知道 AI 伴学助手和本地大模型服务的大致作用。
  • 实践材料:本章 Notebook:notebooks/ch04_data_model_prediction.ipynb
  • 样例数据:虚拟体测数据表,包含三个字段:
    • height:身高,单位 cm;
    • weight:体重,单位 kg;
    • jump_distance:立定跳远距离,单位 cm。
  • 实践方式:本章只需要运行、观察、记录和解释,不需要从零编写程序。

本章提醒:本章使用的是虚拟数据。真实的学生身高、体重、体测成绩属于个人信息,不能随意上传到公共 AI 平台,也不能在没有授权的情况下公开传播。


知识准备:先认识这些词

  1. 数据(data) 可以理解为 AI 用来学习的材料。体测表、商品销量表、天气记录、设备运行日志,都可以是数据。

  2. 模型(model) 可以理解为 AI 从数据中总结出来的一套规律。模型不等于数据本身,它更像是从数据里学到的判断方法。

  3. 预测(prediction) 当模型面对新的情况时,根据已经学到的规律给出的估计结果。例如输入身高 175cm、体重 65kg,模型估计其立定跳远距离。

  4. 特征(feature) 用来帮助模型判断的已知信息。在本章中,身高和体重就是特征。

  5. 标签(label) 模型想要预测的目标结果。在本章中,立定跳远距离就是标签。

  6. 趋势线 当一堆数据点散在图上时,模型会尝试找到一条最能代表整体变化方向的线。它不一定经过每一个点,但尽量靠近大多数点。

  7. 误差 预测值和真实值之间的差距。误差越大,说明模型这次估计得越不准。

  8. 异常数据 明显不符合常识或记录规则的数据。例如普通学生立定跳远不可能达到 1800cm,这就是异常数据。


4.1 问题与现象:模型为什么会被一条错误数据带偏?

想象某课程正在整理一批虚拟体测数据。体育专业人员希望通过数据发现一些有用规律,例如:同样的身高和体重条件下,有些学习者跳远成绩明显高,可能说明爆发力或技术动作较好;有些学习者跳远成绩明显低,可能需要进一步观察起跳姿势、摆臂动作或训练情况。

如果数据很多,体育专业人员逐条查看会很耗时。于是可以让 Notebook 中的简单模型帮忙做一件事:根据已有学习者的身高、体重和跳远距离,估计某个学习者在这个体型条件下大概能跳多远。

这个任务本身并不复杂,但它能暴露一个关键问题:准确地说,模型不是直接理解人的身体素质,它只是根据数据中的关系进行估计。

如果数据表里大部分记录比较正常,模型会学到一个大致合理的趋势。例如,身高较高、体重适中、训练较好的学生,可能整体跳得更远。当然,这不是绝对规律,因为每个人的力量、动作、训练习惯都不同。

可是,如果数据里混入一条非常离谱的记录,例如:

相关内容见表4-1。

表4-1 异常体测记录示例表

身高 体重 立定跳远距离
175cm 60kg 1800cm

这条数据明显不可能真实发生。普通人的立定跳远不可能达到 18 米。它可能来自录入错误,也可能来自测距设备故障,还可能是单位写错了。

问题是:模型自己不一定知道这条记录不合理。它看到的只是表格中的数字。只要这条数据被送进模型,它就会参与寻找趋势线的过程。结果就是,原本比较平稳的趋势线可能被这一个异常点拉偏,预测值和误差都会发生变化。

这就是本章要观察的核心现象:

一条错误数据,有时足以改变模型学到的规律。

这也是为什么真实工作中经常说:数据清洗、数据检查、数据复核,比单纯追求更大的模型更重要。


4.2 原理与分析:数据、模型和预测到底是什么关系?

相关结构如图4-1所示。

图4-1 异常数据如何拉偏趋势线

图4-1采用空心圆点、叉号、实线和虚线区分信息,不依赖颜色。即使黑白印刷,也能看出正常样本、异常样本、正常趋势线和被拉偏后的趋势线。

4.2.1 数据是原材料:没有好数据,就没有好判断

人工智能的基本链路可以写成:

数据 → 模型 → 预测

这条链路可以用非常简单的话理解:

  • 数据:给模型看的过去材料;
  • 模型:从过去材料里总结出来的规律;
  • 预测:把规律用到新的情况上。

如果把人工智能系统比作一个学习做菜的人,数据就是它看过的菜谱和试吃记录,模型就是它总结出来的做菜经验,预测就是它面对一道新菜时判断应该怎么做、味道可能怎样。如果菜谱本身乱写,盐和糖经常记反,那么再努力学习,也可能学出错误经验。

体测数据也是一样。身高、体重、跳远成绩如果真实可靠,模型就有机会找到大致规律;如果数据里有很多错误、漏项、单位混乱或异常值,模型就会从错误材料中学习。

因此,学习人工智能时不要只盯着模型强不强,还要先问:

数据从哪里来?
数据有没有错?
数据是否完整?
数据是否适合这个任务?

这四个问题,是任何 AI 应用都绕不开的起点。

4.2.2 特征和标签:模型到底在看什么、猜什么?

在本章例子中,我们有一张虚拟体测表:

相关内容见表4-2。

表4-2 字段与含义记录表

height weight jump_distance
160 50 175
168 58 205
175 65 225

这三个字段中,heightweight 是模型已经知道的信息,叫作特征。jump_distance 是模型要学习和预测的目标,叫作标签。

可以这样理解:

特征:给模型看的线索。
标签:希望模型猜出的答案。

如果我们把问题说成一句话,就是:

已知一个学生的身高和体重,模型能不能估计他的立定跳远距离?

这只是一个非常简化的例子。真实体测成绩还会受到很多因素影响,如腿部力量、核心稳定性、训练习惯、起跳动作、心理状态等。本章故意只保留身高和体重两个特征,是为了让大家先看清最基础的模型学习过程。

这也提醒我们:模型没有看到的因素,它就很难纳入判断。如果只给模型身高和体重,却让它判断一个人的运动能力,这个判断一定是有限的,不能被当成最终评价。

4.2.3 趋势线:让散乱数据出现一个大致方向

线性回归可以理解为:在一堆散乱的点中,找到一条最合适的趋势线。

假设我们把每个学生看成图上的一个点。因为人的身体情况和训练情况不同,点不会整齐排成一条直线,而是有高有低、有近有远。模型要做的是找到一个大致方向,让这条线尽量靠近大多数点。

它并不保证每个人都被准确预测。比如有些学生技术动作特别好,真实跳远距离可能高于模型预测;有些学生力量不差,但起跳动作不熟练,真实成绩可能低于模型预测。

所以,趋势线表达的是整体规律,不是每个人的命运。

这一点非常重要。AI 模型适合帮助我们发现大致趋势,但不能简单替代专业人员做最终判断。

4.2.4 误差:模型有没有学好,要看差距

模型给出预测以后,我们不能只看它有没有输出,还要看它输出得准不准。预测值和真实值之间的差距,就是误差。

例如:

真实跳远距离:220cm
模型预测距离:210cm
误差:10cm

如果大多数样本的误差都不大,说明模型大致抓住了规律;如果很多样本误差都很大,说明模型可能没有学好,也可能数据本身不适合这个任务。

本章 Notebook 会显示一个简单指标:平均绝对误差,可以理解为平均差了多少。你不需要记住复杂公式,只需要知道:

平均误差越小,说明模型整体预测越接近真实值;
平均误差突然变大,说明数据、模型或流程中可能出现了问题;
误差指标只能提醒我们继续检查,不能单独决定学生评价。

4.2.5 异常数据为什么会拉偏模型?

现在回到最关键的问题:为什么一条跳远 1800cm的错误数据,会影响模型?

因为模型在寻找趋势线时,会尽量照顾所有数据点。正常数据点都在一个合理范围内,趋势线比较稳定;突然出现一个离谱点,模型会尝试把这条线往它那边拉,以减少这个点带来的差距。

这就像一群人排队拍合照,大多数人站在中间,队形很整齐。突然有一个人站到很远的地方,如果摄影师坚持把所有人都放进画面,镜头就不得不拉远,整个画面都会变小,原本主要人物反而不清楚了。

异常数据就是那个站得太远的人。它可能只有一条,却会影响整体画面。

所以,在真实项目中,数据进入模型前,通常要做检查,例如:

  • 跳远距离是否超过常识范围;
  • 身高、体重是否漏填;
  • 单位是否统一;
  • 是否存在重复记录;
  • 是否存在录入错误。

模型不是数据警察。很多时候,数据质量需要人和规则先把关。


AI 协同实践:20分钟观察一条异常数据如何改变预测

本章实践不要求你从零写代码。Notebook 已经准备好数据、图表和运行单元。你的任务是运行、观察、记录和解释。

实践目标

通过一次小实验验证本章核心原理:

模型从数据中学习规律;如果数据被异常值污染,模型的误差和预测结果可能发生明显变化。

实践准备

打开文件:

notebooks/ch04_data_model_prediction.ipynb

确认 Notebook 中已经包含以下区域:

  1. 正常数据预览;
  2. 正常数据下的趋势图;
  3. 正常数据下的预测结果;
  4. 加入异常数据后的趋势图;
  5. 两次结果对照表;
  6. 观察记录区。

第 1 步:观察正常数据

运行 Notebook 中的正常数据预览单元。观察表格中每一列的含义。

请填写:

相关内容见表4-3。

表4-3 问题与我的记录表

问题 我的记录
表格中有几个字段?
哪些字段是模型输入的线索?
哪个字段是模型要预测的结果?
数据看起来是否有明显离谱值?

第 2 步:运行正常数据下的预测

运行正常数据预测单元。Notebook 会给出一个样例学生:

身高:175cm
体重:65kg

记录模型预测的立定跳远距离和平均误差。

相关内容见表4-4。

表4-4 项目与记录表

项目 记录
样例学生身高 175cm
样例学生体重 65kg
正常数据下的预测距离
正常数据下的平均误差

第 3 步:加入异常数据

运行加入异常数据单元。Notebook 会自动加入一条异常记录:

身高:175cm
体重:60kg
立定跳远:1800cm

注意:这是一条故意设计的错误数据,不是真实记录。

第 4 步:再次运行预测并对比

运行异常数据预测单元,记录新的预测结果。

相关内容见表4-5。

表4-5 正常数据与异常数据结果对照表

项目 正常数据 加入异常数据后 是否明显变化
样例学生预测距离
平均误差
趋势线方向

第 5 步:请 AI 帮你解释,但不要直接照抄

把你的观察表发给课程 AI 伴学助手,并使用下面提示词:

我正在学习数据、模型与预测。
下面是我观察到的正常数据和加入异常数据后的模型结果:
【粘贴我的观察表】
请用读者能理解的话解释:
1. 为什么一条跳远1800cm的错误数据会影响模型?
2. 如果真实学校体测数据里出现这种记录,应该先做什么检查?
3. 为什么不能直接把模型预测当作学生成绩评价?
要求:不要写复杂公式,用生活例子说明。

AI 给出解释后,请你用自己的话再写一段 80—120 字总结。不要只复制 AI 原文。

第 6 步:人工复核

请根据本章内容判断下面说法是否正确:

相关内容见表4-6。

表4-6 判断题与理由记录表

说法 正确/不正确 理由
模型预测值一定比专业人员判断更客观。
数据中有一条异常记录,也可能影响模型整体规律。
模型误差变大时,应该优先检查数据是否异常。
AI 可以辅助发现问题,但不能替代真实体测成绩和人工评价。

验证与证据:怎样让模型少被错误数据影响?

本章实验不是为了证明模型坏,而是为了让我们知道:要让 AI 可靠工作,必须做好数据检查。

三个最简单的数据检查规则

对于本章体测数据,可以先设置三条非常朴素的规则:

规则1:身高应在合理范围内,例如 120cm—220cm。
规则2:体重应在合理范围内,例如 25kg—150kg。
规则3:立定跳远距离应在合理范围内,例如 50cm—350cm。

这些规则并不完美,但能拦截明显错误。例如跳远 1800cm就会被规则3发现。

数据检查不是为了排斥特殊学生

需要注意,数据检查不是简单地把所有不一样的人排除掉。真实世界里确实会有身体条件特殊、成绩特别优秀或特别需要帮助的学生。我们要区分两件事:

  • 异常数据:明显不可能或明显录入错误,例如跳远 1800cm;
  • 特殊个体:真实存在但与多数人不同,例如某位学生经过专业训练,跳远成绩明显高于同龄人。

如果只是因为某个学生成绩特别好,就把数据删除,这是不负责任的。正确做法是:先核对记录是否真实,再决定如何处理。

让 AI 帮你设计检查清单

可以让 AI 伴学助手帮你设计数据检查清单,但你必须审查它是否合理。

提示词示例:

请帮我为一张虚拟学生体测数据表设计数据检查清单。
表中字段包括:身高cm、体重kg、立定跳远距离cm。
要求:
1. 用读者能理解的话说明每条检查规则。
2. 每条规则都要写出为什么要检查。
3. 不要把模型预测结果作为学生最终评价。
4. 结果用表格输出。

你需要重点检查:

  1. AI 给出的范围是否符合常识;
  2. 是否误把特殊个体当作错误数据;
  3. 是否保留了人工复核环节。

伦理、安全与边界:体测数据辅助分析可以做什么,不能做什么?

假设学校希望建设一个体测数据辅助分析小助手。它可以做什么?

它可以帮助负责人快速发现:

  • 某些记录是否明显不合理;
  • 某些学生是否需要进一步关注;
  • 某些班级的整体数据是否存在录入问题;
  • 某些训练建议是否需要根据趋势调整。

但它不能做什么?

它不能直接决定:

  • 某个学生体测是否合格;
  • 某个学生身体素质一定好或一定差;
  • 某个学生是否应该被批评、奖励或处分;
  • 某个负责人的工作效果是否完全由模型判断。

因为模型只能看到数据表中的一部分信息。它看不到学生当天是否身体不适,看不到测试场地是否湿滑,看不到动作是否受伤病影响,也看不到数据是否录错。

因此,本章要建立的职业底线是:

AI 可以帮助发现线索,不能替代人承担判断责任。


使用边界

  1. 隐私边界 身高、体重、体测成绩属于个人信息。真实数据必须脱敏处理,不能随意上传公共平台。

  2. 评价边界 模型预测只能作为辅助参考,不能直接替代正式考核结果。

  3. 数据边界 数据异常不等于学生异常。发现离谱记录时,应先核对数据来源和录入过程。

  4. 责任边界 AI 可以生成解释、建议和检查清单,但最终复核和使用责任仍在人。

  5. 公平边界 如果数据本身存在偏差,模型可能放大偏差。比如某些班级测试条件不同,却被放在一起比较,就可能造成不公平判断。


交付物标准

请提交一份 Markdown 格式的《异常数据如何影响模型判断观察记录》,至少包含以下内容:

相关内容见表4-7。

表4-7 交付物与达标要求记录表

项目 达标要求
数据观察表 能写清楚特征、标签和异常数据是什么
结果对照表 能记录正常数据和异常数据下预测值、误差的变化
原理解释 能用自己的话说明异常数据为什么会拉偏趋势线
AI 协同记录 能粘贴一次向 AI 提问的提示词和主要回答摘要
人工复核结论 能说明哪些结论可以参考,哪些不能用于正式评价
安全意识 能说明真实体测数据为什么不能随意上传或公开

总结与思考

  1. 人工智能的基础链路是:数据 → 模型 → 预测。这条链路比很多术语更重要。
  2. 特征是模型看的线索,标签是模型要学习和预测的结果。
  3. 线性回归可以帮助我们直观看到趋势线如何代表整体规律。
  4. 一条极端异常数据可能让模型误差变大,也可能改变预测结果。
  5. 数据检查、人工复核和责任边界,是使用 AI 做预测时必须守住的底线。

练习与思考

基础题

  1. 请用一句话说明数据、模型、预测分别是什么意思。
  2. 在本章体测例子中,哪些字段是特征?哪个字段是标签?
  3. 为什么跳远 1800cm属于异常数据?
  4. 平均误差变大,通常说明什么?

实践题

  1. 在 Notebook 中再尝试加入一条错误数据,例如体重 600kg,观察结果是否变化。
  2. 让 AI 帮你设计 5 条体测数据检查规则,并人工判断是否合理。
  3. 画一张简单的黑白观察图,说明异常点怎样影响趋势线。要求用实线、虚线或不同形状区分信息,不依赖颜色。

反思题

  1. 如果一个模型预测某位学生体测表现较差,能不能直接据此批评学生?为什么?
  2. 你在生活中还见过哪些数据错了,判断也跟着错的例子?
  3. 当 AI 给出看起来很有道理的分析时,你会先检查哪些依据?

本章交付物

  1. 本章 Notebook 运行记录。
  2. 一条核心提示词和一段 AI 输出。
  3. 改变变量前后的观察表。
  4. 人工复核记录。
  5. 100—200 字原理解释。
当前中职版(2026-07-20)修订稿

第4章 数据、模型与预测:AI 怎样学会回答

(建议3课时)

章首语

工房建好了,环境验证过了,小李却生出一个新的疑问。这位 AI 助手上知天文,下知地理,写通知、答问题样样在行——它这一身本领,究竟是从哪里学来的?

它没有上过学,没有老师给它批改作业,也从未在生活里摸爬滚打。可它谈起食堂菜谱头头是道,说起汽车构造条条在理。本领必有来处,正如流水必有源头。

这一章,我们溯流而上,去看它的源头:它读过什么,怎样学习,又凭什么本事回答我们的每一个问题。看清了源头,前几章留下的那句提醒——流畅不等于正确——也将真相大白。

为了避免把复杂技术讲成一句口号,本章将区分模型的训练阶段与使用阶段。我们会看到,文字先被拆成模型可处理的文本单元,训练通过大量样例调整内部数值;使用时,模型依据当前内容为后续单元计算多种可能,再按生成设置逐步形成回答。

字里行光 问渠那得清如许?为有源头活水来。——朱熹《观书有感》

学习目标

  1. 知道大语言模型的能力来自数据与训练,能简述训练的基本方式;
  2. 能复述并理解本书的核心机制陈述:“根据当前可见内容预测后续文本”;
  3. 能由这一机制解释模型”为什么流畅”和”为什么会编”;
  4. 知道数据质量决定模型品质,能举出坏数据带来的问题;
  5. 树立尊重数据、保护隐私的意识。

4.1 模型是怎样炼成的:数据与训练

大语言模型的”课本”,是人类写下的海量文字:书籍、文章、网页、对话,数量之大,一个人穷尽一生也读不完万分之一。这些供机器学习使用的文字材料,就是它的数据

它处理文字时,会先把文字拆成可计算的文本单元,再练习依据已有内容预测后续单元。预测与原文存在差异时,训练程序便调整模型内部的大量数值。让模型通过海量数据反复调整、逐渐形成某种能力的过程,称为训练(Training);训练完成后得到的系统,称为模型(Model)。

亿万遍填空练下来,模型把人类语言中词与词的搭配、句与句的承接、事与理的关联,都摸出了规律。它并没有背下每一篇文章,而是把规律存了下来——好比一位读遍天下文章的人,未必记得每一页原文,落笔却自有章法。

【做一做】 请补全下面两句话,并留意你是怎样”知道”答案的: ①床前明月光,疑是地上(  )。 ②今天下大雨,出门记得带(  )。

训练不是简单记忆答案

训练前,文字要先被转换成模型可处理的文本单元。一个单元可能是一个字、一个词的一部分或标点,具体划分由模型决定。训练程序给模型一段内容,让它预测后续单元,再把预测与原文比较。差异越大,说明当前内部数值越需要调整;经过大量批次反复调整,模型逐渐学到语言结构和知识关联。

模型内部包含许多可以调整的数值,它们共同影响每一步预测。训练的目标不是把某篇文章原样放进一个抽屉,而是让这些数值形成对大量规律的压缩表示。因此,模型可能概括相似表达,也可能在罕见问题上混淆;它还可能复现训练材料中的错误、偏见或不当内容。

【图4-1 训练阶段:数据样例—预测—比较差异—调整内部数值(SVG图位)】

真实模型训练还会经过数据清理、基础训练、任务适配和安全调整等环节。不同模型使用的数据、结构和训练方法不同,表现也会不同。教材中的“填空”是帮助理解主要目标的入门模型,不代表训练过程只有一种题型,更不代表模型的全部能力都能用一次填空解释。

4.2 承重的一句话:根据前文预测

刚才的填空,你几乎不假思索:第一句填”霜”,第二句填”伞”。凭什么?凭你读过的诗、经过的事——见得多了,下一个词自然浮现。

大语言模型回答问题,用的正是同一个动作。本书最重要的一句话,就在这里:

大语言模型会依据当前可见内容,计算后续文本的多种可能,并按生成设置逐步形成回答。

请把这句话读两遍。全书后面的许多道理,都由它生长出来,我们不妨当下就推出三条。

第一条:它为什么流畅。它统计过亿万篇文章里词语的走向,预测出的每一个词,都顺着人类语言最常见的路走。所以它的话总是通顺妥帖,像出自一位老练的写作者。

第二条:它为什么会编。预测只管”像不像”,不管”是不是”。问它”床前明月光”的下一句,数据里千万遍出现过,预测便与事实相合;问它”我们班班主任姓什么”,数据里没有依据,它依然会预测出一个最像答案的姓——王,或者李。话说得一样流畅,内容却是无中生有。前两章见过的”凭空补出周六和三号广场”,根源就在这里:它不是在查证事实,而是在续写语言。

第三条:它为什么需要人来核对。既然流畅是预测的本色,编造是预测的暗面,那么分辨真假这件事,模型自己无法完全担保,必须由使用它的人来完成。第2章的”看结果”、往后各章的种种核验方法,都是这第三条的展开。

一句机制,三条推论——这就是本书的承重之梁。往后每逢新的现象,我们都会回到这里来找答案。

【想一想】① 用”预测下一个词”的道理,解释第2章小李遇到的事:为什么他不给时间地点,模型会写出”周六上午”和”三号广场”,而不是空着不写?

【旁注】(楷体) 预测并非机器独有。经验丰富的师傅听发动机的声响,能预测故障在哪里;老练的棋手看一眼棋局,能预测对手的下一步。模型的特点在于,它能对后续文本的多种可能进行连续计算,而训练中处理过的语言样例数量巨大。

从候选结果到连续生成

使用阶段不再调整整套模型内部数值,而是把当前问题和可见材料送入模型。模型为下一文本单元计算一组可能性,并依据生成设置选出其中一个;新单元加入当前内容后,系统再计算下一步。循环持续到回答结束、达到长度限制或被系统停止。

模型不必每次都选择可能性最高的一项。系统可以让选择更集中,使回答较稳定;也可以保留更多候选,使表达更多样。因而,同一问题多次回答可能不同。对需要事实一致和格式固定的任务,应降低不必要的随机变化,并用验收规则检查;对创意构思,可以允许更丰富的候选,但仍要遵守边界。

【图4-2 使用阶段:当前内容—候选可能性—选择下一单元—循环生成(SVG图位)】

“预测后续文本”能够解释回答为何连贯,却不能推出“模型只会模仿句子”。训练形成的内部表示可以支持归纳、比较和一定程度的推理,系统还可能连接检索资料和外部工具。与此同时,生成仍不等于查证。只要当前依据不足,流畅的推理过程也可能从错误前提出发,因此第7章以后还要建立证据链。

4.3 好数据与坏数据

源头决定流水。模型的一切规律都从数据中来,数据的品质,也就决定了模型的品质。

数据可能有错。人类写下的文字本就真伪混杂,谣言与讹传一旦进入数据,也会被当作规律学去。

数据可能过时。模型的训练总在某个时间点完成,此后世界发生的事,它一概不知,问急了,它便按旧规律预测出一个”新答案”。

数据可能有偏。如果数据里某类人、某类职业总以固定的面目出现,模型学到的便是偏见,说出的话会不知不觉带着成见。

明白了这三条,我们对模型的态度就有了分寸:它是一位读书极多的伙伴,但它读的书里有精华也有糟粕,有新知也有旧闻。敬其博学,核其言语,这不是苛刻,而是清醒。

这一节还有一层与职业相关的意思。今天各行各业都在积累自己的数据:维修厂的工单、医院的护理记录、商铺的销售流水。这些记录将来都可能成为训练行业模型的源头活水。认真、真实、规范地记录数据,正在成为一项新的职业基本功——你今天写下的每一条工单,也许就是明天行业智能的一滴源头水。

【想一想】② 如果一个模型的训练数据主要来自十年前的维修手册,用它协助今天的新能源汽车检修,可能出现什么问题?

【想一想】③ “认真记录数据是职业基本功。”结合你的专业,举一个例子说明这句话。


数据质量要在整个流程中检查

高质量数据不仅要“正确”,还要考虑代表性、时效性、完整性、来源授权和标注一致性。若只收集白天拍摄的安全帽图片,模型在夜间场景可能明显变差;若维修工单缺少车型和故障条件,模型便难以区分相似问题;若两位标注人员对同一现象给出不同类别,模型会收到互相冲突的信号。

工程上通常把数据分成不同用途。训练部分用来调整模型,验证部分帮助选择设置,测试部分留到最后检验对未见样例的表现。若反复用同一批题训练又验收,模型可能只熟悉这些题,却不能说明在新任务上也有效。这与只背模拟卷、不面对新题的区别相似,但评价必须以真实测试记录为准。

数据进入项目后还需要版本和来源记录。新增资料、删除错误记录、改变标注规则,都应写明时间与原因。只有知道某次模型测试使用了哪一版数据,才能解释结果变化,也才能在发现问题时回到来源修正。数据工作因此不是训练前的一次准备,而是贯穿模型生命周期的工程任务。

工程案例:商品评价分类为什么换店就失灵

某小组用一家数码店的商品评价制作“满意、一般、不满意”分类演示。训练样例中,“续航强、屏幕清楚”多为满意,“发热、卡顿”多为不满意。课堂测试表现较好,但换到服装店后,“面料薄”有时是夏装优点,有时是质量抱怨,原有规律无法直接套用。

小组回看数据,发现三个问题:类别来自单一店铺,表达场景不够多;“一般”和“不满意”的标注规则不一致;测试题曾在调整规则时反复查看,已经失去独立检验作用。于是重新制定标注说明,把数据按商品类别和时间分组,留出一批从未用于修改的测试样例。

数据检查 发现 可能影响 修正
代表性 只有数码商品 换品类后失效 增加其他品类
一致性 同句标注不同 模型收到冲突信号 统一标注规则
时效性 旧型号评价过多 新商品特征不足 标明时间并补样例
独立测试 反复看测试题 结果过于乐观 留出未见样例

修改后,课堂并不追求训练一个大型模型,而是通过实训页观察数据分布变化怎样影响结果。先在原店铺样例上测试,再在新店铺样例上测试,分别报告表现,不能只给一个总数掩盖差异。对“面料薄”这类依赖上下文的表达,系统应保留整句和商品类型,而不是只取关键词。

案例说明,模型表现是“模型、数据、任务条件”共同作用的结果。一个模型在某组样例上通过,不等于在所有场景都通过。数据卡应写明来源范围、时间、类别比例、标注规则和已知不足;没有这些条件,单独展示一个正确率没有足够意义。

实践活动 亲眼看一看”预测”

本章起,实践活动在课堂本地环境进行。打开本章实训页(labs/ch04),完成环境三步验证后开始。

第1步 逐词观察。 实训页开启了”逐词显示”开关。输入一个简单问题,观察回答不是整段跳出,而是一个词一个词地”长”出来——你看到的,正是一次次预测的连续发生。

第2步 接词比赛。 实训页给出五个句子开头(如”秋天到了,树叶……“)。先自己写下预测的下一个词,再让模型续写,比一比:哪些句子人机所见略同?哪些句子它接得比你更常见、更”大路”?

第3步 诱它一编。 问它一个它不可能有依据的问题,例如:

请告诉我,我们班下周三值日生是谁?

观察它的回答。它是承认不知道,还是预测出了一份像模像样的名单?把结果如实记录——如果它承认不知道,也是重要的观察。

第4步 填写记录单。 将三步观察填入《预测观察记录单》。

【编者注:此处配实训页实际截图,待实训页定稿后补充】


增加可重复的预测实验

接词比赛中,每个句子连续运行三次。记录首个输出片段是否相同、整体意思是否变化、是否出现事实性补充。随后在实训页切换“稳定表达”和“多样表达”两种预设,再比较结果。页面只显示设置名称和现象,不要求学生修改技术参数。

“诱它一编”不能只记录一次回答。请用“有依据的问题、材料不足的问题、含错误前提的问题”各做一组测试,并标明模型是直接回答、说明不知道,还是先纠正前提。最后写出一条结论:预测机制怎样带来语言能力,又为什么仍需要资料与核验。

解释一次结果波动

每组选择一个开放式句子,在“稳定表达”和“多样表达”两种预设下各运行三次。先比较首段输出,再比较事实内容、结构和措辞。若只是表达不同,记录为措辞波动;若事实判断不同,记录为内容波动;若格式未按要求,记录为约束未保持。三类变化不能混成“答案不一样”。

再选择一条错误结果,画出训练阶段与使用阶段的责任边界:哪些问题可能来自数据和训练,哪些问题来自当前上下文或生成设置,哪些仅凭一次课堂观察无法确定。不能确定时明确写“证据不足”。最后用200字解释核心机制,必须同时出现“文本单元、多种可能、生成设置、核验”四个要点。

预测实验的证据表

每个实验条件至少保留三类证据:输入是什么,系统采用哪种预设,输出发生了什么。观察“逐步形成回答”时,不把页面动画速度等同于模型内部计算速度;页面可能分批显示结果,技术结论只写到实训页能够支持的程度。

条件 重复次数 稳定部分 波动部分 是否涉及事实
稳定表达 3
多样表达 3
材料不足 3

最后把实验结论与第2章联系起来:开放式创作可以接受表达波动,岗位数据和固定格式任务则需要更严格的材料、设置与验收。结论中至少写出一个“模型可以做”和一个“模型不能自行保证”,避免只讲能力或只讲风险。

岗位迁移:做一张小型数据卡

电商方向选择12条虚构商品评价,数媒方向选择12条虚构作品标签,汽修、护理或物流方向选择12条去标识化的故障现象、护理观察或物流状态。先明确任务是分类、预测还是生成,不把不同目标混在同一组数据中。数据量只够课堂观察,不用于声称训练了可部署模型。

数据卡写明来源方式、时间范围、类别规则、是否含个人信息、哪些场景没有覆盖。两名成员独立检查标注,对意见不一致的记录保留争议状态。若一组样例全部来自相似场景,要主动补入不同条件,而不是用重复数据增加数量。

把样例分成用于观察规律的一组和最后才查看的测试组。调整分类说明时不查看测试答案;完成后一次性运行并记录。若测试结果较差,先分析代表性、标注和任务条件,不能反复改到这批题全部通过后再把它当作独立测试。

迁移总结回答三个问题:模型可能学到什么规律,哪些规律可能是数据偏差,当前测试不能证明什么。把“数据质量决定模型品质”具体落实为一张能被另一组检查的数据卡,而不是停在口号上。

贯穿项目:班级 AI 助手 v0.4

本章项目阶段是“数据与预测”。加入一组带来源的数据样例和预测记录,说明数据改变后结果怎样变化,哪些结论仍需核验。这一版不是另起一个无关作业,而是在上一版项目档案上增加一项可验证能力;新增、保留和取消的内容都要写入版本记录。

同时把本章最值得保留的一次失败写入《失败样例册》。记录项目版本、输入条件、预期与实际、错误起点、修改动作和回归结果;暂时无法定位时写“证据不足”,不得为了完整而虚构原因。

安全与责任

本章红线 数据里有他人的生活。收集、使用、分享数据,必须尊重隐私、遵守规定。

一条护理记录连着一位病人的隐私,一份客户名单连着千百人的信任。数据是资源,更是责任:不该收的不收,不该看的不看,不该传的不传。将来无论在哪个岗位上同数据打交道,这条底线都先于一切技巧。

本章小结

这一章,我们找到了源头。模型的本领来自海量数据和反复训练;使用时,它依据当前可见内容计算后续文本的多种可能,并逐步形成回答。由这一句机制,我们推出了三条道理:预测顺着语言的常路,所以流畅;预测只问像不像、不问是不是,所以会编;真假的把关,必须由人来做。源头活水有清有浊,数据的品质决定模型的品质,也提醒我们守好自己手中的数据。承重之梁已经立起,后面各章的种种现象,都将回到这里得到解释。

习题

基础题

  1. 默写本书的核心机制陈述,并用自己的话解释其中”预测”的含义。
  2. 由这句机制推出的三条道理是什么?各用一句话写出。
  3. 判断并说明理由:模型回答错了,说明它存心欺骗我们。

应用题

  1. 一位同学问模型”本校今年校运会的冠军班级”,模型给出了一个具体班级。请用本章道理分析:这个回答可信吗?该怎样核实?
  2. 从你的专业里举出一种正在被记录的数据(如工单、台账、病历),说明它如果记录马虎,将来可能带来什么后果。

拓展题(选做)

  1. 想一想:为什么同一个问题问两次,模型的回答可能不完全相同?试着用”预测”的道理作出解释。

本章交付物

交付物 要求
《预测观察记录单》 一张,三步观察记录完整
自评勾选单 逐条自查勾选

《预测观察记录单》

项目 记录
逐词观察:我看到的生成过程
接词比赛:人机一致的句子
接词比赛:模型的选择更常见的句子
诱它一编:它的回答与我的判断
我对”承重的一句话”的理解(一两句)

自评勾选单