十二章候选稿 · 汇总于2026-10-08
《人工智能基础与实践》中职/技工版 · 全稿
本页收录《人工智能基础与实践》中职/技工版四单元十二章候选稿,汇总于2026年10月8日,供阅读、审阅与教学试用。这是独立的十二章修订线,保留各章原有稿件版本,与本站十四章中职版及高职版分别提供入口。
第一单元 与AI相遇:认识变化,表达自己的想法
第1章 认识正在走进生活的人工智能
样章 v0.2 | 2026年9月20日
从一个问题开始
桌角有一张用过的包装纸。你拿起它,想做一点东西,又暂时没有想法。
过去,你可能会先翻书、搜索图片,或者问身边的人。现在,你还可以打开一个AI对话窗口,写下:“一张旧包装纸,除了包东西,还能用来做什么?”
屏幕上可能出现一些你想到过的建议,也可能有一个新点子让你停下来。你接着说明,手边有什么材料,希望做给谁看。随着交流继续,那个模糊的念头有了可以尝试的第一步。
但纸是否折得起来,作品是否符合你的想法,同学看了以后有什么反应,还需要你去做、去看、去交流。
这是一种可能发生的学习情境。你也可以从完全不同的问题开始:想解释一个现象,想读懂一段材料,想把一次经历讲清楚,或者想改善一件不方便的小事。
人工智能正在成为我们接触信息、表达想法和制作作品的一种工具。本章先认识它能够参与哪些事情,再完成一次自己的尝试。你不需要先会编程,但需要带着好奇心,留意实际发生了什么。
学完本章,你将能够:用例子说明识别、生成与执行的不同;初步解释规则、数据和模型之间的关系;完成一次交流、追问和核对,并说清自己作出的一项判断。
1.1 人工智能能够参与哪些事情
1.1.1 识别、生成与执行
人工智能(artificial intelligence,AI)是研究和构建具有识别、学习、推理、生成等能力的计算机系统的技术与方法。这样的系统接收文字、图像、声音或其他信息,经过处理,给出判断、建议、内容,或者帮助安排后续行动。[1]
这句话还比较概括。我们可以先从使用中容易观察到的三类事情认识它:识别、生成和执行。这是一种便于入门的观察方式,实际应用中的能力常常相互配合。
识别:从已有信息中作出判断。
你给一个支持图像输入的AI应用提供照片,请它指出照片中的物品;或者给语音识别程序一段录音,让它把说话内容转成文字。这些任务都需要系统从输入中提取信息。[3]
观察识别结果时,要注意输入的范围。一张照片记录了一个角度,录音也只保留了当时采集到的声音。假如照片没有拍到纸盒背面的标签,系统就不能仅凭正面照片确认标签上写了什么。它可以提出猜测,但猜测需要与看见的内容分开。
生成:根据要求形成内容。
你可以请AI把一段说明写得更容易理解,为一个主题提出几种表达方式,或者生成一幅图像。不同应用支持的形式不同,需要使用相应功能。[3]
生成过程中,系统会利用从数据中学到的关联和当前提供的信息组织输出。文字可以通顺,点子也可能有启发,但里面的具体事实仍然需要核对。[5]
例如,你请AI为自己的小作品写介绍,却没有告诉它作品的尺寸。它若写出了一个具体尺寸,你就需要确认这个数字从哪里来。对于作品名称,你可以比较不同提议后自行选择;对于实物尺寸,则应该测量或查阅自己的记录。这两种判断的依据不同。
执行:借助工具完成实际操作。
当AI应用接入适当工具,并获得相应许可时,它还可以帮助调用计算程序、读取文件,或修改一个网页。应用中的AI提出要进行的操作,程序或工具负责实际执行,再把结果返回。[6]
请比较两种情况:一种是屏幕上出现“请把这段文字保存成文件”的操作说明;另一种是指定位置已经出现文件,而且打开后能看到正确内容。前一种给出了做法,后一种才有实际保存结果。
因此,观察AI执行任务时,既要看它说了什么,也要查看文件、程序或设备实际发生了什么变化。
这三类事情可以连在一起。例如,应用先读取一张作品照片,再整理介绍文字,最后调用工具把内容放入网页。也可以只使用其中一种能力。简单计算或固定格式转换,常常直接使用普通程序就能完成;选择合适的方法,比为所有操作加上“AI”名称更重要。
1.1.2 一次实际体验中的能力与限制
打开AI对话工具,做一次小尝试。
第一次提问可以很简单。你可以写下自己的问题,也可以借用下面的起点:
我想用一张旧包装纸做一个有意思的小作品,你有什么建议?
读到回答后,先找一条自己愿意继续了解的建议。然后想一想:这条建议适合我现在的材料和条件吗?我还需要说明什么?
例如,你可以继续补充:
我只有一张纸和一支手电筒。这次不使用剪刀、胶水,也不拆装电器。我想向同学展示一种会变化的影子。请帮我想一个容易尝试的做法,并说明第一步。
这一次,你说明了材料、操作范围和想呈现的效果。系统可利用的信息更具体了。它的回答是否真的更适合你,仍要通过阅读与尝试来判断。[5]
下面是一段示例:
可以试着把纸折成连续的折面,让它立在桌上。用手电筒从不同方向照,观察影子有什么变化。先试折一小段,看看这张纸能否保持形状,再决定怎样继续。
读完这段话,可以从三个方面理解它。
它使用了你说明的材料,没有增加复杂设备;它把“做一个有意思的作品”变成了一个较容易开始的动作;它还留下了需要现场观察的问题——手里的纸是否能保持形状,实际影子是否符合你的期待。
你可以先想象,也可以在教师允许的条件下进行简单尝试。使用手电筒时不要照向眼睛。这里不要求必须完成纸作品,重要的是看清:一个想法怎样在补充信息和实际观察中逐步具体起来。
你的AI回答可能完全不同。它可能提出更好的办法,也可能要求更多材料,或者需要你继续说明。按实际情况记录即可。第一次回答已经很有帮助时,就继续完善;暂时没有合适建议时,也可以换一个更明确的问题。
这次体验中,AI帮助你扩大了可考虑的做法,或者把一个想法拆成了容易开始的步骤。你则需要判断建议是否适合自己,决定采用什么,并观察实际效果。
停下来想一想:你补充的哪一条信息最重要?从实际回答中,能看出这条信息影响了什么吗?
1.2 人工智能怎样发展到今天
1.2.1 从编写规则到从数据中学习
今天的AI应用建立在长期研究之上。1956年,在美国达特茅斯学院举行的人工智能夏季研究项目,是人工智能研究领域形成的重要节点之一。研究者开始围绕机器怎样学习、使用语言和解决问题展开集中讨论。[2]
了解这段历史,可以先抓住一个问题:人怎样让计算机知道该怎么处理一件事?
一种办法是把处理规则明确写出来。
假设你想让程序从一组物品图片中找出杯子,最初想到的规则可能是:“看见把手,就判断为杯子。”可是,水壶也有把手,有些杯子又没有把手。你继续增加条件,还会遇到角度变化、遮挡和不同形状的问题。
这个例子说明,对某些任务,人很容易认出结果,却很难把所有判断条件写成一套简单规则。
另一种办法是提供许多例子,让计算机通过计算寻找其中的规律。这就是机器学习的基本思路。[3]
还是以辨认杯子为例。准备一批杯子和其他物品的图片,并说明每张图属于哪一类。这些图片和对应说明就是训练时使用的数据。计算机先按当前的方法给出判断,再把判断与已知结果比较,并据此调整内部一些数值。经过许多次这样的比较和调整,处理方法逐渐形成。这个过程称为训练。[4]
训练得到的模型,可以接收新的图片并给出判断。在这里,模型是把输入信息通过计算转换为结果的一套结构和数值。训练中调整的数值会影响它怎样处理输入。它与桌面上的纸模型含义不同,也不等于我们看到的聊天窗口。[4]
现在可以把过程连起来理解:准备例子,训练模型,用新的材料检查,再观察它能否用于需要解决的问题。
训练过的材料不能代表所有实际情况。假设训练中的杯子总是放在白色桌面上,模型可能利用了背景中的某些规律。换一个背景后,结果是否变化,需要实际检查。第3章会通过一个小实验进一步研究这个问题。[4]
这里介绍的是使用带有已知类别的例子进行学习的一种方法。机器学习还有其他方式,后面会结合具体任务逐步了解。
规则与从数据中学习也可以配合使用。例如,模型帮助判断图片中的物品,程序则按照明确规则决定结果怎样显示、什么操作必须先确认。现实应用通常需要把多种方法组合起来。[1][6]
1.2.2 从专门任务到更广泛的应用
我们可以专门训练一个模型,让它区分两类物品。这样的模型解决的问题比较明确:输入一张图片,输出一个类别。它并不会因此自动获得写作、计算或操作文件的全部能力。
还有一些模型使用范围更广的材料进行训练,并包含大量可以在训练中调整的数值。人们常用“大模型”称呼这类规模较大的模型。其中,大语言模型主要学习和处理语言中的关联,能够用于解释、改写、概括、翻译等不同任务。[5]
这带来一种容易观察到的变化:在同一个对话窗口中,你可以先请它解释一句话,再比较两种写法,接着讨论怎样安排一次尝试。为了适应新的要求,系统会利用当前提供的问题、材料和前文信息组织回应。[5]
这里要分清两个过程。前面说的训练,是根据数据调整模型。你在一次交流中补充“只有纸和手电筒”,则是提供本次处理所需的信息。仅凭回答随着对话改变,不能判断模型刚刚经历了新的训练。[4][5]
应用还可以把不同能力组合起来。处理图片的功能帮助读取图像信息,语言模型帮助组织说明,工具负责计算、读取或保存。完整应用还需要界面和相应的程序。[6]
因此,同样显示一个对话框,背后能做的事情也可能不同。有的只能进行文字交流,有的能够接收图片,有的能调用工具。使用前要了解手头工具提供了哪些功能,实际结果也要在相应位置查看。
能力范围扩大,给学习和创造提供了更多入口。你可以先用熟悉的语言说明想法,再在帮助下逐步接触绘图、编程或其他方法。本书后面的实践会带你从一段表达走向小作品,再尝试让作品感知环境并作出回应。
这种变化也让我们更需要学习判断:一个建议是否适合实际条件,一项信息是否有依据,一个做法是否值得采用。工具能够提供选择,选择背后的理由仍然值得认真讨论。
联系自己的经验:你接触过的哪种工具只做一类事情?哪种工具可以完成多种任务?试着描述它们接收什么、给出什么,不必急着判断哪一个“更聪明”。
1.3 我们怎样开始与AI相处
1.3.1 带着自己的问题使用AI
接下来,把前面的尝试进一步推进。已经提出自己问题的同学,可以继续围绕原来的问题交流;借用了纸作品示例的同学,可以延续这个想法,也可以选择另一个自己关心的问题。
你可以从一个具体观察出发:同样一件物品,换一个拍摄角度以后为什么很难认出来?也可以从表达需要出发:怎样向没有看过作品的人讲清楚自己做了什么?还可以从想改进的小事出发:怎样让一份说明更容易被第一次使用的人读懂?
选择时,优先考虑自己熟悉、能够找到部分材料、并且可以进行简单核对的问题。涉及危险操作,或者需要专业诊断的问题,先与教师讨论,不作为这次入门练习。
这次练习不要求问题宏大,也不要求做出完整产品。完成一次有来回的交流,找到一项真正有用的推进,并留下自己的判断即可。
先写下问题与已有认识。
在提问之前,用自己的话写一两句话:“我想弄清什么?”“我已经观察到什么,或者尝试过什么?”这份记录可以帮助你在交流以后看出变化。
例如,“帮我设计一个作品”还比较宽泛。你可以补充希望表达的内容、手里的材料、准备给谁看,以及现在最不清楚的一点。此时不需要追求固定格式,先把意思说清楚。
进行交流,再追问一个具体问题。
把自己的问题输入AI工具,读完后,挑一处值得继续的内容。可能是一个你没想到的办法,也可能是一句不明白的解释。
你可以追问:“你说的这一步具体怎么做?”“我只有这些材料,这个办法还适用吗?”“请用我已经学过的知识解释这一点。”这些说法只是起点,关键是回应你实际遇到的疑问。
追问时最好一次处理一个主要问题。这样更容易观察新的信息是否让解释或方案发生了变化。
选一项关键内容,换一种方式检查。
如果回答解释一个事实,回到教材、原始资料或可靠出处核对;如果提出一个做法,检查它是否符合你的材料和操作条件,必要时进行安全的小尝试;如果帮助你修改文字,请实际阅读的人说说哪里清楚、哪里还不明白。
再请同一个AI重复回答,可以帮助进一步讨论,但重复本身不能代替核对。[5] 你需要接触原始材料、实际结果或有关人员,而不仅看它是否说得肯定。
暂时找不到依据时,记下“还没有确认”也很重要。尚未确认的内容,不必为了交作业写成确定答案。
留下一段自己的记录。
把最初的问题、AI提供的一项有用内容、自己怎样检查,以及接下来想继续做什么写下来。附上使用日期和工具名称即可,不必保存全部对话。
可以把这份记录写在笔记本上,也可以保存为“第1章—我的第一个问题”。
如果采用小组方式,每位同学都应留下自己的判断和理由。第12章会请你再次回看这段记录,观察自己最初的问题和认识发生了什么变化。
1.3.2 保留观察、核对与选择的习惯
在与AI交流的过程中,有三种习惯值得逐渐形成。
观察实际发生的事情。
你给了什么信息,系统回应了什么,文件或作品有了什么变化,这些都值得仔细看。回答变长,不一定意味着解决了更多问题;一句很短的追问,也可能帮助你发现自己没有说清楚的条件。
例如,一段作品介绍写得流畅,但别人读完仍然不知道它怎么使用。你可以观察对方停在哪里、提出了什么问题,再决定怎样修改。这时,实际使用者的反应给出了新的信息。
用合适的办法核对。
事实、方案和个人感受,需要不同的判断办法。事实要寻找材料和证据;方案需要考虑条件并查看效果;审美和感受则可以交流理由,允许不同选择。
讨论一个纸作品的名字,可以存在多个好答案。讨论它能否站稳,就需要实际观察。学习区分这些问题,会让你更清楚哪些事情可以继续讨论,哪些事情需要动手或查证。
作出选择,并能够说明理由。
你可以接受AI的建议,也可以改动、暂缓或放弃其中一部分。重要的是知道自己为什么这样处理。理由可以很具体:“这个办法需要我没有的材料。”“这句话与原文不一致。”“我保留这段自己的经历,因为它解释了我为什么做出这个设计。”
有时你也会发现,直接查一本书、用计算器算一下,或者与同学商量,更适合眼前的问题。学会选择工具,也是学习AI的一部分。
使用过程中,还要顾及其他人的信息和感受。优先使用自己整理或允许使用的材料,上传照片前留意是否包含他人的面孔、联系方式或私人内容。需要对外发送、发布或修改公共文件时,应先明确自己的权限和相关人的同意。
同样重要的是,认真对待自己的感受和想法。AI可以提出许多表达方式,但你熟悉的人、亲自看到的细节、实际做过的尝试,能够帮助你判断什么值得写、什么值得做。第2章将从这些具体经验出发,学习把自己的想法说清楚。
本章回望
这一章从一次小小的提问出发,认识了AI参与识别、生成和执行的不同方式,也初步理解了数据、训练与模型的关系。我们看到,完整应用需要模型、程序、工具以及实际使用条件共同发挥作用。
你还完成了一次属于自己的交流。值得保留的不只是AI的回答,还有你怎样补充信息、检查内容,以及作出选择。
屏幕上的建议,为一次尝试提供了起点。接下来的事情,发生在你的阅读、观察、动手和与他人的交流中。
练习与继续探索
1. 说清发生了什么。AI显示“已为你生成介绍卡”,但你只看见一段文字。这时你能够确认什么?要确认介绍卡文件确实完成,还需要看什么?结合本章的识别、生成与执行进行说明。
2. 解释模型怎样形成。一位同学把自己拍的杯子照片交给程序训练。请用自己的话解释训练在做什么,以及为什么还要找另外一些照片检查。暂时不需要写出计算公式。
3. 比较两种判断。给一个纸作品起名字,与判断它能否站稳,各可以怎样检查结果?为什么两件事情可以采用不同的判断办法?
4. 把自己的问题留给以后。回看本章记录,补上一句:“我下一步还想弄清……”保留具体疑问。它可以成为后续实验、创作或小项目的起点。
本章资料来源
以下资料用于核对本章的基本概念与历史事实。
[1] OECD.AI. Updates to the OECD’s definition of an AI system explained. 访问日期:2026-09-20。用于参照AI系统的输入、输出及不同技术方法;正文为适合入门学习的概括性解释。https://oecd.ai/en/wonk/ai-system-definition-update
[2] Dartmouth. Artificial Intelligence (AI) Coined at Dartmouth. 访问日期:2026-09-20。https://home.dartmouth.edu/about/artificial-intelligence-ai-coined-dartmouth
[3] Google for Developers. What is Machine Learning? 访问日期:2026-09-20。https://developers.google.com/machine-learning/intro-to-ml/what-is-ml
[4] Google for Developers. Supervised Learning. 页面更新于2025-08-25,访问日期:2026-09-20。https://developers.google.com/machine-learning/intro-to-ml/supervised
[5] Google for Developers. Introduction to Large Language Models;LLMs: What’s a large language model? 访问日期:2026-09-20。https://developers.google.com/machine-learning/crash-course/llm ;https://developers.google.com/machine-learning/crash-course/llm/transformers
[6] Anthropic. Building effective agents. 原文发表于2024-12-19;访问日期:2026-09-20。用于参照模型、工具与执行结果的关系,未采用其中具体框架版本要求。https://www.anthropic.com/engineering/building-effective-agents
第2章 把自己的想法说清楚
样章 v0.1 | 2026年9月20日
一只纸盒,几句话
一只旧纸盒,可以改成放铅笔和橡皮的桌面收纳盒。要向别人介绍它,你会从哪里说起?
你打开AI对话工具,输入:“帮我写一段收纳盒的介绍。”屏幕上可能出现这样的句子:
这款收纳盒外形美观,结构合理,使用方便,能够让桌面更加整洁。
读完以后,你也许觉得这些话没有明显问题,却又少了些什么。换成另一只收纳盒,这段介绍似乎也能用。
于是,你重新看眼前的东西:原来铅笔和橡皮放在一起,拿橡皮时要先取出几支铅笔。后来,你在盒子里加了一块隔板,把前面的一格做浅一些,用来放橡皮,铅笔则放在后格。
这些小事,正好回答了别人可能关心的问题:你遇到了什么不方便?为什么这样分格?改动以后,有什么不同?
在上一章,我们已经尝试过向AI提问。本章继续向前走:先认真观察,把自己知道的事情说具体;再通过交流、阅读和修改,形成自己愿意采用的表达。
你可以跟随收纳盒的例子理解方法,再选择自己熟悉的一件物品、一次尝试或一个发现来练习。不必专门制作一件新作品。一段值得讲清楚的经历,就是很好的起点。
学完本章,你将能够:区分观察、猜测与意见;说明表达对象、目的和已有材料;理解提示词与上下文的基本含义;与AI共同修改一段文字,并解释自己的选择。
2.1 表达从观察开始
2.1.1 记录具体的人、事物与现象
“我的收纳盒很好用。”这句话表达了感受,但读者还不知道“好用”体现在哪里。
把目光移到使用过程,内容就会具体起来:“以前拿橡皮时,要先取出几支铅笔;现在橡皮放在前面的浅格,可以直接拿出来。”读者能够想象这个动作,也更容易理解改动的用处。
观察可以从一个看得见的动作开始。拿起、寻找、停顿、挪动、重新尝试,这些动作往往比“非常方便”“效果很好”更能帮助我们发现问题。
下面是一段观察记录的示例:
收纳盒由旧纸盒改成。后格放铅笔,前格较浅,放橡皮。原来没有分格时,我拿橡皮需要先取出几支铅笔。加上隔板以后,我请一位同学试用。他伸手就拿起了前格的橡皮。
这段话交代了物品、改动和一次实际动作。它没有把整个制作过程都写下来,却给后面的介绍提供了几项有用材料。
观察也需要选择。纸盒表面的每一条折痕、每一处颜色,不一定都要写入介绍。要解释橡皮为什么好拿,前后格的深浅就很重要;要介绍外观设计,颜色和折痕才可能成为重点。选择哪些细节,与自己想说明的问题有关。
同样的方法也适用于一段经历。写“我们讨论得很热烈”,读者很难知道发生了什么。写“我原来准备把按钮放在右边,同学试了一次,左手伸过去时挡住了屏幕”,就有了可以继续讨论的具体问题。
你已经有了自己的材料吗?先离开对话窗口看一看,或者回想一个清楚的片段,用三五句话记下来。写物品时,可以描述一个部位和一次使用动作;写经历时,可以交代先发生了什么,哪件事使自己的想法改变。
开始时不必追求漂亮的句子。忘记的细节可以再看一次,记不清的原话可以写出大意。不要为了让叙述显得完整,补上一段自己没有经历过的事情。
试着改一句:从自己的记录中找出“很好”“很有意思”或类似的说法。它背后有什么具体的动作或细节?把那个细节补进去,再读一遍。
2.1.2 分清观察、猜测与意见
观察以后,我们自然会解释原因,也会形成自己的看法。把这几种内容分清楚,表达会更准确,后面的讨论也更容易继续。
请看关于同一次试用的三句话:
同学伸手拿起了前格的橡皮。
他很快找到橡皮,可能是因为前格比较浅,橡皮没有被挡住。
我更喜欢现在的分格方式,因为我拿常用的东西时不用再翻找。
第一句记录了看到的动作,属于观察。第二句尝试解释动作的原因,属于猜测。第三句说明个人偏好和理由,属于意见。
观察记录可以通过照片、实物、当时的笔记或有关人员的说明加以核对。记录也可能有遗漏,因此,写清楚是谁、在什么情况下做了什么,有助于别人理解它的范围。
猜测为继续探索提供了方向。前格较浅,确实可能让橡皮更容易被看见;但同学也可能事先知道橡皮放在哪里。要进一步了解原因,可以问问他,也可以请一位没有见过这个盒子的人再试一次。
意见体现了我们重视什么。有人希望桌面尽量简洁,有人更看重物品是否容易找到。两个人可能选择不同的设计,各自的理由都值得听。说明“我更喜欢什么,以及为什么”,比只写“这个设计最好”更容易展开交流。
这三种内容可以出现在同一段文字里。关键是让读者知道,哪些事情已经观察到,哪些是可能的解释,哪些是自己的选择。
还要注意表达的范围。“一位同学这次很快拿到了橡皮”,支持我们介绍这次试用;它还不能说明“所有人都觉得方便”。把“一次”写成“总是”,把“一个人”写成“所有人”,改变的已经是意思。
与AI交流时,也可以把尚未确定的地方直接说出来:“我猜测是前格变浅起了作用,但还没有比较过。”这样既能提供一个思路,也给后面的核查留下位置。
现在回看自己的记录。挑一句观察、一句猜测或意见,看看它们是否容易区分。没有猜测或意见也没有关系,不必为了凑齐类别增加内容。
2.2 让别人和AI理解你的意思
2.2.1 说明对象、目的与已有材料
有了观察记录,下一步就可以考虑怎样把它讲给别人听。
介绍同一只收纳盒,面对第一次看见它的同学,要先说明它是什么、怎样使用;面对也想动手做一个的人,则需要进一步说明隔板的位置和制作方法。读者关心的问题不同,文字需要提供的信息也会不同。
目的同样重要。你希望别人了解一次改动,还是照着说明进行操作?前者需要讲清改动的原因与结果,后者还需要能够依次执行的步骤。
材料则决定了你目前可以具体说些什么。对收纳盒来说,材料包括原来的不方便、改变了哪个部位、一次试用中发生了什么。如果没有测量尺寸,就先不把尺寸写成确定数字。
现在可以把这些内容一起交给AI。下面是一段示例:
我想向第一次看到作品的同学介绍自己的桌面收纳盒,重点讲清楚为什么要分格。
这是我的记录:我用旧纸盒做了一个收纳盒。原来铅笔和橡皮放在一起,拿橡皮要先取出几支铅笔。后来加了一块隔板,后格放铅笔,前格较浅,放橡皮。一位同学试用时,伸手就拿起了前格的橡皮。
请帮我整理成一小段介绍,用第一人称,语言自然。没有记录的尺寸和试用结果不要补写。如果有影响理解的地方,可以先问我。
在与AI交流时,我们输入的问题、要求或指令,常被称为提示词(prompt)。提示词可以是一句话,也可以连同相关材料组成一段较完整的输入。说明目的和要求,有助于模型生成更贴近任务的回答。[1]
这段示例中,真正有用的信息是具体的:读者没有见过作品,介绍要解释分格的原因,已有记录说明了改动和一次试用。你知道这些信息从哪里来,也有办法检查它们有没有被正确使用。
先把这些内容说清楚即可。表达并不需要每次都套用同一种格式。有时候一句补充就足够:“这是写给第一次使用的人看的,请解释一下‘前格’在哪里。”
这里还会遇到一个重要概念。模型生成本次回答时能够参考的问题、要求、相关前文和材料等信息,称为上下文(context)。它不同于模型训练时用过的材料。[2]
可以把它想成桌面上摊开的材料:面前有哪几页,对照时就能参考哪几页。你已经在笔记本里写好的尺寸,若没有提供给AI,它并不会因为这本笔记放在你手边就知道尺寸。
长对话中的前文不一定始终完整保留,工具可能对它们做概括或省略,因此重要要求有时需要重新说明。[2]
语言模型会结合训练中学到的关联和当前上下文组织回答。补充记录可以给它更具体的依据,但不能保证每句话都符合实物。提示词写得清楚以后,仍然需要读懂和检查结果。[3]
也不必把所有想到的事情都塞进去。介绍隔板的改动时,大段无关的活动安排通常没有帮助。先选择与当前问题有关的材料,把要求和材料分开写,自己也会更容易看清有没有矛盾。
继续自己的练习:打开AI对话工具,说明这段文字准备给谁看、希望讲清什么,再附上刚才的观察记录。保存返回的第一稿,接下来还要读一读、改一改。
2.2.2 通过提问和修改逐步澄清想法
你不必在第一次输入时就想清楚全部事情。交流中的追问,常常能帮助我们发现遗漏,也会让原本模糊的想法变得具体。
假如第一稿写了“前浅后深的设计提高了使用便利性”,你觉得有点空,可以接着说:
请把“提高了使用便利性”换成具体的使用动作,让没有见过盒子的人也能明白。
如果回答把两格的位置写反了,可以直接指出:
橡皮放在前面的浅格,铅笔放在后格。请改正这一处,保留其他已经准确的内容。
这两次修改处理的是不同问题。前一次让表达更容易理解,后一次改正信息。知道问题在哪里,才容易提出有用的修改要求。
笼统地说“再好一点”,对方还需要猜测你希望改变什么。可以先找出一句具体的话,说明哪里不合适、希望读者明白什么,再决定怎样修改。你也可以直接动手改,不必每句话都交给AI重新生成。
有时问题出在自己的意思还没有理顺。例如,你原先说“介绍怎样制作收纳盒”,读过草稿才发现,真正想讲的是“我为什么改变了它”。这时,应当先修改任务的目的。仅仅要求把制作步骤写得更生动,仍然无法得到自己需要的介绍。
还可以让AI先提一个问题,帮助自己继续观察:
我还没有想好怎样描述这次改动。请根据我的记录,问一个有助于读者理解的问题,我回答后再继续整理。
下面是一段示例:
AI:没有分格的时候,拿橡皮具体要多做什么动作?
我:要先取出几支铅笔,才能把橡皮拿出来。分格以后就不用先拿铅笔了。
这个问题把注意力引向了改动前后的差别。你补充的回答也有了明确用途:帮助读者理解为什么增加那块隔板。
如果AI问的是尚未测量的尺寸,就按实际情况回答“还没有测量”。然后判断:尺寸是否影响这次介绍?只是讲改动经历,可以暂时不写;要让别人照着制作,就需要补上有关尺寸。收到追问以后,仍然要判断哪些事情值得继续做。
再看看自己的第一稿,选择一处真正需要处理的问题。它可能是事实不准确,也可能是读者看不懂,或者没有表达自己最想说的内容。修改后,把前后两句话放在一起读,指出具体改变。
第一稿已经合适的部分可以保留。修改有没有价值,要看它帮助解决了什么问题,不必为了增加轮次而反复重写。
想一想:这次交流中,你只是把同一个意思说得更清楚了,还是发现自己原先想说的事情也需要调整?试着说明其中一次变化。
2.3 阅读回答,形成自己的表达
2.3.1 判断内容是否准确、清楚、有根据
AI给出一段通顺的文字以后,阅读并没有结束。接下来需要带着自己的材料和目的,逐句看看它说了什么。
先核对具体信息。名称、材料、位置、数量、时间,以及某个人说过的话,都应当与现有记录相符。提到某种效果时,还要看记录是否足以支持这个说法。
下面是一段待修改的示例:
这款收纳盒采用防水材料制作,所有同学都能立即找到需要的文具。前浅后深的结构,让它成为最适合学生的桌面用品。
回到前面的记录,可以发现几个问题:“旧纸盒”没有提供防水性能的依据;记录只有一位同学的一次试用;前格放橡皮、后格放铅笔,也不足以证明它“最适合学生”。
其中有些内容可以删去,有些则需要换成范围恰当的表述。例如,把“所有同学都能立即找到需要的文具”改为“试用时,一位同学直接拿起了前格的橡皮”,读者就能知道实际依据是什么。
对于已经清楚的事实,可以直接说清;对于没有依据的效果,不要写成已经发生。个人感受则可以保留,并说明是谁的感受和相应理由。
接着检查是否容易理解。请比较:
我对它进行了调整,因此使用起来更方便。
我在盒子里加了一块隔板,把橡皮放进前面的浅格。取橡皮时,就不用先拿出铅笔了。
第二段说明了调整的位置、做法和一个具体变化。即使读者没有见过作品,也能大致理解。检查自己的文字时,可以特别留意“它”“这样”“更好”等词:读者能否找到它们具体指什么?
还可以把文字读给一个没有看过作品的人听,请他用自己的话说说:“原来有什么问题?后来改了什么?”他复述不清的地方,往往值得再解释。听到不同理解时,先问清楚他是从哪句话这样理解的,再决定怎样改。
最后回到目的。介绍分格的原因,就应当让这条线索容易找到。颜色、名称和装饰可以增加趣味,但如果它们挤掉了最重要的改动过程,就需要重新取舍。
现在读自己的修改稿。找出一处与记录对应的事实、一处帮助读者理解的细节,以及一处表达个人感受的地方。需要改的就改,已经清楚的就保留。
2.3.2 保留自己的经验与选择
经过整理,收纳盒的介绍可以写成这样:
我用旧纸盒做了一个桌面收纳盒。起初,橡皮夹在铅笔之间,拿它时要先取出几支铅笔。后来,我加了一块隔板,让铅笔留在后格,橡皮放进前面的浅格。请同学试用时,他伸手就拿起了橡皮。我保留了这个改动:取一样东西时,可以少挪动几样东西。
这段话交代了困难、改动和一次反馈。你也可以采用别的顺序,例如先写同学取橡皮的动作,再回头解释为什么这样设计。不同写法会使读者先注意到不同内容。
选择顺序时,可以问自己:这段文字中,我最希望别人记住什么?是旧物被再次利用,是一个细节带来的变化,还是自己怎样发现了问题?想清楚这一点,就有了取舍的方向。
个人感受也有位置。“看着橡皮终于有了自己的小格,我很满意。”这句话并不提供新的尺寸或性能信息,却表达了制作过程中的心情。只要它符合自己的感受,就可以成为介绍的一部分。
保留经验,并不意味着拒绝修改。AI可能帮助你发现重复,把一段话的顺序整理得更好,或者提出一个你没有想到的角度。你可以采用这些帮助,同时判断它们是否准确表达了自己经历过的事情。
同样,一句自己很喜欢的话,也可能让别人难以理解。你可以解释它,调整它,或者在与读者交流之后决定删去。自己的表达是在这样的选择中逐渐形成的。
写真实经历时,让细节有出处;写想象中的故事时,可以创造人物和情节,并让读者知道这是创作。本章练习介绍熟悉的物品或经历,重点是把已有的观察讲清楚。后面学习创作时,我们还会探索更丰富的表达方式。
现在完成自己的这一小段文字。可以保留AI提出的好句子,也可以主要采用自己的写法。再补上一句修改说明,例如:“我把‘大家都觉得好用’改成了一位同学的实际动作,因为我只记录了这一次试用。”
留下最初的记录、完成的文字和这一句理由就够了。三者放在一起,你能看到材料怎样进入表达,也能看到自己作出了什么选择。
进一步试一试:保持事实不变,把读者换成一个没有接触过这类物品的人。最需要解释哪个词或哪一个动作?只修改相关部分,看看说明是否更清楚。
本章回望
本章从一只普通的纸盒出发,学习怎样把观察变成材料,把材料整理成别人能够理解的表达。
在与AI交流时,提示词说明我们要做什么,上下文提供本次回答能够参考的信息。读到回答以后,我们还要核对事实、补充解释,并决定哪些内容值得保留。
表达也会使想法发生变化。原先只觉得“这个盒子好用”,写下来以后,才逐渐发现自己在意的是一个小动作:取一样东西时,能不能少挪动几样东西。
留心这样的细节,认真对待自己的疑问,再借助AI继续探索。下一章,我们将换一个角度,研究机器怎样从例子中学习。
练习与继续探索
1. 分清三种说法。“同学在说明牌前停下,问了一句‘从哪里开始?’”“他可能没有找到第一步”“我建议把第一步放在最上面”,分别侧重观察、猜测还是意见?还可以怎样了解同学停下的原因?
2. 给一句话补上材料。有人向AI输入“帮我写得更好”。请选择自己的一段文字,说明准备给谁看、当前哪里不清楚,以及已有的事实。写出一次具体的修改请求,不要求使用固定格式。
3. 比较修改是否改变了事实。原记录是“今天请两位同学试用了纸盒,一位认为前格方便,另一位希望格子更宽”。改写后变成“同学们一致认为设计合理”。这句话有哪些变化?请改成与原记录相符的一段话。
4. 找回一条有用的细节。从自己的观察中挑一个原先没有留意的动作或变化。它是否让你想到一个值得改进的问题?用一两句话写下来,后面的项目可以从这里开始。
本章资料来源
[1] Google AI for Developers. Prompt design strategies. 访问日期:2026-09-20。用于核对提示词、任务要求与相关材料的基本说明。https://ai.google.dev/gemini-api/docs/prompting-strategies
[2] Anthropic. Context windows. Claude Platform Docs. 访问日期:2026-09-20。用于核对上下文的含义及长对话中材料可能被概括或省略的情况。https://platform.claude.com/docs/en/build-with-claude/context-windows
[3] Google for Developers. LLMs: What’s a large language model? 访问日期:2026-09-20。用于核对语言模型利用训练中学到的关联与当前输入生成内容的基本解释。https://developers.google.com/machine-learning/crash-course/llm/transformers
第二单元 理解AI:数据、感知、生成与证据
第3章 机器怎样从数据中学习
样章 v0.1 | 2026年9月20日
桌面换了,杯子还是那个杯子
把一只杯子放在桌上,你很容易认出它。将它转过来,把杯把藏到背面,或者在下面垫一张深色的纸,你大概仍然知道这是同一只杯子。
如果让计算机来认,它会根据什么作出判断?是杯口的形状,是杯身的颜色,还是照片中某个我们没有留意的地方?
你可以试着写一句规则:“有把手的是杯子。”但有的杯子没有把手,有时把手正好被挡住。继续补写规则,会遇到更多不同的情况。
还有一种做法:准备一些杯子的照片,也准备一些橡皮的照片,分别告诉计算机它们属于哪一类,再让程序根据这些例子调整模型。调整完成后,给它一张新的照片,看看它怎样判断。
这一次,我们既要准备例子,也要研究例子怎样变成识别的依据。最后再换一张桌面背景,问同一个问题:杯子还是那个杯子,模型的回答有没有变化?
上一章,我们学习了认真观察、把材料说清楚。本章继续使用这些方法,只是材料变成了照片。你选择拍什么、怎样拍,会影响模型接触到哪些信息。
学完本章,你将能够:说明样本、标签和模型的关系;通过简单计算理解参数怎样影响结果;完成一次两类物品的图像分类训练;用新照片检查模型,并解释一次观察。
3.1 从例子中寻找规律
3.1.1 给程序写规则与给模型提供样本
假如要把一组已经记录好重量的物品分成两组,要求是“不超过100克放在甲组,其余放在乙组”,程序照着这个条件比较就能完成。规则明确,结果也容易检查。
认照片中的杯子要复杂一些。拍摄角度一变,杯口看起来可能从圆形变成椭圆形;距离一变,杯子在画面中的大小也会变化。颜色、阴影和遮挡还会带来更多差别。
要为这些情况逐一写出判断条件,需要先找出适用的规律。机器学习(machine learning)提供了一种办法:通过数据和训练,让模型形成完成某项任务所需的计算关系。本章学习的,就是利用已经标明类别的图片来训练模型。[1]
这两种做法可以放在一起理解:
依据规则判断:人写好判断条件,程序接收图片中提取的信息,按条件给出结果。
依据样本学习:人准备图片和对应类别,训练程序据此调整模型;调整完成后,模型接收新图片,计算它更接近哪一类。
后一种做法仍然需要人设计程序、选择材料和检查效果。变化在于,许多具体的判断依据由训练过程从数据中形成,人不必事先把每一种杯子的样子都写成规则。
这也让数据的选择变得重要。假如提供的照片里,杯子总在画面左边,橡皮总在右边,位置就可能与类别一起影响训练。我们希望模型识别物品,但照片还记录了背景、位置、光线等许多信息。
学习方法也有适合的范围。对“是否超过100克”这样确定的问题,直接比较数值就很清楚。对外观变化较多的图片,学习数据中的规律往往更有帮助。选择方法时,先看问题需要处理什么信息、判断条件是否已经明确。
本章先完成一个小任务:每次给模型看一张图片,图片中只有杯子或橡皮中的一种,让它选择类别。这类任务称为分类。给出物体在图片中的具体位置,是另一个问题,我们将在下一章继续研究。
先想一想:为杯子和橡皮各写出一个容易观察的特点。这个特点在物品转动、离镜头远近变化以后,还一定成立吗?
3.1.2 数据、标签与模型
准备一只杯子、一块普通的橡皮,以及两张颜色不同的纸。纸用来改变桌面背景。使用能够拍摄图片的设备和图像分类训练工具,就可以开始。Teachable Machine的图像项目是一种可选工具,也可以使用具有采集图片、训练和预览功能的同类工具。[2]
先选一张纸铺在桌面上。把杯子放好,拍一张照片。在这个任务中,这张照片就是一个样本。给它标上“杯子”,这个类别名称就是标签。拍摄橡皮时,相应标签就是“橡皮”。
把许多这样的照片和标签放在一起,就形成了这次训练使用的数据集。照片提供输入信息,标签告诉训练程序:我们希望这张图片得到什么分类结果。[1]
在训练工具中建立“杯子”和“橡皮”两个类别。先分别采集约20张图片,作为第一轮尝试的起点。可以直接用摄像头采集,也可以导入已经拍好的照片。
每拍几张,就把物品转动一点,或适当改变它的位置。两类物品都使用刚才选定的背景,都尝试几个角度。尽量让物品完整、清楚地出现在画面中;放好后移开手,再采集图片。
先不用追求很多照片。重要的是看看这些照片提供了哪些不同的信息。同一个姿势连续拍20张,与从几个角度拍20张,覆盖的情况并不一样。这里的数量便于开始实验,不能保证任何物品都能得到理想结果。
采集完成后,浏览两个类别中的图片。有没有把橡皮照片放进杯子一类?有没有某张照片同时出现两种物品,让标签变得含糊?把这类问题改正,再开始训练。标签是训练所依据的答案,填错以后,程序也会受到错误信息的影响。
此时,我们已经有了数据和标签。那么,模型是什么?可以先把它理解为一套把输入信息转换成结果的计算方法,其中有一些可以调整的数值。训练会改变这些数值,使模型在所提供的样本上更接近相应标签。[1]
训练后的模型接收一张照片,能够为“杯子”和“橡皮”分别计算一个分数,再据此选择类别。它怎样调整数值,正是下一节要研究的问题。
现在把采集好的图片作为训练材料。后面检查效果时,我们会另外拍摄新照片,先不把检查用的图片加入训练。这样才能看看模型面对新材料时的表现。
3.2 模型怎样逐步改进
3.2.1 比较结果并调整参数
照片本身不会直接变成一句“这是杯子”。计算机要把图片中的信息表示成数字,再按模型的计算方法得到结果。模型中可以调整、并会影响输出的数值,称为参数。
先用一个可以手算的小例子,看清参数的作用。假设我们只看物体在照片中的高宽比,用“高度÷宽度”得到一个数。例如,高度是宽度的1.2倍,高宽比就是1.2。
下面四组数据用于演算。
| 图片编号 | 高宽比 | 已知标签 |
|---|---|---|
| 甲 | 0.5 | 橡皮 |
| 乙 | 0.8 | 橡皮 |
| 丙 | 1.2 | 杯子 |
| 丁 | 1.6 | 杯子 |
我们暂时采用这样的计算方法:高宽比达到某个分界值,就判为杯子;低于它,就判为橡皮。这里可以调整的参数,就是这个分界值。
先把分界值设为0.7。甲的0.5低于0.7,判为橡皮,正确;乙的0.8高于0.7,判为杯子,与标签不符。丙、丁也被判为杯子,与标签一致。这次共有一张图片分错。
把分界值改成1.0,再算一次。甲、乙都低于1.0,丙、丁都达到1.0,四张图片的判断便与标签一致。
这里发生了三个动作:先计算结果,再与标签比较,随后调整参数。分界值的改变,使同一组输入得到了不同结果。这里由我们演算,也可以让程序比较若干个分界值,选出分错较少的一项。它先利用带标签的数据进行比较,再确定参数,这就构成了一种简单的学习过程。
分界值可以继续增大吗?试着把它改成1.4。你会发现,丙又被分错了。参数的数值越大,并不代表模型越好;需要看它对整组样本产生了什么影响。
这个例子可以用分错的张数来比较结果。实际训练通常会用一个数表示预测结果与标签之间的差别,这个数称为损失(loss)。不同任务可以采用不同的计算方式,训练的目标是尽量减小这种差别。[3]
在神经网络的图像分类训练中,程序通常还会比较各类别的预测分数。即使最后选对了类别,分数与目标之间仍可能有可调整的差别。程序利用损失的变化,计算参数向哪些方向作小幅调整更有帮助,再反复进行计算和更新。[3]
回到桌面的实验。现在选择训练功能,先保留工具的默认设置。训练程序会使用已经提供的图片和标签,调整参与本次训练的参数。完成后,进入预览,把杯子和橡皮分别放到画面中,看看输出是否跟随物品变化。
这时看到的是模型的一次实际运行。接下来还需要专门用新照片检查,暂时不用凭这几次预览给模型下结论。
刚才的高宽比计算,只是帮助我们看清一个参数怎样改变结果。真实的杯子和橡皮有更多外形,单独使用高宽比很难充分区分。图像模型会组合许多信息,下面再看其中一种常用结构。
3.2.2 神经网络怎样组合简单的计算
高宽比把一张图片中的信息压缩成一个数。真实图片还包含颜色变化、边缘、纹理,以及各部分的位置关系。为了利用更多信息,模型需要组织更多计算。
神经网络(neural network)把许多计算单元连接起来。前面的单元得到一些数值,后面的单元继续处理这些结果,最后形成输出。先看一个计算单元,就能理解其中一部分工作。[4]
沿用刚才的高宽比,把它记作x。一个用于演算的单元先做下面这步计算:
计算结果=2 × x - 1
这里的2控制输入变化对结果的影响,称为权重;-1让整个计算结果向下移动,称为偏置。二者都是参数。对这个单元来说,输入变化时,结果会变化;输入不变而参数变化时,结果也可能变化。[4]
当x=0.8时,计算结果是2×0.8-1=0.6。若把权重从2改成3,结果就变成3×0.8-1=1.4。你可以看到,参数怎样参与了计算。
继续使用权重2和偏置-1。许多神经网络单元还会对计算结果作一次变换:负数变成0,正数或0保持原值。这样,x=0.8时输出0.6;x=0.4时,先算出-0.2,最后输出0。这种数值变换由激活函数完成。[4]
把刚才得到的0.6交给下一个单元。假设这个单元先算“3×输入值-0.5”,再把负数变为0,就会得到3×0.6-0.5=1.3。前一个单元的输出,成为后一个单元的输入;后面还可以继续接着计算。
为什么要加上把负数变为0这类变换?假如很多层都只是把输入乘上固定的数,再加上另一个数,它们合在一起仍能化成同一类简单计算。加入这样的变换以后,整个网络就能够表示更复杂的关系。[4]
真实的计算单元通常会接收多个数,将它们分别乘上权重后相加,再加上偏置并进行变换。许多单元使用不同参数处理输入,将结果传给下一层。一个单元的计算并不复杂,多层组合后就有了处理更复杂信息的可能。
在图像网络中,有些前面的计算能够对局部明暗变化或边缘产生不同响应;后面的计算继续组合这些信息。具体利用了哪些信息,还需要通过分析和实验来了解。不能仅凭最终输出“杯子”,就认定某一个单元专门负责识别杯把。[5]
训练时,程序把网络最终的输出与标签比较,再据此调整参与训练的权重和偏置。我们刚才手动改动一个数,网络训练则由程序处理许多参数。小例子帮助我们看清计算,实际模型需要更多数据和计算来形成有用的结果。[3][4]
你也许还会问:刚才只有几十张照片,为什么就能训练一个图像模型?
一种常见做法是先使用已经在大量图片上训练过的网络,利用它提取图像中的信息,再用我们提供的样本训练后面的分类部分。这种借用已有学习成果来完成新任务的方法,称为迁移学习(transfer learning)。[5]
采用这种方式时,杯子和橡皮的照片主要用于学习本次分类所需要的区别;模型处理图像的部分能力来自此前的训练。因此,少量照片就能开始一次练习,并不说明仅凭这些照片就能从头形成全面的图像识别能力。
现在区分两个过程:训练时,程序依据图片和标签调整参数;预览时,程序使用当前参数处理新画面。在本章采用的操作方式中,连续给它看更多画面,并不会自动再次训练模型。
上一章向AI补充一段文字,是给本次回答增加可以参考的材料。本章专门执行训练,则会改变参与训练的参数。这两个过程都使用了信息,改变模型行为的方式有所不同。
动手算一算:沿用“2×x-1,负数变为0”的单元,当x=1.2时,输出是多少?再把偏置由-1改成-2,保持x不变,输出又是多少?说说究竟是哪一项变化影响了结果。
3.3 怎样知道模型学得如何
3.3.1 用不同材料进行训练与测试
四张演算图片都分对了,能说明那个分界值适合所有杯子和橡皮吗?还需要看看其他图片。真正训练出的图像模型也面临同样的问题。
用于调整模型的材料称为训练集。专门留出来、用于检查模型面对新材料时表现的材料称为测试集。测试时,我们知道图片的类别,但先只把图片交给模型,再用已知类别核对它的回答。[6]
就像检查自己是否理解了一种解题方法,做过的原题可以帮助回顾,换一道题才能了解是否会运用。在模型训练中,训练材料上的表现与新材料上的表现也需要分别观察。
现在保持模型不变,使用原来的背景,为杯子和橡皮各拍5张新照片。这些照片不加入训练类别,只送入预览或预测功能。可以重新摆放物品、变换少量角度,让照片与训练时有所不同。
这里的“新”不只是换一个文件名。从训练录像中紧挨着截出的两帧,画面往往很相近。重新摆放、重新拍摄,能让检查更有意义。若只使用同一只杯子和同一块橡皮,得到的结论也先限定在这两件物品及本次拍摄条件内。
逐张查看模型选出的类别,与实际物品对照。可以直接把结果记成“杯子,5张中判对几张;橡皮,5张中判对几张”。选择预测分数较高的一类作为答案;若两类分数并列最高,这次记为未正确分出。
下面是一组计算示例:杯子的5张照片判对4张,橡皮的5张照片判对5张,一共判对9张。准确率表示判断正确的数量占总数量的比例:[7]
准确率=判断正确的图片数÷测试图片总数×100%
9÷10×100%=90%
这个90%说明模型在这10张图片上的表现。测试数量很少,换一组图片还可能不同。阅读结果时,把“检查了什么”和“判对多少”放在一起,比只记一个百分数更有用。
预览中还可能显示“杯子90%,橡皮10%”。这是模型对当前这一张图片给出的类别分数,与刚才数出“10张中判对9张”不同。前者是预测时算出的数,后者来自与实际标签逐一核对。模型显示很高的分数,也仍然可能判断错误。[8]
如果训练时已经显示了很好的结果,但新照片经常分错,就需要继续检查。模型过分贴合训练材料中的细节,却不能很好处理新材料,这种情况称为过拟合。训练时间更长,并不保证新图片上的结果更好。[9]
不过,只看到一次错误,还不足以断定原因就是过拟合。先回到图片:是否模糊,是否放错标签,拍摄条件是否有较大变化?上一章区分观察与猜测的方法,在这里依然适用。
现在完成第一组检查:记下两类物品各自判对的数量,保留一张你想进一步研究的照片。它可以是判断错误的一张,也可以是在新角度下仍然判断正确的一张。
3.3.2 换一种条件,结果会怎样变化
第一组检查之后,换上另一张颜色明显不同的纸。仍然使用同一只杯子、同一块橡皮和同一个模型,尽量保持光线、拍摄距离和物品摆放方式与刚才接近,再为每类物品各拍5张新照片。
这次主要改变背景,让两组结果比较起来更容易理解。若同时换物品、换房间、换镜头,即使结果不同,也很难判断主要与哪项变化有关。
在训练工具中仍然只使用预览或预测功能,把这一组照片逐张送入模型。不要在两组检查之间重新训练,否则比较的就同时包含模型变化。
可以把实际结果放在一张小表中:
| 检查条件 | 杯子判对数 | 橡皮判对数 | 合计判对数 |
|---|---|---|---|
| 原来的背景,新拍照片 | ____ / 5 | ____ / 5 | ____ / 10 |
| 更换背景,新拍照片 | ____ / 5 | ____ / 5 | ____ / 10 |
如果更换背景后结果变差,一个值得继续检查的猜测是:背景变化影响了识别。它还不能单独证明模型主要依靠背景作出判断,因为拍摄时的阴影、曝光或物品位置也可能有变化。可以挑选一件物品,在两种背景之间来回比较几次,观察影响是否反复出现。
如果两组都判断得很好,也有清楚的收获:在这次选择的背景和样本中,模型保持了较好的表现。记录实际结果,再考虑还有哪一种条件值得检查。没有必要刻意把照片弄得无法辨认,去寻找一个必然出错的例子。
如果换背景以后反而更好,也值得观察。新的背景可能让物品轮廓更清楚,也可能只是这一组照片更容易识别。先描述变化,再提出可能的解释。
模型在没有参与训练的新材料上仍能作出有效判断的能力,称为泛化能力。不同的新材料检查不同的方面:换背景,观察对环境变化的适应;换一只不同颜色的杯子,观察是否能处理同一类别的新物品。一次检查提供的是其中一部分信息。[6][9]
本章的基本实验做到这里,就可以回到起初的问题:桌面换了,模型的回答有没有变化?用刚才的记录回答,再说明一项你能够支持的判断和一项还想继续了解的事情。
还可以怎样改进?
如果某类图片经常分错,先查看这一类的训练材料是否清楚、标签是否正确,是否缺少实际使用时会遇到的角度和背景。若两类物品分别只在不同背景上出现,可以让两类都在这些背景上出现,减少背景与类别固定相伴的情况。
补充数据时,想清楚新照片要增加什么信息。原来的照片复制十遍,文件数量增加了,新的情境却没有增加。把缺少的角度、光线或物品形态补进去,更有机会帮助我们检验原来的猜测。
需要继续尝试时,再修改训练材料、重新训练。已经用来分析问题的测试照片,可以继续帮助观察改动前后的差别;要了解改进后的模型处理新材料的能力,还应另外准备没有参与训练和改进选择的新照片。[6]
两组小实验不能回答所有问题,却能改变我们看模型的方式。看到一次正确识别时,会进一步问它经历了哪些训练、还需要检查什么;看到一次错误时,也能从材料和实际条件出发寻找原因。
你可以用三句话收束这次探索:我提供了什么样的训练材料;换成新照片以后实际出现了什么;根据这些结果,我准备保留或改变什么。让观察和理由留在一起,下一次尝试就有了起点。
本章回望
本章从杯子和橡皮的照片出发,研究机器怎样从数据中学习。图片和标签提供训练依据;模型中的参数参与计算;训练程序比较预测结果与标签,逐步调整参数;新照片则帮助我们检查模型面对变化时的表现。
一个分界值,就能够改变简单分类的结果。神经网络把许多带有参数的计算单元组合起来,再通过训练形成更复杂的处理能力。借用已有模型的学习成果,也可以让一个小实验从少量材料开始。
我们同时看到,数据总是在某些条件下采集的。一张照片包含物品,也包含拍摄位置、背景和光线。我们选择了哪些例子,遗漏了哪些情形,会影响模型能够学习和接受检验的范围。
上一章要求我们把观察写具体。本章又向前走了一步:把材料准备好,让一个判断接受实际检查,再用结果修改自己的理解。
下一章,我们将走近这些输入信息,看看图像和声音怎样进入计算机,以及模型怎样利用它们。
练习与继续探索
1. 用一张照片解释三个词。从本章训练材料中选一张照片,说明它作为样本提供了什么,标签写的是什么,训练后的模型要根据新图片输出什么。
2. 改一个数,再检查。对3.2.1中的四组演算数据,把分界值分别设为0.9和1.3,各会分错几张?如果新出现一只高宽比为0.7的矮杯子,原来的高宽比方法可能遇到什么困难?
3. 判断材料是否真的更新。一位同学把训练照片复制出来,改了文件名,作为测试照片。他得到全部正确的结果。这说明了什么,又没有说明什么?怎样重新安排一次检查?
4. 区分预测分数与实际表现。某张图片显示“杯子95%”,另一份记录写着“20张测试图片中判对19张”。这两个95%分别怎样得到?为什么不能相互替代?
5. 为下一次尝试选材料。一个分类器在正面照片上表现较好,在侧面照片上表现较差。现在只能增加10张训练图片,你准备怎样拍?说明希望补充哪些信息,再设计一次能够检查效果的小尝试。可以借助AI整理计划,最终以实际拍摄和测试结果作判断。
本章资料来源
[1] Google for Developers. Supervised Learning. 用于核对样本、标签、模型、训练与预测的基本关系。访问日期:2026-09-20。https://developers.google.com/machine-learning/intro-to-ml/supervised
[2] Google. Teachable Machine 2.0 makes AI easier for everyone. 2019-11-07。用于核对图像采集、训练与预览的基本流程;工具入口:https://teachablemachine.withgoogle.com/ 。访问日期:2026-09-20。https://blog.google/innovation-and-ai/products/teachable-machine/
[3] Google for Developers. Linear regression: Loss;Linear regression: Gradient descent. 用于核对损失、参数调整与训练过程的基本说明。访问日期:2026-09-20。https://developers.google.com/machine-learning/crash-course/linear-regression/loss ;https://developers.google.com/machine-learning/crash-course/linear-regression/gradient-descent
[4] Google for Developers. Neural networks: Nodes and hidden layers;Neural networks: Activation functions. 用于核对权重、偏置、计算单元和激活函数的解释。访问日期:2026-09-20。https://developers.google.com/machine-learning/crash-course/neural-networks/nodes-hidden-layers ;https://developers.google.com/machine-learning/crash-course/neural-networks/activation-functions
[5] TensorFlow. Transfer learning and fine-tuning. 用于核对利用预训练网络提取图像信息、再训练分类部分的方法。访问日期:2026-09-20。https://www.tensorflow.org/tutorials/images/transfer_learning
[6] Google for Developers. Datasets: Dividing the original dataset. 用于核对训练与测试材料的分离、重复材料及反复使用测试结果的问题。访问日期:2026-09-20。https://developers.google.com/machine-learning/crash-course/overfitting/dividing-datasets
[7] Google for Developers. Classification: Accuracy, recall, precision, and related metrics. 用于核对分类准确率的含义。访问日期:2026-09-20。https://developers.google.com/machine-learning/crash-course/classification/accuracy-precision-recall
[8] GUO C, PLEISS G, SUN Y, et al. On Calibration of Modern Neural Networks. Proceedings of Machine Learning Research, 2017, 70: 1321–1330. 用于核对模型预测分数不自动等于实际正确比例的说明。访问日期:2026-09-20。https://proceedings.mlr.press/v70/guo17a.html
[9] Google for Developers. Overfitting. 用于核对过拟合与泛化的基本解释。访问日期:2026-09-20。https://developers.google.com/machine-learning/crash-course/overfitting/overfitting
第4章 让AI看见和听见
样章 v0.1 | 2026年9月20日
一张照片,一声轻响
还是上一章的那只杯子。把它放在桌上,拍一张照片。照片中可以看见杯口、杯身和桌上的影子。刚才杯底碰到桌面时发出的轻响,却没有留在这张照片里。
再录下一段轻敲桌面的声音。只听录音,你能知道桌子是什么颜色,杯子放在左边还是右边吗?
我们在现场时,会很自然地把看到的、听到的和已有经验联系起来。离开现场,只拿到一张照片或一段录音,能够知道的事情就发生了变化。有些细节变得清楚,有些信息仍然缺少。
AI处理的也是这些被记录下来的材料。上一章,我们用照片训练模型,观察它怎样区分杯子和橡皮。本章再往前追问一步:照片怎样成为数字?声音怎样进入计算机?把不同材料放在一起以后,又能多知道些什么?
本章继续使用上一章的图片完成一次比较。声音部分通过短录音和示例理解基本方法,不需要再训练一套新的模型。
学完本章,你将能够:用简单数字解释图像与声音的记录方式;区分图像分类与目标检测、声音分类与语音识别;比较一次输入变化带来的结果;说明多种信息怎样互相补充,以及哪些问题仍需进一步了解。
4.1 图像怎样成为可以处理的信息
4.1.1 像素、颜色与图像中的特征
打开一张杯子的照片,放大杯口附近的一小块区域。图像由按行、列排列的许多小点组成,每个位置都有相应的颜色数值。这样一个图像单元,称为像素(pixel)。它在屏幕上占多大,与显示时的缩放有关。[1]
一张宽640像素、高480像素的图片,共有640×480=307 200个像素。这里说的是横向和纵向记录了多少个位置。把同一张图片在屏幕上放大,显示面积会增加,原先没有记录下来的细节却不会因此自动出现。
计算机怎样记录颜色?一种常见方法是分别记录红、绿、蓝三个颜色分量,英文名称为red、green、blue,合称RGB。把三个分量按顺序写在一起,就能表示一个像素的颜色。[1]
以每个分量取0到255的整数这一常见表示方式为例,(255,0,0)表示红色,(0,0,255)表示蓝色,(0,0,0)表示黑色,(255,255,255)表示白色。其他组合可以表示更多颜色。这里的数值范围对应这种具体的记录方式,图像还可以采用其他表示方法。
只表示明暗的图像称为灰度图。在常见的0到255的灰度表示中,0表示黑,255表示白,中间的数值表示不同深浅的灰。于是,杯子的照片就可以变成一张按位置排列的数值表。每个位置的数值不同,整张图就呈现出明暗变化。[1]
从几个数看见一条边
下面是一行用于演算的灰度数值。把它们想成照片中从左向右相邻的六个像素。
| 像素位置 | 1 | 2 | 3 | 4 | 5 | 6 |
|---|---|---|---|---|---|---|
| 灰度值 | 30 | 32 | 31 | 220 | 222 | 219 |
前三个数比较接近,后三个数也比较接近。第3个像素与第4个像素之间,却从31变成220,差了189。其余相邻位置的差别都很小。
如果用后一个数减去前一个数,再只看差值的大小,就得到2、1、189、2、3。计算机通过这种比较,可以找出局部明暗变化明显的位置。这个例子中,最值得关注的就是第3与第4个像素之间。[2]
在照片里,这样的变化可能出现在杯子与桌面的交界处,也可能来自阴影或杯身上的图案。所以,找到明暗变化只是获得一条线索,尚不能直接判断“这是杯子的边”。
图像中的颜色分布、边缘变化、纹理和位置关系,都可以成为识别所利用的信息。对任务有用的这些信息,通常称为特征。第三章用高宽比作简单分类,高宽比就是我们选出的一个特征。真实图像模型可以利用更丰富的数值组合。[2]
有一类图像神经网络会用同一组参数,反复处理图片不同位置的小片区域,再将得到的结果交给后面的计算。这使网络能够在不同位置寻找某些局部变化,并进一步组合这些信息。训练会调整其中的参数,使它们更适合所学的任务。[2]
刚才计算相邻像素的差值,是一个容易看清的例子。真实模型的计算更加丰富,不能把它理解为“先找到杯子的完整轮廓,再按人的思路认出杯子”。我们能够观察输入和输出,也可以进一步研究模型利用的信息。
回到杯子照片。把杯子移到较暗的地方,像素中的数值会跟着变化;让杯把被挡住,一部分形状信息就不再出现在画面里。上一章看见的识别变化,正是从这些输入差别开始的。
动手算一算:另一行灰度值为40、42、41、43、44、42。按刚才的方法计算相邻差值。与前一组相比,这一行有没有同样明显的明暗交界?只根据这六个数,你能确定它们来自什么物品吗?
4.1.2 识别物体与确定物体的位置
上一章的模型回答的是:“这张图片更接近杯子,还是橡皮?”它给整张输入图片选择类别。这是图像分类的一种用法。
现在把杯子和橡皮同时放在桌面上。我们可能要问:“图片里有哪些物品?每件物品在哪里?”这时,只给整张图选择一个类别就不够了。
目标检测(object detection)同时处理物体类别与图像中的位置。常见的输出方式是在物体周围画一个矩形,标出类别和预测分数。这个矩形称为检测框。[3]
例如,一张图里有两只杯子,检测工具可能分别给出两个框,并各自标注“杯子”。这些框表示模型给出的候选位置;是否框到了物体、有没有遗漏,仍然可以与图片对照检查。
位置也需要用数字表示。可以把图像左上角作为起点,向右记录横向位置,向下记录纵向位置。在一张640×480像素的图像中,假设某个框的左上角为(80,60),右下角为(240,300),就能算出:
框的宽度=240-80=160像素
框的高度=300-60=240像素
这些数说明框在图片中的位置和大小。它们还不能直接告诉我们杯子的实际高度,也不能直接换算成杯子离摄像头多少厘米。那需要额外的测量条件或信息。
训练检测模型时,通常需要在学习材料中标明物体的类别和位置;不同方法对标注的要求有所不同。上一章只提供“杯子”“橡皮”类别的两类分类器,不会因为我们输入“请把杯子框出来”,就自动获得目标检测功能。选择工具时,需要看它实际支持的输入和输出。[3]
具有看图能力的对话工具,可能同时提供描述、问答或定位等功能,但也应通过实际结果了解它能做到哪一步。“能说出图中有杯子”与“能稳定地给出每只杯子的准确位置”,仍然是不同的要求。[9]
做一次比较:照片变成灰度图以后
现在继续使用第3章的分类器。这次不增加识别功能,只研究同一张照片换一种表示以后,分类结果是否变化。
先从上一章的测试照片中选一张杯子照片和一张橡皮照片。保留原图,用图像编辑工具分别制作灰度副本。保持画面范围和像素尺寸不变,不另外裁剪、锐化或使用轮廓滤镜。
灰度副本将彩色信息转换为明暗信息,保留了许多形状与明暗关系。有些颜色原来不同,转换后的灰度却可能很接近,因此这一步也会改变模型能够利用的线索。
把两张原图和各自的灰度图依次交给同一个分类器。只使用预览或预测功能,比较期间不重新训练。记录它实际选出的类别;若页面提供预测分数,也可以一起记下。
| 照片中的物品 | 原图的分类结果 | 灰度图的分类结果 | 你注意到的一项变化 |
|---|---|---|---|
| 杯子 | __________ | __________ | __________ |
| 橡皮 | __________ | __________ | __________ |
如果结果改变,先比较图片中哪些线索发生了变化。可以提出“彩色转为灰度影响了这次判断”的解释,但不能据此断定模型只看颜色。转换还会改变局部对比关系,样本也只有两对。
如果结果没有改变,说明模型在这两对图片中保持了相同的分类。它可能利用了转换后仍然存在的信息,也可能受到其他线索影响。这个结果同样值得记录,不需要再故意把图片处理得无法辨认。
选出其中一对图片,用自己的话说明:输入改动了什么,模型实际回答了什么,你还不能确定什么。需要继续研究时,再增加几对不同角度的照片,按同样方法比较。
这一小实验不重新评价模型的整体准确率。它帮助我们理解:拍到的是同一件物品,计算机接收的信息仍然可以不同。
4.2 声音怎样被记录和识别
4.2.1 从声音变化到数字记录
轻敲一下桌面,你会听到一个短促的声音。发声物体的振动引起周围空气压力的变化,这种变化传播到麦克风。麦克风把接收到的变化转换成电信号,录音设备再把电信号记录为数字。[4]
这些数字按时间先后排列。可以把它想成连续拍摄一连串“快照”:每隔很短的时间,记录一次信号当时的数值。这种按一定时间间隔取值的过程,称为采样。[4]
每秒记录多少次,就是采样率。例如,一段单声道录音采用16 000次/秒的采样率,常记作16 kHz,那么3秒钟会记录16 000×3=48 000个采样值。单声道表示这里只有一路声音数据。[4]
这里的48 000个数描述声音信号随时间的变化,不表示录到了48 000次敲击。采样率也不是声音的高低:前者表示设备记录得有多密,后者与声音本身的振动频率等性质有关。
为保存这些采样值,设备还需要用有限的数值精度表示信号大小。这个过程称为量化。采样决定在什么时候取值,量化决定这些数值能够分得多细。[4]
把采样值按时间画出来,就得到波形图。横向表示时间,纵向表示信号相对于参考零点的变化。出现负数不代表录音错误,它只是信号变化的一种表示。
下面的数值用于理解一小段波形。相邻位置之间的时间间隔相同,具体单位在这里不作要求。
| 采样位置 | 1 | 2 | 3 | 4 | 5 | 6 | 7 |
|---|---|---|---|---|---|---|---|
| 信号数值 | 0 | 2 | 6 | 1 | -4 | -1 | 0 |
在纸上依次标出这七个点,就能看见它先偏向零点上方,再偏向下方。真实录音在很短的时间里就包含大量采样值,显示整段录音时,屏幕往往把这些细小变化概括成便于观察的轮廓。
还可以做一个短观察。打开录音工具,录下约5秒声音:先停一会儿,再用手指轻敲桌面两次,最后再停一会儿。回放录音,留意两次敲击出现的先后。若工具显示波形,可以对应查看敲击附近的变化。
不要急着给波形命名。波形中两处较明显的变化,可以帮助寻找两段声音出现的时间;只看这两个起伏,还不能确定发声动作一定是敲桌面。键盘按键、碰到物品等声音也可能产生短时变化。
在相同设备和录音设置下,波形的起伏有时能帮助比较信号强弱。但录音工具可能自动放大或减弱录入的信号,也可能改变显示比例,因此,两张截图中哪个波形更高,并不能直接证明现场哪个声音更响。
声音数据保存得更密,也不等于能够弥补所有问题。一段录音如果已经漏掉开头的字,或把人声与背景声混在一起,仅把文件转换成更高采样率,并不会重新记录当时缺少的信息。
从波形到声谱图
波形呈现的是信号随时间的变化。一段声音往往包含多种频率成分,频率描述振动重复的快慢。要区分一声轻敲、一阵摩擦或一句话,程序还可以分析这些成分的强弱及其变化。[5]
一种常见方法是把录音分成许多较短的片段,逐段计算频率成分,再按时间排在一起,形成声谱图(spectrogram)。横向表示时间,纵向表示频率,颜色或明暗表示相应成分的强弱。它是由声音数据计算出来的图,不是摄像头拍摄的图像。[5]
在常见的声谱图中,短促敲击可能呈现为某些时刻跨越多个频率的变化,持续的音调可能形成较长的带状区域。具体形状还取决于声音、录音条件和计算方式,不能只凭一条线就认定声音来源。
模型可以处理这样的数值分布,也可以采用直接处理波形等其他方法。我们先理解它们的共同点:声音被记录为数字,模型再从这些数字中寻找与任务有关的信息。[5]
4.2.2 识别声音与识别说话内容
把刚才的敲击录音交给AI,可以提出不同的问题。
“这是什么声音?”要求判断声音类别。例如,模型在预先设定的类别中给出敲击、说话、音乐等结果,这属于声音分类。它接收音频数据,输出一个或多个类别及相应分数。[6]
“这一段说了什么?”则要求把语音转换成文字,这称为自动语音识别(automatic speech recognition,ASR),也常称为语音转文字。[7]
两项任务处理的都可以是录音,预期结果却不同。看到“说话”这个类别,只知道模型认为存在语音,还不知道具体说了哪句话。得到一段转写文字,也不意味着录音中的敲击、音乐等声音都被记录下来。
可以用下面的例子比较:
| 提供的录音 | 希望判断的问题 | 相应的结果形式 |
|---|---|---|
| 两次轻敲桌面的声音 | 更接近哪一类声音? | 敲击等类别及其分数 |
| 一句“杯子放在左边” | 具体说了什么? | 对应的文字 |
| 说话时伴有敲击声 | 说了什么,同时有什么声音? | 转写内容和声音事件,可能需要分别处理 |
这些是任务与结果形式的示例,实际输出以所用工具为准。一个只支持语音转写的工具,未必会告诉你刚才敲了几次桌面。一个声音分类器,也只能在它支持的任务范围内给出结果。
声音分类同样依靠训练中形成的计算关系。训练材料中有哪些声音、类别怎样定义,会影响它能够区分什么。如果工具没有学过某类声音,输出列表里又没有“其他”,它仍可能从已有类别中给出分数较高的一项。[6]
先观察声音分类的输入与输出,就能理解它与图像分类的相通之处。后面制作感知作品时,我们可以根据真正需要识别的声音,选择已有模型或准备新的训练材料。
试着听清一句话
可以用语音转文字工具说一句:“杯子放在左边,橡皮放在右边。”读一读得到的文字,再对照自己的原话。重点看物品名称、左右关系和有没有漏词,不必先纠结标点。
有些工具在转写时会自动加标点,还会进一步把口语改得通顺、整理出要点。后两种处理已经改变了内容的呈现方式。核对具体说了什么时,先查看尽量接近原话的转写,再与录音比较。
继续尝试时,只改变一个条件。例如,保持同一句话、同一工具和近似说话方式,稍微远离麦克风再说一次。实际结果可能不变,也可能出现漏字或替换。先听录音中是否仍然清楚,再研究转写结果。
语音识别需要处理发音、说话速度和环境等变化,也可能利用词语之间的关联选择文字。遇到较少见的名称,即使输出读起来很顺,也值得回放核对。录音质量与语言设置等因素,也会影响结果。[7]
还有一个更容易忽略的区别:如果原话只是一个练习句子,那么准确转写出“杯子放在左边”,只能说明文字与声音相符,并不能证明桌面上的杯子真的在左边。
理解这一点,才能继续讨论图像与声音怎样一起使用。设备可以忠实记录一句话,现场事实却仍需要相应的观察。
4.3 多种信息怎样共同发挥作用
4.3.1 图像、声音和文字的相互补充
回到本章开头。照片里有杯子,录音里有一声轻响。把它们放在一起,是否就能确定“杯子刚才碰到了桌面”?
还不能只凭这两份材料确定。照片可能拍在声音出现以前,声音也可能来自画面外的一次敲击。我们需要知道它们是否记录了同一时段,并寻找声音与动作之间更直接的联系。
若再提供一段视频,画面中可以看到杯底与桌面接触,而接触附近的时刻出现轻响,这些信息就能彼此支持。新的材料帮助缩小了可能的解释范围,同时仍要留意声音是否也可能来自别处。
图像、声音、文字等不同形式的信息,称为不同的模态。结合两种或更多形式的信息来处理任务,称为多模态(multimodal)处理。它既关心各份材料包含什么,也关心材料之间怎样对应。[8]
可以用一个更简单的指物问题理解这种配合。桌面照片中有杯子和橡皮,你问:“右边那件东西是什么?”文字说明要关注哪个位置,图像提供物品的外观和摆放。少了文字,系统不知道你要问哪一件;少了图像,系统也不知道现场摆着什么。遇到不容易叫出名称的物品,拍张照片,再用文字指出关注的部位,就可能比只凭名称提问更清楚。
如果你用声音说出同一个问题,可以先把语音转成文字,再将文字与图片一起交给支持看图的模型。也有模型可以直接接收图片和音频,分别处理后利用它们之间的关联。具体能接收哪些材料,取决于所用模型和工具。[8][9]
因此,一个能录音的聊天界面,未必把完整声音交给了后面的模型。它也可能先转换成文字。这样能够传递说话内容,但敲击声、音量变化或停顿等信息,可能没有完整地进入后续处理。
从计算的角度看,多种材料都要先变成模型能够处理的数字。图像提供按空间排列的信息,声音提供按时间排列的变化,文字提供符号之间的关系。模型利用训练中学到的联系,结合当前问题处理这些材料。[8]
一个杯子的图像分数与一个敲击的声音分数,分别对应不同任务。把两个数直接相加,不能自动说明发生了“杯子碰到桌面”。要回答这个问题,还需要处理时间、动作和声音之间的关系。
用一张图和一句话试一试
把杯子和橡皮放在一起,拍一张两件物品都完整可见的照片。向具有图片理解能力的AI对话工具提供这张图,再提问:“按这张照片中的左右位置,杯子在哪边?橡皮在哪边?”[9]
先自己看清照片中的位置,再核对回答。这里以最终提交的图片为准,摄像头预览有时会镜像显示,不能把预览中的左右与上传图片中的左右混用。
接着保持图片不变,改问:“这张照片能告诉我,刚才有没有人敲桌面吗?”比较两次回答分别需要哪些信息。无需期待工具一定出错,重要的是你能够指出答案的依据或缺少的材料。
再换一个问题:“能从这张照片确定杯子里有没有水吗?”如果杯口和内部看得清,图片可能提供直接线索;如果内部被遮挡,就需要调整角度或补充材料。关键要看这张具体照片,而不是只记住“AI能不能看见水”这样的笼统结论。
通过这个小比较,可以看到文字怎样确定任务,图像怎样提供线索。也能看到,同一份输入并不能回答所有问题。
4.3.2 环境变化与信息缺失
我们在现场往往知道很多没有拍进照片、也没有录进声音的事情。你记得杯子属于谁,知道刚才是谁挪动了它,也许还知道这只杯子最近用来装画笔。模型拿到的材料里,未必有这些信息。
现场环境发生变化时,记录下来的内容也会变化。镜头移远以后,物品占用的像素可能变少;杯把被挡住以后,形状线索就减少了;一声短促敲击被更响的背景声盖住,也可能难以从录音中分辨。
这时,可以依次看三件事:材料有没有采到,采到以后是否清楚,模型给出的解释是否有依据。这三个问题对应不同的处理办法。
例如,相机根本没有拍到杯子,应该调整拍摄范围;杯子拍到了却很模糊,可以重新对焦或保持设备稳定;照片已经清楚,模型仍经常判断错误,再进一步检查模型适用的类别、训练材料和实际使用条件。
声音也一样。录音按钮没有启动,与已经录下安静的一段时间,是两种情况。已经录到声音但工具未识别出来,又是第三种情况。把它们分清,才知道下一步该检查录音、重新采集,还是研究识别方法。
没有识别出来,不能直接写成现场没有发生。工具没有给出“杯子”,可能与遮挡、类别范围或判断有关;工具没有转写出文字,也可能是没有录好或没有识别成功。说“在这份材料中尚未确认”,会比直接下结论更准确。[3][7]
多增加一种材料,有时能够补充缺少的信息。例如,单张照片没有记录动作过程,视频可以增加时间上的变化;单看画面难以察觉一次短促声响,录音可以提供补充。不过,新增材料也要相关、清楚,并与原来的材料对应。
如果照片显示杯子在右边,文字说明却写着“杯子在左边”,先比较材料的时间和观察角度。两份材料可能来自不同摆放时刻,也可能采用了不同的左右方向。必要时重新拍照或询问,不能仅因为某种信息是文字、图像或AI输出,就自动把它当作最后答案。
改进输入也有取舍。提高图像分辨率可能保留更多细节,同时增加数据量和处理负担;增加录音时长可能记录到前后过程,也可能加入许多与问题无关的声音。我们要补充的是回答当前问题所需要的信息。
为自己的材料补上一项有用信息
从本章的照片比较或短录音中,选一项自己还不能确定的事情。先说明缺少什么,再决定补一张照片、换一个角度、重新录一小段,还是增加一句经过核对的背景说明。一次先补一项,再观察它是否真的帮助回答了原来的问题。
如果材料已经足够,且结果与实际情况相符,也可以到这里结束。解释为什么这些材料能够支持结论,同样是一种学习。
这样的选择会影响我们怎样创造工具。有人在嘈杂环境中不容易听到提示,屏幕上的文字可以提供另一种方式;有人不方便一直看屏幕,简短声音又能带来帮助。第10章将继续研究,怎样把感知结果变成合适的回应。
现在可以先留下一个自己的问题:你希望帮助谁注意到什么?现有的照片、声音或文字能提供多少信息,还需要怎样改变?
本章回望
本章从一张杯子的照片和一声轻响出发,研究图像与声音怎样进入计算机。像素记录图像中各个位置的颜色或明暗,采样值记录声音信号随时间的变化。模型接收这些数字,利用训练中形成的计算关系完成任务。
同一种材料可以对应不同问题。图像分类判断类别,目标检测还需要给出物体位置;声音分类判断声音类型,语音识别把说话内容转换为文字。看清预期输出,才知道应该怎样选择和检查工具。
图像、声音和文字能够相互补充,也都只记录了现场的一部分。多种材料能否带来帮助,要看它们是否与问题有关、是否清楚、是否彼此对应。
本章的比较实验把上一章的认识推进了一步:同一件物品可以形成不同输入,同一份输入也只能支持一定范围的判断。我们在现场知道的事情,需要通过合适的材料表达出来,才可能成为AI处理的依据。
下一章将转向另一个方向:当AI生成一段文字、一幅图像或一段声音时,这些新内容又是怎样形成的?
练习与继续探索
1. 用数字解释照片。一张图片宽320像素、高240像素,共有多少个像素?把它在屏幕上放大两倍,会自动得到原先没有记录到的杯身小字吗?说明你的理由。
2. 为问题选择输出。“这张图片更接近杯子还是橡皮”“杯子在图片的什么位置”“这段录音是哪一类声音”“说话的人具体说了什么”,分别需要什么形式的输出?为什么上一章的两类图片分类器不能直接回答这四个问题?
3. 区分声音与采样。一段2秒的单声道录音采用16 000次/秒的采样率,一共有多少个采样值?它与两次敲击有什么区别?能否仅凭采样值数量判断声音来源?
4. 研究两个材料的关系。一张照片显示杯子放在桌上,另一段录音中有一声轻响。有人据此写道:“杯子刚刚被放到桌上。”这个解释还需要哪些信息支持?你准备怎样补充一项有用的材料?
5. 为一个人改变信息的呈现。从自己熟悉的学习或生活场景中,找一件容易被错过的信息。谁可能需要它?你准备增加文字、声音还是画面?先说明选择的理由,不必立即开发程序。
本章资料来源
[1] OpenCV. Basic Operations on Images;MDN Web Docs. Digital video concepts. 用于核对像素、行列、颜色分量与常见RGB表示。访问日期:2026-09-20。https://docs.opencv.org/4.x/d3/df2/tutorial_py_basic_ops.html ;https://developer.mozilla.org/en-US/docs/Web/Media/Guides/Formats/Video_concepts
[2] OpenCV. Image Gradients;TensorFlow. Convolutional Neural Network (CNN). 用于核对局部明暗差异、边缘线索及图像网络的局部计算。访问日期:2026-09-20。https://docs.opencv.org/4.x/d5/d0f/tutorial_py_gradients.html ;https://www.tensorflow.org/tutorials/images/cnn
[3] Google AI Edge. Object detection task guide. 用于核对检测类别、预测分数、边界框坐标、输入处理与模型类别范围。访问日期:2026-09-20。https://developers.google.com/edge/mediapipe/solutions/vision/object_detector
[4] MDN Web Docs. Digital audio concepts;Adobe. Digitizing audio. 用于核对声音数字化、采样、采样率、数值精度、声道与波形表示。访问日期:2026-09-20。https://developer.mozilla.org/en-US/docs/Web/Media/Guides/Formats/Audio_concepts ;https://helpx.adobe.com/audition/desktop/digital-audio-fundamentals/digitizing-audio.html
[5] TensorFlow. Simple audio recognition: Recognizing keywords. 用于核对波形、声谱图与音频模型输入的基本关系。访问日期:2026-09-20。https://www.tensorflow.org/tutorials/audio/simple_audio
[6] Google AI Edge. Audio classification guide. 用于核对声音类别、训练确定的分类范围、音频输入与分类输出。访问日期:2026-09-20。https://developers.google.com/edge/mediapipe/solutions/audio/audio_classifier
[7] Google Cloud. Cloud Speech-to-Text overview;Improve transcription results with model adaptation. 用于核对语音转写、结果形式、词语线索,以及录音质量和语言等设置对识别的影响。访问日期:2026-09-20。https://docs.cloud.google.com/speech-to-text/docs/overview ;https://docs.cloud.google.com/speech-to-text/docs/v1/adaptation
[8] BALTRUŠAITIS T, AHUJA C, MORENCY L P. Multimodal Machine Learning: A Survey and Taxonomy. arXiv:1705.09406. 用于核对模态、表示、信息融合与材料对应关系。访问日期:2026-09-20。https://arxiv.org/abs/1705.09406
[9] Google AI for Developers. Image understanding. 用于核对图像与文字联合输入、看图问答和定位等能力的区分,以及图像清晰度的影响。访问日期:2026-09-20。https://ai.google.dev/gemini-api/docs/image-understanding
第5章 AI怎样生成文字、图像和声音
样章 v0.1 | 2026年9月20日
同一只纸盒,还能怎样讲述
还记得第2章的收纳盒吗?旧纸盒里加了一块隔板,后格放铅笔,前面的浅格放橡皮。原来拿橡皮时,需要先取出几支铅笔;分格以后,可以直接拿到它。
把这段记录交给AI,可以得到一段作品介绍,也可以得到一句简短的使用说明。换一种要求,还可以请它写一段明确虚构的“纸盒独白”:一只原本准备被丢弃的盒子,怎样开始新的生活。
同一份材料,能够通向不同的表达。前两种表达需要忠实说明实物,最后一种则给想象留出了空间。我们提供的材料和要求,参与了这些内容的形成。
上一章研究图像与声音怎样进入计算机。本章转过来看:当AI写出一段原先没有出现在输入中的话,画出一幅图,或合成一句声音时,这些内容从哪里来?它怎样接着已有的内容继续生成?为什么再次提出相同要求,得到的结果有时会变化?
我们先从文字入手,看清其中的数字和计算,再了解训练怎样形成能力,以及图像、声音生成有哪些不同。最后,用同一段自己的说明做一次比较,分清表达的变化、材料以外的补充和有意的想象。
学完本章,你将能够:解释文字怎样转为模型能够处理的数字;说明一种常见的逐步生成过程;区分训练与日常对话;认识图像、声音生成的基本思路;结合自己的材料判断哪些变化可以保留,哪些内容还需要确认。
5.1 文字怎样一步步生成
5.1.1 把文字分成片段并用数字表示
“前格放橡皮,后格放铅笔。”我们一读就知道这句话在安排物品。计算机要处理它,需要先把文字变成数字。
第4章里,照片可以表示为像素数值,声音可以表示为一串采样值。处理文字时,一种常见做法是先把它分成较小的片段。每个片段称为词元(token)。词元不一定是语文课中的一个完整词语:它可能对应一个汉字、几个字、一段字母或标点,具体边界由所用的处理方法决定。[1]
下面用一种便于观察的划分作示例:
前格|放|橡皮|,|后格|放|铅笔|。
这句话在示例中共有8个词元。实际工具可能把“前格”分成更小的片段,也可能采用其他划分。因此,不能把汉字数直接当作所有模型的词元数。
负责划分文字并转换编号的程序,称为分词器(tokenizer)。它使用一份对应表,为各个词元安排编号。下面的编号只用于说明方法:[1]
| 词元 | 示例编号 | 词元 | 示例编号 |
|---|---|---|---|
| 前格 | 17 | 后格 | 18 |
| 放 | 6 | 铅笔 | 35 |
| 橡皮 | 42 | 。 | 4 |
| , | 3 |
于是,上面这句话可以写成:
17,6,42,3,18,6,35,4
“放”出现两次,在这个例子中使用同一个编号6。编号只负责标明片段,42大于35,并不表示橡皮比铅笔更重要。它也没有直接告诉模型,橡皮和铅笔都属于文具。
要让这些片段参与更丰富的计算,还需要把每个编号对应到一组数。这样一组按顺序排列的数称为向量,其中的数值可以通过训练逐渐形成。[2]
例如,可以用“0.2,-0.4,0.7”演示一组数的形式。真实模型通常使用更多数值,这些数值在训练中逐渐调整。它们共同参与表示,不能简单把第一项读成颜色、第二项读成用途。[2]
编号相当于找到对应的入口,一组数则能够进入神经网络的乘、加与变换。经过训练,模型可以利用这些数字之间的关系处理文字。第3章讲过的参数和计算,在这里继续发挥作用。
文字的先后位置也很重要。“前格放橡皮,后格放铅笔”与“前格放铅笔,后格放橡皮”,所用的词元相同,意思却不同。模型需要在计算中利用位置信息,才能区别这些排列。[3]
继续处理时,某个词元的表示还会受到上下文影响。例如,同一个“它”出现在不同句子中,可能指向不同的物品。初始数字表示只是起点,后面的计算还要结合周围内容。
先把这个过程连起来:文字被分成片段,片段转换成编号,编号对应到数字表示;模型再结合位置和上下文进行计算。到输出时,生成的词元编号会转换回文字,让我们读到回答。[1][3]
动手看一看:按本节示例中的划分和编号,把“后格放橡皮,前格放铅笔。”写成一串编号。与原来的数列相比,哪些位置变了?为什么只保留有哪些编号、丢掉它们的顺序,会漏掉重要信息?
5.1.2 利用上下文中的关联生成后续内容
文字变成数字以后,模型怎样决定接下来生成什么?先读两段尚未写完的话:
甲:盒子分成前后两格,铅笔和橡皮各放一格。前格放橡皮,后格放……
乙:盒子分成前后两格,铅笔和橡皮各放一格。前格放铅笔,后格放……
两段话最后都是“后格放”,但根据更前面的安排,甲应当接“铅笔”,乙应当接“橡皮”。决定后续内容时,需要利用前文的关系。
语言模型(language model)学习文字片段之间的关联。一种常见的文字生成方式,是结合已有上下文,为下一个词元的不同候选计算概率,再按一定方法选出一个。选中的词元加入已有内容以后,继续计算下一个,直到输出结束标记或达到程序规定的停止条件。[4][5]
在这种逐步生成方式中,后面的计算会使用前面已经生成的内容。这里先沿着这一条常见路线理解过程。
下面是一组演算数据。为了便于比较,把“铅笔”“橡皮”“尺子”分别看作一个词元,“其他”合并其余候选。
| 候选词元 | 接在甲后面的概率 | 接在乙后面的概率 |
|---|---|---|
| 铅笔 | 70% | 15% |
| 橡皮 | 15% | 70% |
| 尺子 | 5% | 5% |
| 其他 | 10% | 10% |
每一列合计100%。根据这组数,若每次都选概率最高的候选,甲会接“铅笔”,乙会接“橡皮”。上下文不同,候选的分配就可以不同。
还有一种选择方法:按概率进行抽样。可以把甲这一列想成100张小纸片,其中70张写“铅笔”,15张写“橡皮”,5张写“尺子”,10张写“其他”。混匀后抽一张,“铅笔”最有机会被抽到,但一次也可能抽到别的候选。程序用数字实现这种选择,不需要真的准备纸片。[5]
算一算:在这组演算数据中,抽到“铅笔”以外候选的概率是多少?如果连续抽取10次,每次都把纸片放回并混匀,会保证恰好7次抽到“铅笔”吗?
抽样保留了多种继续表达的可能。一个开头可以接出不同句子,前面选中的片段又会改变后面的条件,因此,即使输入相同,完整回答也可能出现差异。实际工具还会调整候选范围或选择方式,有时也会给出相同结果。[5]
要注意,表里的70%描述候选词元在这一步的概率,不能直接读成“这一整段介绍有70%的概率符合实物”。词元选择与事实核对,是需要分别理解的事情。
模型怎样联系较远的内容?
回看甲、乙两段话。仅记住最后的“后格放”还不够,模型需要把“两样东西各占一格”与“前格已经放了什么”联系起来。
注意力机制(attention mechanism)提供了一种利用上下文的计算方法。它根据当前数字表示,计算不同位置的信息应当怎样参与组合,让相关内容对当前结果产生不同程度的影响。[3]
可以先看一个简单的加权计算。假设两处信息中各取一个数,分别是2和6。给它们分配0.8与0.2的权重,组合后是:
0.8×2+0.2×6=2.8
若权重改成0.2与0.8,组合后则是:
0.2×2+0.8×6=5.2
两个输入没有改变,参与组合的程度改变了,结果就不同。实际注意力计算处理的是多组数字,相关权重由模型结合输入计算得到;这里的数值只帮助理解“怎样把不同信息按不同比重合起来”。
这样的计算可以把当前位置与较远的相关内容联系起来。文字生成时,模型利用已经提供的输入和已经生成的内容,不需要提前知道尚未生成的文字。[3]
Transformer是一类组织神经网络计算的结构,它将注意力计算与其他带有参数的变换组合起来,再多层处理信息。模型既利用片段之间的联系,也利用训练中形成的其他计算关系。注意力提供了联系信息的方法,效果还要通过实际任务检查。[3][4]
我们不必把每一层的公式都展开,仍然可以看清主要关系:提供的材料转为数字,模型结合上下文反复计算,输出候选概率,程序选择后续内容。参数来自训练,当前问题与材料则影响本次计算。
做一个很短的观察:把甲、乙两段话分别交给同一个AI对话工具,只要求补出省略号后的物品名称。比较实际结果,再指出自己是根据哪一句前文作出判断的。
若结果正确,可以说明模型在这两个输入中给出了符合安排的回答;若有不同,就回看材料和输出。单凭回答的变化,我们还不能知道内部某个注意力单元具体用了哪些信息。
5.2 大模型的能力怎样形成
5.2.1 从大量材料中进行训练
在第3章,我们用带有“杯子”“橡皮”标签的图片训练分类器。语言模型也需要训练,但文字本身就能提供许多学习目标。
仍然使用“前格放橡皮,后格放铅笔。”按照前面的示例划分,可以从一句话得到多处预测任务:
| 用来预测的前文 | 原文中紧接着的词元 |
|---|---|
| 前格 | 放 |
| 前格|放 | 橡皮 |
| 前格|放|橡皮 | , |
| 前格|放|橡皮|, | 后格 |
训练程序让模型根据前文计算候选概率,再与原文中的下一个词元比较。目标直接从文字的先后关系中取得,无需人为给每一个位置重新填写答案。这里的学习目标就来自数据本身。[4][6]
它与前面的补句体验有所不同。补句时,我们在使用已有模型;这里讨论的是训练程序怎样借助原文调整模型参数。
假设在“前格|放”之后,原文的目标词元是“橡皮”。模型起初只给它20%的概率,训练程序就可以据此计算损失,并调整参数。在后续某次比较中,它对这个目标的概率可能提高到60%。这些数用于说明变化方向,真实训练需要综合许多位置、许多材料的结果。[6]
第3章的“计算—比较—调整”在这里仍然成立。模型不用先完整写出一篇文章,才得到一次反馈;一段文字可以提供很多预测位置。训练中的计算还可以批量进行,但预测某个位置时,要限制模型直接利用目标词元及其后面的内容,避免把要预测的答案提前交给它。[4][6]
如果某个位置允许有多种合理说法,训练时为什么还用原文中的一种作目标?因为这一条材料只提供了实际出现的表达。其他材料会呈现不同说法,大量例子共同影响模型的概率分配。训练目标有助于学习语言规律,也需要结合更广泛的材料与评价理解其效果。
在大量、较广泛的材料上进行基础训练,通常称为预训练(pretraining)。经过这类训练,模型可能学到词语的搭配、句子之间的关系、不同文体的组织方式,以及材料中表达的许多知识与解题方法。[4]
人们将规模较大的这类语言模型称为大语言模型(large language model,LLM)。第3章讲过,参数参与神经网络计算;更多参数可以提供表达复杂关系的空间,但实际能力还与数据质量、训练方法和计算安排有关。仅看“大”或某个参数数量,无法代替实际检验。[4][7]
“预测后续片段”这个目标看起来很小,完成它却可能需要利用相当复杂的联系。前文说把橡皮从前格移到桌上,后文再问它在哪里,就需要处理位置随动作改变的关系;一段制作说明要保持前后顺序,也需要利用步骤之间的联系。通过很多这样的材料,网络有机会形成能够迁移到新输入的处理能力。
这些能力分布在训练后形成的计算关系中。模型使用时会利用它们组织内容,也可能重现某些在训练中记住的片段。因此,不能把每次回答都理解为从某篇文章中取出原句,也不能保证生成文字绝不会与已有材料重合。[9]
训练材料还会影响模型熟悉什么。若某类事物主要以广告形式出现,模型可能更容易生成宣传式表达;如果某种方言、专业名称或生活经验出现得较少,相关表现也需要另外检查。第3章关于数据覆盖范围的认识,在这里仍然适用。
因此,大量材料只是起点。材料怎样选择、怎样处理错误与重复、模型在新任务中表现如何,都需要研究。能够生成通顺的句子以后,还要继续解决一个问题:怎样让它更好地回应人的实际要求?
5.2.2 通过进一步训练改进回答与行为
设想一个善于继续写文章的模型看到“请给收纳盒写两句介绍”,它可能接着写出一串类似的要求。文字衔接得上,却没有完成使用者希望它做的事。
为了让模型更适合问答和协作,可以在预训练基础上安排进一步训练。这一阶段通常称为后训练(post-training),可以采用示范回答、回答之间的比较,以及对任务结果的反馈等材料。[7][8]
先看示范回答。开发者准备“要求与材料—合适回答”这样的例子,让模型学习如何依照要求组织输出。这种有针对性的进一步训练,是微调(fine-tuning)的一种用法。训练会调整参与其中的参数。[7]
例如,材料只说“前格放橡皮,后格放铅笔”,要求写两句真实介绍。示范回答应当交代分格和用途,控制长度,不随意增加尺寸和试用经历。很多不同任务的示范,可以帮助模型学习如何遵循要求,而不只是继续原来的文字。
还可以给同一个要求准备几个回答,比较哪一个更合适。下面是一段示例:
要求:根据现有记录,介绍这个纸盒的分格安排,不补写尺寸。
回答甲:前面的浅格放橡皮,后格放铅笔。两类物品分开放置。
回答乙:这款20厘米长的收纳盒广受欢迎,能让所有人迅速整理桌面。
比较时可以明确指出:甲保留了材料中的关系;乙增加了没有提供的长度和评价。把许多这样的比较用于训练,有助于改善回答与要求的匹配程度。训练程序可以利用这些反馈,继续调整模型参数,使它更倾向于产生符合评价要求的回答。[7]
反馈也可以来自可检查的任务结果。例如,一段程序能否通过规定的运行检查,一道计算题的答案是否符合已知结果。有些后训练方法会利用这样的反馈改进模型解决问题的表现。[8]
这并不意味着一种反馈能够检查所有方面。程序通过几个例子,还需要考虑其他输入;一段文字受到读者喜欢,也不自动保证事实准确。评价重视什么,会影响训练改进的方向。选择示范、制定比较标准和检查实际效果,仍然需要人的知识与判断。
再分清一次:补充材料与训练有什么不同?
你在对话中说“前格放的是橡皮,请把这里改正”,改变的是本次可参考的内容。普通对话生成通常使用当前参数,并不会因为这句话就在当场完成一次模型训练。[10]
开发者把成批任务和回答交给训练程序,计算损失、更新参数,则属于训练。前者帮助当前任务使用已有能力,后者改变模型计算本身。两种方式都可能让下一次看到的回答更合适,需要根据实际过程区分。
某些应用还会另外保存偏好,在后续对话中重新提供给模型。记下并再次提供一条信息,与更新模型参数也有区别。看到工具“记住了”某个要求,不能只凭这一点断定模型刚刚经过训练。
我们在第2章练习观察、提问和修改,现在能够进一步解释这些动作:清楚的语言把相关信息带入当前计算;训练则为模型处理这些信息提供能力基础。二者配合,才可能得到有用的结果。
5.3 生成内容有哪些共同问题
5.3.1 不同形式的内容怎样被生成
文字生成有了一个清楚的解释,接下来看看图像和声音。
我们把能够根据输入条件生成文字、图像、声音等内容的人工智能,通常称为生成式人工智能(generative artificial intelligence)。不同系统生成的数据形式不同,具体计算方法也不完全相同。
图像:从带噪数据中学习,逐步形成画面
你输入“一个分成前后两格的纸质收纳盒,前格放橡皮,后格放铅笔”,图像生成工具需要产生一整幅画面的数字表示,再将其显示为图像。文字说明给出对象与关系,画面还需要确定形状、颜色、位置和光影等细节。[11]
一种重要方法是扩散模型(diffusion model)。先从训练过程理解它:程序取一张训练图片,在它的数字表示中加入不同程度的随机噪声,让模型学习怎样估计应当去掉的噪声或较清楚的图像信息。这里的噪声可以想成随机扰动的数值;加得越多,原来的内容通常越难辨认。[11]
程序知道原来提供了什么,也知道加入噪声的过程,因此可以把模型的估计与相应目标比较,再调整参数。大量图片和不同噪声程度提供许多训练机会。若训练还配有描述文字,模型就能学习文字条件与图像内容之间的关系。[11][12]
生成时,一种典型做法是从随机噪声开始,结合文字条件和当前中间结果,反复估计并更新。许多步以后,逐渐得到一幅图像。可以把这条路线简记为:
文字要求+随机起点 → 多步计算与更新 → 生成的图像
这些计算利用训练学到的规律形成画面。随机起点里没有藏着一张已经拍好的收纳盒照片,生成过程也不必先找到某一张原图,再把它恢复出来。[11]
有些方法先把图片压缩成较小的数字表示,在这种表示中完成主要生成计算,最后再转换回像素。这可以减少直接处理大图的负担。还有方法把图像编码为一系列片段来生成。我们学习的逐步去噪路线是一种代表,不能据此推断每个图像工具内部都完全相同。[12][15]
想象一下,同样是“纸质收纳盒”,纸的颜色可以不同,盒沿也可以有不同形状。输入没有规定这些细节,生成时仍然要把画面填充完整。不同结果可能都符合这段文字,却未必与自己手上的实物一致。
这也说明,生成画面能够帮助探索“可以做成什么样”,而实物照片记录“当时拍到了什么”。两类材料都能用于交流,使用时应当让别人知道它们各自的用途。
声音:从文字或其他条件形成音频
第4章的语音识别把说话内容转成文字。现在把“前格放橡皮,后格放铅笔”转换成可以播放的声音,就是文本转语音(text-to-speech,TTS),也常称为语音合成。[13]
训练语音合成模型时,可以使用录音及其对应文字,让模型学习文字与发音、时长、语调等信息之间的联系。一种路线先根据文字生成声音的中间表示,例如声谱图,再通过另一个模型把它转换成声音波形;也有系统采用音频片段编码或其他生成路线。[13][14]
还记得第4章的声谱图吗?当时它是从已录下的声音计算出来的。在这里,它可以成为模型生成的中间结果,用来形成新的声音。表示方法相通,信息流动的方向发生了变化。
最后得到的音频同样包含随时间排列的数值,播放设备把它转为可以听到的声音。同一句话可以有不同语速、停顿和语调,因而对应不同波形。文字内容相同,并不要求每次合成的全部数值相同。
文字转语音通常以给定文字为内容基础;生成一段音乐或某种环境声,还需要决定旋律、节奏或声响变化等内容。它们都属于声音生成,任务要求却有所不同。一个只能朗读文字的工具,不一定能够直接生成各种声音作品。
三种形式放在一起看
| 希望得到的内容 | 一种代表性的生成路线 | 可以观察的结果 |
|---|---|---|
| 一小段介绍 | 将文字变成数字,结合上下文逐步生成词元 | 词句、信息与前后关系 |
| 一幅收纳盒设计图 | 将文字作为条件,从随机起点逐步更新图像表示 | 物体、分格、颜色与布局 |
| 一句语音介绍 | 根据文字生成声音表示,再形成可播放的音频 | 读了什么,怎样停顿和发音 |
共同点是利用训练形成的能力,结合本次条件计算新的内容。差别在于表示什么数据、怎样安排计算,以及最后怎样检查结果。实际应用也可能组合多个模型,让一个界面同时完成不同任务。
可以再选一种形式体验:把本章的一小段介绍交给语音合成工具,听听文字与读音是否对应;或者给图像生成工具一段简短外形说明,看看它确定了哪些文字没有写出的细节。选择一种即可,主要比较活动仍然围绕下面的文字材料进行。
5.3.2 生成结果中的变化、补充与不确定性
生成内容中的变化,可以帮助我们找到不同的表达和设计。关键在于分清:改变的是说法,还是对事实的陈述;新增的是允许的想象,还是没有依据却被写成真的细节。
以收纳盒为例,把“前面的浅格放橡皮”改成“橡皮放在前面的浅格”,主要改变了句式。写成“这个20厘米长的盒子经过全班试用”,则增加了尺寸与试用经历。现有记录中没有这些内容,就需要另外确认。
允许创作时,增加想象可以成为作品的一部分。请纸盒“说说自己新的生活”,可以写它看着铅笔每天被拿起又放回。读者知道这是虚构,就能按创作来理解。若同样的文字被当作真实试用记录,要求就不同了。
生成结果中,缺少依据或与材料、事实不符,却被表述得像可靠事实的内容,常被称为幻觉(hallucination)。[4]
这种问题可能与训练材料、输入不足、错误关联以及生成过程中的选择等因素有关。模型学到许多有用关系,也可能在信息不足时延续出貌似合适的细节。只看到一段错误文字,通常不足以确定唯一原因。
再生成几次并不能自动解决事实问题。几段文字完全一致,也可能共同重复一个错误;几段文字说法不同,却可能都准确表达同一份记录。检查时,应当回到具体内容与依据。
做一次比较:同一份材料,几次生成
先取出第2章的一段观察记录,也可以另写三五句话,介绍自己熟悉的物品或经历。选一份自己能够核对的短材料即可,不必重新制作作品。
本章示例继续使用下面这段记录:
我用旧纸盒改成了一个桌面收纳盒。后格放铅笔,前格较浅,放橡皮。没有分格时,拿橡皮需要先取出几支铅笔。加上隔板以后,一位同学试用时,伸手就拿起了前格的橡皮。
先生成一段真实介绍。打开AI对话工具,附上自己的材料,再提出要求:
请根据这段记录,写两三句给第一次看见作品的人读的介绍。可以调整说法,保留已有事实,不添加没有提供的尺寸、经历或效果。
读完第一份结果,找出一处表达变化,再看看它有没有增加事实。内容已经准确时,就按准确记录,不需要主动寻找错误。
保持要求,再生成一次。在同一工具中另开一段新对话,使用相同材料和相同要求,尽量不改变其他设置。这样可以减少上一份回答对下一次生成的影响。把第二份结果与第一份并排阅读。
两份结果可能不同,也可能很接近。前面学过,生成方式可以保留不同选择;实际工具还可能包含未显示的设置。这里观察的是这两次实际输出,不据此判断模型内部唯一采用了哪种选择方法。
明确换成创作任务。仍用同一份材料,另开一段对话,将要求改为:
请以这只纸盒为主角,写两三句明确虚构的独白。保留它被改成收纳盒、前格放橡皮和后格放铅笔的安排,其他情节可以想象。
这一次改变了任务性质。先看它是否保留指定安排,再找一处新增的想象。新增内容是否合适,要结合创作要求判断,不能因为材料里没有,就把所有新增句子都当作错误。
最后作出自己的选择。从几份结果中选出两三处值得说明的地方,可以简单写成“原文写了什么—生成内容怎样表达—我为什么保留或修改”。不必逐字给全文分类。下面是判断方式的示例:
| 生成内容 | 与原材料的关系 | 可以怎样处理 |
|---|---|---|
| 橡皮放在前面的浅格 | 保留位置关系,调整句式 | 根据表达需要保留 |
| 全班同学试用后都很满意 | 把一次试用扩大为全班的评价 | 在真实介绍中删去或另行核实 |
| 我这只旧纸盒又有了新工作 | 在明确虚构的独白中使用拟人表达 | 结合创作目的判断是否采用 |
保留自己的材料、两份介绍和一项有理由的选择,就可以结束基本练习。虚构独白也可以留作第7章创作时的材料。
如果某一项事实在不同回答中始终一致,并且与记录相符,可以说明本次生成较好地保持了它。若发现改写扩大了原意,就具体指出从“一位同学”变成了“全班”,而不只写“AI不可靠”。
同样的判断也适用于图像和声音。设计图中的新颜色可以启发下一次制作,却不能证明实物已经涂过这种颜色。合成声音可以朗读一段自己写的介绍,却不能作为某个人确实说过这段话的记录。展示这些材料时,用“设计设想”“合成旁白”等简短说明交代用途即可。
生成工具让我们更容易看到多种可能。真正值得保留的选择,仍然需要联系自己的意图、掌握的材料和作品的读者。它有没有把一个想法表达得更清楚?有没有让别人误会一件尚未发生的事?这两类问题可以放在同一次阅读中考虑。
本章回望
从同一只收纳盒出发,我们看见了文字、图像和声音的不同可能,也开始理解这些内容背后的计算。
文字先分成词元,再转为模型能够处理的数字。模型利用上下文和训练中形成的关系,计算候选内容。逐步生成时,已经产生的内容会继续影响后续结果;不同的选择可能带来不同表达。
能力的形成需要训练。预训练从大量材料中学习广泛的关系,后训练进一步改善回答、行动和解决任务的方式。日常对话补充材料,主要改变当前计算可以参考什么;训练则调整模型中的参数。
图像和声音也通过数字表示生成,但不必沿用同一种文字生成方法。逐步更新图像表示、根据文字形成声音等路线,各自需要适当的训练材料、计算过程和结果检查。
本章的比较让我们区分了三件事情:改换说法、补充事实、展开想象。表达可以有多种选择,事实需要相应依据,创作需要让读者理解作品的性质。
下一章将继续追问:当我们需要一个有根据的答案时,怎样寻找材料、检查引用,并把已经确认和仍然不确定的内容说清楚?
练习与继续探索
1. 解释数字表示。“前格放橡皮,后格放铅笔。”在本章示例中被划分为多少个词元?能否由此断定任何工具都会得到相同数量?编号、表示词元的一组数和词元的位置,分别起什么作用?
2. 看懂一次生成。在5.1.2的演算数据中,甲这一列每次都选最高概率时会选什么?按概率抽样时,又可能发生什么?为什么70%不能直接表示整段回答的事实准确率?
3. 比较两种改变。“在当前对话中补充一条实物记录”和“用一批任务与回答重新训练模型”,分别改变了什么?一个应用在下次对话中再次提供保存的记录,是否足以证明模型参数发生了改变?
4. 为生成材料找合适的用途。一张按文字说明生成的收纳盒图片,与一张实物照片,可以分别帮助回答什么问题?如果要介绍已经完成的作品,你准备怎样使用它们,让读者理解哪些是实物、哪些是设计设想?
5. 为文字选择声音。把一句作品介绍合成为语音,需要形成怎样的数据?两段语音读了同样的文字,是否必须有完全相同的波形?语速和停顿怎样影响你对介绍的理解?
6. 留下一项自己的判断。从本章生成的内容中,选一处你愿意保留的变化,再选一处需要修改或暂不采用的内容。说明理由;如果没有需要修改的地方,就说明你核对了什么,以及这些材料还不能回答哪个问题。
本章资料来源
[1] Hugging Face. Tokenizers. 用于核对文本划分、词元、编号与文字还原。访问日期:2026-09-20。https://huggingface.co/learn/llm-course/en/chapter2/4
[2] TensorFlow. Word embeddings. 用于核对整数编号、向量表示、嵌入与可训练参数之间的关系。访问日期:2026-09-20。https://www.tensorflow.org/text/guide/word_embeddings
[3] VASWANI A, SHAZEER N, PARMAR N, et al. Attention Is All You Need. 2017. arXiv:1706.03762. 用于核对注意力、位置、Transformer与生成时的因果约束。https://arxiv.org/abs/1706.03762
[4] Hugging Face. How do Transformers work?;Google for Developers. LLMs: What's a large language model? 用于核对语言建模、自监督训练、预训练与生成模型的基本概念。访问日期:2026-09-20。https://huggingface.co/learn/llm-course/en/chapter1/4 ;https://developers.google.com/machine-learning/crash-course/llm/transformers
[5] Hugging Face. Generation strategies. 用于核对逐步选择、最高概率选择与按概率抽样的区别。访问日期:2026-09-20。https://huggingface.co/docs/transformers/generation_strategies
[6] Hugging Face. Training a causal language model from scratch. 用于核对从文本取得预测目标、计算损失与训练参数。访问日期:2026-09-20。https://huggingface.co/learn/llm-course/en/chapter7/6
[7] OUYANG L, WU J, JIANG X, et al. Training language models to follow instructions with human feedback. 2022. arXiv:2203.02155. 用于核对示范回答、偏好比较及基于反馈的进一步训练。https://arxiv.org/abs/2203.02155
[8] DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. 2025. arXiv:2501.12948. 用于核对利用任务结果反馈改进推理表现的训练思路。https://arxiv.org/abs/2501.12948
[9] CARLINI N, TRAMÈR F, WALLACE E, et al. Extracting Training Data from Large Language Models. 2020. arXiv:2012.07805. 用于核对模型可能记忆并重现部分训练材料,避免将生成一概解释为逐句检索或完全不会重复原文。https://arxiv.org/abs/2012.07805
[10] Google for Developers. LLMs: Fine-tuning, distillation, and prompt engineering. 用于核对训练调整参数与提示输入使用已有参数的区别。访问日期:2026-09-20。https://developers.google.com/machine-learning/crash-course/llm/tuning
[11] HO J, JAIN A, ABBEEL P. Denoising Diffusion Probabilistic Models. 2020. arXiv:2006.11239;Hugging Face. Understanding pipelines, models and schedulers. 用于核对加噪训练、从随机噪声开始的多步生成与结果转换。访问日期:2026-09-20。https://arxiv.org/abs/2006.11239 ;https://huggingface.co/docs/diffusers/using-diffusers/write_own_pipeline
[12] ROMBACH R, BLATTMANN A, LORENZ D, et al. High-Resolution Image Synthesis with Latent Diffusion Models. 2022(CVPR). arXiv:2112.10752. 用于核对压缩表示中的图像生成与文字条件。https://arxiv.org/abs/2112.10752
[13] SHEN J, PANG R, WEISS R J, et al. Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions. 2017. arXiv:1712.05884;Google Research. Tacotron 2: Generating Human-like Speech from Text. 用于核对文字、声学表示与波形生成的一种代表路线,不将其视为全部语音合成系统的统一结构。访问日期:2026-09-20。https://arxiv.org/abs/1712.05884 ;https://research.google/blog/tacotron-2-generating-human-like-speech-from-text/
[14] WANG C, CHEN S, WU Y, et al. Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers. 2023. arXiv:2301.02111. 用于核对将音频表示为离散编码、通过语言建模进行语音合成的另一类方法。https://arxiv.org/abs/2301.02111
[15] ESSER P, ROMBACH R, OMMER B. Taming Transformers for High-Resolution Image Synthesis. 2021(CVPR). arXiv:2012.09841. 用于核对将图像转为离散表示并通过Transformer生成的代表方法。https://arxiv.org/abs/2012.09841
第6章 一个答案,怎样才算有根据
样章 v0.1 | 2026年9月20日
第二十五枚硬币会怎样
设想你看到这样一段短视频:一张折成连续折纹的纸,搭在两摞书之间。有人把硬币一枚一枚放到纸桥上。十枚,二十枚,二十四枚……画面到这里结束,桥没有塌。
转发时,有人配了一句话:“一张A4纸最多能托住24枚硬币,照这样折就一定能成功。”
这个结果很有意思,你也想试一试。不过,“已经托住24枚”和“最多只能托住24枚”,说的是同一件事吗?视频里没有放上第二十五枚,是因为纸桥已经到了极限,还是因为手边只有这么多硬币?两摞书之间的距离,又有没有影响?
上一章,我们研究AI怎样生成内容,知道同一份材料可以有不同表达,也可能被补上原本没有的细节。这一章继续往前走:遇到一个值得弄明白的问题,怎样找到资料、看懂资料,并让AI帮助我们形成有根据的回答?
我们将围绕纸桥阅读几份短材料,先形成一个回答,再加入新的记录,看看哪些说法可以保留,哪些需要修改。整个练习用文字就能完成。你也可以把本章的方法带回第1章留下的问题,继续寻找答案。
学完本章,你将能够:分清模型生成、搜索与资料提供各自的作用;从材料中找出支持一句话的依据;解释检索怎样与生成配合;比较不同记录的条件;把已经确认、仍有疑问和暂时不知道的内容说清楚。
6.1 分清回答来自哪里
6.1.1 模型生成、搜索结果与提供的资料
向AI询问纸桥能托住多少枚硬币,它可能很快给出一个数字,也可能先询问纸张、折法和支撑距离。阅读回答以前,可以先看看:这次回答能够参考什么?
第5章讲过,语言模型会利用训练形成的能力,结合当前输入生成内容。你只输入“一张纸能托住多少枚硬币”,模型能够调用已有的语言与知识关联,解释相关因素,提出试验建议。但是,没有看到那次试验的记录,它就缺少判断现场具体情况的直接材料。[1]
模型可以先帮我们解释问题、提出观察方向;现场用了什么纸、放到哪一枚停下来,则需要查看相应记录。
有些AI应用能够调用搜索工具,先到外部寻找资料,再将找到的内容交给模型组织回答。这样,模型就有机会参考本次检索得到的信息,包括训练之后才发布的内容。能不能做到,要看应用是否具有并实际使用了相应工具。[2]
搜索本身也有一个过程。以网页搜索为例,搜索系统会发现网页、处理和整理内容,在收到查询后返回相关结果。它能够找到哪些页面,受到收录范围、访问条件和查询方式等因素影响。没有出现在搜索结果中的内容,仍然可能存在。[3]
第三种常见情况,是由我们直接提供资料。你把一次试验记录贴到对话中,模型便可以根据这段文字回答。这时,资料不必已经在互联网上公开,也不必先被写入模型参数。
| 本次怎样获得可参考的信息 | 对纸桥问题有什么帮助 | 还需要留意什么 |
|---|---|---|
| 利用模型已有能力回答 | 解释问题、提出可能影响结果的因素 | 是否缺少这次试验的具体记录 |
| 先搜索,再组织回答 | 寻找公开记录和相关说明 | 找到了什么,原文是否支持回答 |
| 直接提供记录再提问 | 围绕指定材料阅读、比较和归纳 | 材料是否完整,归纳是否改变原意 |
这三种情况可以出现在同一次回答中。例如,模型阅读你提供的记录,再搜索一个相关概念,最后综合信息生成文字。使用的资料可能来自不同地方。
因此,核对时要落实到具体句子。“纸张形状可能影响承托表现”是一种需要知识解释的说法;“视频里的纸桥托住了24枚”则是在描述某次试验。它们需要的依据不同。
把链接放进对话后,还要看看应用是否真正读取了网页。没有网页读取能力时,可以直接提供相关短文;AI自称“已经查证”时,也要看它给出了什么可查看的依据。
停下来想一想:你想知道自己昨天做的纸桥用了几枚硬币,而记录还在自己的笔记本里。AI能够直接知道这个数字吗?它可以先帮你做什么,你又需要补充什么?
6.1.2 看起来合理与得到证实
“纸很薄,所以一定托不住硬币”听起来有理由;“把纸折起来就能托住很多硬币”也可能让人觉得有道理。要说明某次试验究竟发生了什么,我们需要更具体的信息。
先读两份材料。以下是本章使用的纸桥试验示例。
材料A:第一次试验记录
① 用一张A4纸折成连续的折纹,搭在两摞等高的书之间。两摞书内侧相隔10厘米,纸桥两端放在书上,没有用胶带固定。
② 将同一种硬币逐枚放在桥面中部的一小片区域。放到24枚时停下,纸桥仍托住这些硬币。
③ 手边准备的硬币已经放完,没有继续加放。当天只进行了这一次试验。
材料B:根据第一次记录写成的转发配文
一张普通A4纸折一折,最大承托数量就是24枚硬币。任何人照着做,都能达到这个结果。
材料B根据材料A改写,没有增加新的试验。两份材料都出现了“24枚”,但它们表达的意思有差别。
材料A交代了观察结果、停止原因和试验次数。材料B却把“放到24枚时停下”变成了“最大数量是24枚”,又把“一次试验”变成了“任何人都能达到”。这些新增判断,需要额外的依据。
我们把信息从哪里取得称为来源。来源可以是一篇文章、一份原始记录,也可以是一张照片、一段录音。某项材料中能够支持或反驳一个具体说法的内容,就是我们判断这个说法时所用的证据。
来源与证据之间,需要通过问题联系起来。材料A能说明当时怎样摆放纸桥,也能说明放到24枚时的情况。它没有记录第二十五枚会怎样,因此,不能据此确定最大数量。
| 想写进回答的话 | 材料A能否支持 | 理由 |
|---|---|---|
| 这次纸桥托住了24枚同一种硬币 | 能,在记录所述条件下 | 第②句写明了数量和观察结果 |
| 这座纸桥最多只能托住24枚 | 还不能 | 第③句说明停止后没有继续加放 |
| 换一张纸,任何人都能得到相同结果 | 还不能 | 只记录了一次试验,没有提供不同人的重复结果 |
“还不能支持”也有明确含义:目前的材料不够。它既不能把一个说法变成已经证实的事实,也不自动说明这个说法已经被证明是假的。
换一个例子,如果有人说“第一次试验把纸桥用胶带粘在书上”,这就与材料A第①句“没有用胶带固定”直接不符。若我们暂按这份记录讨论,就应当指出这一处矛盾。它与“没有测出最大数量”属于不同情况。
还有一个层次需要记住:准确转述一份记录,与确认记录描述的事情确实发生过,也有区别。本章先用所给材料练习阅读和判断;研究实际事件时,还要看记录由谁完成、怎样形成,必要时查看原始照片、完整视频或重复观察。
让结论与掌握的依据相称:材料写了什么,清楚转述;材料没有解决的部分,先保留问题。
现在写一句自己的回答:只根据材料A,你准备怎样告诉一个想试做纸桥的人,这次试验已经说明了什么?尽量保留有用结果,也保留重要条件。
6.2 让AI依据资料回答
6.2.1 寻找相关内容并提供给模型
手头有材料,接下来就可以与AI一起阅读。先不要把“你觉得对不对”作为唯一问题,试着把需要查清的事情问具体。
例如,我们要查的是:“材料B所说的‘最大承托数量就是24枚’,能否从材料A得到?”找到材料A第②、③句,就已经接近了这个问题的关键。
第②句告诉我们观察到了什么,第③句告诉我们观察到哪里为止。只留下第②句中的“24枚”,就会漏掉判断最大数量所需的重要信息。
开始本章的连续练习。打开AI对话工具,附上材料A和B,再提出下面这样的要求:
请根据这两份材料,回答:这次纸桥已经托住了多少枚硬币,能否据此确定它的最大承托数量?请指出依据的材料和原句。材料没有说明的地方,直接说明还缺什么信息。
先读它给出的结论,再对照你在上一节写的那句话。它有没有找到“没有继续加放”?有没有保留“两摞书相隔10厘米”这个条件?这次主要观察资料与回答之间的关系,不需要增加其他功能。
你刚才从材料中寻找与问题有关的内容,这个过程可以称为检索。在少量文字中,人可以直接阅读查找;材料多起来时,程序能够帮助完成这项工作。
例如,一个应用保存了许多试验记录。收到“这座纸桥的最大承托数量是多少”这个问题后,它先寻找有关这座纸桥的段落,再把这些段落连同问题一起交给模型,模型据此组织回答。
把检索得到的资料与模型生成结合起来,是检索增强生成(retrieval-augmented generation,RAG)的基本思路。资料为当前回答提供可参考的内容,模型利用已有能力阅读、联系和表达这些内容。[4]
可以沿着一条基本路线理解它:
提出问题 → 找到相关资料 → 将问题与资料交给模型 → 生成回答 → 对照原文检查
查找决定哪些材料进入回答,生成负责利用和组织材料,检查则帮助判断结果是否有根据。实际应用也可能在资料不足时继续查找。
本章手动选择并提供材料,帮助我们看清这些环节。一个能够自动检索的应用,还需要程序完成查找等工作;本章暂不要求搭建。
材料多了,程序怎样找?
一种做法是寻找关键词。例如,查找“纸桥”“硬币”“24”,能够把范围缩小。具体名称、型号和编号也常适合用文字匹配查找。
另一种做法是比较意思。问题写着“能撑住多重”,记录写着“放上硬币后仍未塌”,用词不完全相同,内容却可能有关。
第5章介绍过用一组数表示文字。检索中可以使用经过训练的表示模型,把问题和段落分别转换成可以互相比较的向量,再寻找数字表示较接近的内容。这种方法有助于找出用词不同但意思相关的材料,通常称为向量检索。有些系统把它与关键词检索结合使用。[5]
这里得到的是“可能相关的材料”。一段话说“托住了24枚”,另一段说“没有托住24枚”,都与纸桥和硬币有关,表达的事实却相反。找到相似内容之后,还需要认真阅读它究竟说了什么。
为了便于检索,较长文件可以按段落或内容分成小段,并保留文件名称与原文位置。模型一次能够处理的输入有长度限制,检索能够帮助选择当前需要的部分,而不必每次提供全部资料。[6]
分段时也要保留关系。把“放到24枚时停下”与“没有继续加放”拆开后,如果只取回前半部分,模型就少了一项重要条件。表格中的数值也需要连同表头、单位一起读取。[6]
应用中所说的“知识库”,常常包括经过整理、能够查询的一组资料,以及帮助查找它们的信息。把文件加入知识库,可以改变应用能够查到什么;在普通检索问答过程中,这通常不等于重新训练语言模型。[1][6]
更新资料,改变了本次能够查到的内容;微调等训练方法则会调整模型参数。第5章讲过的区别,在这里仍然适用。
为什么找到了资料,还要检查?
因为一份相关材料可能漏掉条件,也可能本身写错;模型在组织回答时,还可能遗漏、误读或扩大原意。检索为回答提供依据的机会,是否真正用好了这些依据,要看具体结果。[2][7]
回到纸桥问题:无论材料是自己找到的,还是程序自动找到的,我们最终都应当能回到“放到24枚时停下”和“没有继续加放”这两句话,解释结论是怎样形成的。
6.2.2 对照原文检查回答与引用
AI可能在回答旁边标出材料名称,也可能提供网页链接。这样的标注帮助读者找到内容的出处,通常称为引用。
引用可以帮助我们核对,但需要真的走回原文。研究生成式搜索时,人们会分别检查两件事:回答中的重要说法是否有相应依据,以及所列引用是否确实支持旁边那句话。两方面都需要看,不能只数引用有几条。[7]
先看一段示例:
这次试验中,两摞书内侧相隔10厘米,折叠纸桥托住了24枚同一种硬币。记录者因准备的硬币已经放完而停止,没有继续加放,因此现有记录没有确定它的最大承托数量。(材料A,第①—③句)
回到材料A,可以分别找到这段回答中的条件、观察结果和停止原因。
其中“没有确定最大承托数量”是根据记录作出的判断。原文不必逐字写出这句话,但我们能够解释理由:停止是因为硬币放完,后面没有继续测,因而还不知道再增加会怎样。
有依据的回答允许归纳和推理。读者应当能看清,怎样从记录走到结论,中间有没有加入未经确认的前提。
检查你刚才得到的回答。从中选两三句最重要的话,分别找到原材料中的对应位置。先检查数字和试验条件,再检查“最多”“一定”“所有”等会改变结论范围的词。
例如,“24枚时仍托得住”改写为“这次已经托住24枚”,保留了观察的意思;改写为“最多24枚”,则需要知道第二十五枚以及后续试验的情况。字数相差不多,结论的范围已经变化。
直接摘引原句时,要保持文字准确。用自己的话转述时,可以调整句式,但“没有”“只做了一次”这样的条件不能随意省去。引用范围也要合适,不能把一句话附近并未提到的判断一并归到原文名下。
如果回答把材料B作为“任何人都能成功”的依据,应该继续追问:这份配文增加了新的观察吗?前面已经说明,B只是根据A改写。它能证明有人这样表述过,却没有新增足以支持普遍结论的试验。
原文是网页时,怎样核对?
先打开实际页面,找到相关段落,连同前后文一起读。搜索结果中的标题和摘要适合帮助定位,原文能够提供更多条件和说明。[3]
若页面没有打开,就不要写成已经读过。可以继续寻找同一资料的其他公开版本,或者暂时说明原文还没有核实。只有标题、网址或另一段AI概括时,应当据实际读到的内容作出判断。
还要看这份资料在回答什么问题。介绍一类纸桥的科普文章,可以帮助理解折叠结构,却不能代替某位同学那次试验的记录。记录发生在什么时候,描述的是哪个对象,也可能影响它能支持什么。
对于实际引用,可以记下资料名称、作者或发布机构、日期,以及页码或链接。信息够用即可,目的是让自己和别人能够回到同一处内容。本章的示例材料用字母和句子编号定位,就已经能完成这项练习。
如果发现回答漏掉了条件,可以向AI指出具体位置:“材料A第③句说没有继续加放,请据此检查‘最大数量’这个判断。”读完修改,再回到原文核对。若原回答已经准确,就保留,并说明你核对过什么。
6.3 面对不确定的信息作出判断
6.3.1 比较不同来源,寻找支持与反对的证据
现在加入一份新材料,继续纸桥的讨论。
材料C:第二次试验的补充记录
① 第二天,另取同一包中的一张A4纸,照第一次的方法折叠。两摞书内侧的距离改为20厘米,其他摆放和放硬币的方法尽量与第一次相同。
② 继续使用同一种硬币。放到8枚时,纸桥仍托住硬币;放上第9枚时,纸桥塌下。
③ 这次也只做了一次,没有继续安排其他试验。
第一次托住24枚,第二次放上第9枚就塌了。仅看两个数字,很容易说“它们相互矛盾”。把条件并排放好,再想一想。
| 比较的内容 | 第一次:材料A | 第二次:材料C |
|---|---|---|
| 两摞书内侧的距离 | 10厘米 | 20厘米 |
| 仍托住硬币时记录的数量 | 24枚 | 8枚 |
| 这次怎样结束 | 硬币放完,主动停止 | 放上第9枚时纸桥塌下 |
| 记录的试验次数 | 一次 | 一次 |
两份记录描述的条件不同,也没有采用相同的结束方式。这些数字可以同时出现在各自的记录中,不能仅因不同,就认定其中一份记录有误。
材料C也没有使材料A失效。它写的是另一次试验,为理解条件变化增加了信息。第二天的记录更晚,并不意味着应当删除前一天发生的事情。
由这两份材料,我们可以提出一个值得研究的想法:书之间的距离改变,可能影响纸桥表现。要进一步判断影响有多大,需要尽量保持纸张、折法、放置方法等其他条件一致,并进行更多次比较。仅凭各一次记录,还不能把全部差别都归到距离变化上。
算一算,再解释:24÷8=3。这个算式能否说明,第一次纸桥的最大承托数量是第二次的3倍?
计算本身没有问题,但这里比较的是两份记录中“仍托住硬币时的数量”。第一次根本没有继续测出极限,所以不能把这个比值直接称为两种条件下最大承托数量的比值。读懂数值的含义,和算出结果同样重要。
让AI重新比较。在原来的对话中加入材料C,再问:
现在有了第二次记录。它与第一次是否矛盾?请比较两次的条件和结果,再修改原来的回答。仍然无法确定的地方,请具体说明。
查看它是否保留了第一次的有效信息,是否注意到距离变化,也看看它有没有把“可能影响”说成“全部由此造成”。这里观察实际回答即可,不需要让模型必须出现某种错误。
从不同记录走向更广泛的资料
查找其他问题时,同样要比较资料的对象、时间和条件。两份说明谈的是不同型号,两个试验采用不同材料,两个数字来自不同的计数范围,都可能造成表面上的不同。
若资料确实对同一件事给出相反说法,可以查看原始记录是否有抄写错误,寻找完整视频,或向记录者询问。暂时找不到解释时,先写明分歧和各自依据,不必强行合成一个确定结论。
还要留意资料之间是不是独立。材料B来自A;即使B又被转发到十个页面,这十个页面也没有增加十次试验。多次转述可以扩大传播范围,却不能单靠数量证明原结论。
可以请AI帮助整理资料之间的关系,随后打开来源检查。让AI再生成一个同意你的回答,也没有增加独立观察。
寻找证据时,可以主动问:“什么材料可能改变我现在的想法?”如果我们原先想证明“每个人都能达到24枚”,第二次未达到这一数量的记录就值得认真阅读。它帮助我们检查结论是否说得太满,而不是妨碍作品展示。
看到陌生页面时,可以查查发布者是谁,再找其他可靠资料比较。判断仍要落到具体记录与方法上,不能只凭排版、名称或转发量。
照片和视频也要这样读
纸桥照片可以帮助查看当时的摆放,完整视频可以提供时间顺序。但画面之外仍可能有我们没有看到的部分,标题也可能增加图像没有表达的结论。一张显示纸桥上放着硬币的照片,不能单独说明它此前怎样搭成、此后最多还能放多少。
第5章学习过生成图像。仅靠“看起来很真实”或“某处有一点奇怪”,都不足以完成来源判断。更有用的做法是寻找原始发布、完整画面、拍摄说明和相关记录,再比较它们是否支持同一说法。
有些图片或视频能够附带可验证的来源与修改记录。例如,内容凭证可以帮助检查某些来源信息和修改历史。这样的技术能提供线索,但凭证本身不能保证画面所配的每一句解释都正确;没有凭证,也不能直接断定图片是假的。[8]
6.3.2 区分已经确认、尚有疑问与暂时不知道
经过前面的阅读,我们不必只在“全部相信”和“全部不信”之间选择。一个回答可以同时包含已经有依据的内容、值得进一步研究的解释,以及尚未取得答案的问题。
第一次托住24枚、第二次放上第9枚时塌下,都是材料写明的观察结果。距离变化与结果变化之间的关系,还需要更多比较;第一次的最大承托数量,也没有测出。可以把它们分开表达:
| 当前能够怎样表述 | 纸桥材料中的例子 | 下一步可以做什么 |
|---|---|---|
| 根据记录可以确认 | 第一次在所述条件下托住24枚 | 介绍结果时保留条件与来源 |
| 有线索,仍需验证 | 距离变化可能影响表现 | 尽量控制其他条件,进行重复比较 |
| 材料尚未给出答案 | 第一次究竟最多能托多少枚 | 补充相应试验或寻找完整记录 |
这种区分针对每一项说法。新材料出现后,我们可以改变判断,并说明理由。
表达不确定性,也不必在所有句子前面加“可能”。原记录已经写清的事实,就清楚转述;不能确认的地方,具体指出缺少什么。
比如,“可能是24枚吧,也许不一定”让人难以继续使用。写成“记录显示已托住24枚,但随后没有继续加放,最大数量尚未测出”,读者就知道哪些内容可用、哪些仍待检查。
如果AI给出“我有90%的把握”,先不要把这个数当成已经测得的准确率。除非能够说明它来自怎样的计算或检验,否则它仍不足以替代原始材料。第3章的实际测试比例、第5章某一步的候选概率,与一句回答中的自报把握,需要分别理解。
完成本章的回答
现在,请给准备试做纸桥的同学写一小段说明。可以参考AI的整理,用自己的话交代:已经观察到什么,哪些条件值得注意,还有哪一个问题需要继续尝试。下面是一段示例:
材料A记录了一次成功托住24枚同一种硬币的试验:折叠纸桥两端放在书上,两摞书内侧相隔10厘米。试验在硬币放完时停止,所以还没有测出最大数量。材料C把距离改成20厘米,记录了放上第9枚时塌下的情况。两次条件不同,不能只比较数字就认为记录相互矛盾。试做时可以参考这些安排,同时记录自己的条件与结果;想弄清最大数量或距离的影响,还需要进一步试验。
这段话保留了第一次的发现,也说明了新记录带来的问题,为继续尝试提供信息。
把它与你最初写的那句话比较。你增加了哪个条件?改掉了哪个说得过满的词?哪一项原先的判断在核对后仍然成立?选一处写明理由即可。
保留最终说明、对应的材料位置和一项修改理由,就完成了本章基本练习。主要成果是一段有根据、能让别人接着探索的回答。
把方法带到自己的问题中
从第1章的问题或自己的作品中,选择一项值得确认的具体说法。它可以很小,例如某次测试是否已经达到目标,一种材料是否适合某种用途,或者一幅作品介绍中的数字来自哪里。
先写清要确认的那句话,再寻找能够直接回答它的资料。可以用自己的观察记录、说明书、公开资料或相关研究。请AI帮助整理和比较,随后亲自核对影响结论的关键位置。
不需要为了显得严谨,把每一项常识都查成一份长报告。检查的深度应当与使用目的相配。课堂中的低风险小尝试,可以边做边记录;会影响他人安全或重要决定的内容,则需要更可靠的材料和具备相应知识的人进一步确认。
也不必因为暂时不知道,就停止创造。我们可以先完成有把握的部分,把新想法写成待试验的方案,再通过实际观察增加知识。未知之处说明了下一步往哪里走。
本章开头,画面停在第二十四枚硬币。认真阅读以后,我们能够把“已经发生”与“还想知道”分开,也能提出一个更好的问题:第二十五枚会怎样?怎样试,才能让下一份记录比这一份多告诉我们一点?
本章回望
一个答案有没有根据,要回到它说了什么、参考了什么,以及这些材料怎样支持结论。
模型可以利用已有能力解释问题,也可以结合搜索结果或我们提供的资料回答。搜索帮助寻找,资料提供内容,模型完成阅读与表达;这些作用可以配合,仍然需要检查具体结果。
检索增强生成把寻找资料与模型生成联系起来。关键词、文字的数字表示和文件分段,都可以帮助从许多材料中找到相关内容。找到以后,还要保留重要条件,检查回答与原文的关系。
纸桥的几份材料让我们看到:24枚是一个观察结果,最大数量是另一个待回答的问题。转述可能扩大原意,不同条件可能得到不同记录,后来的材料也可能帮助我们提出新的问题。
有根据的回答既能保留已经取得的认识,也能说明还有什么不知道。它让自己和读者继续思考、试验和修改。
下一章,我们将更主动地运用文字、图像和声音,把关心的内容做成作品。本章形成的习惯会继续发挥作用:真实介绍保留依据,创作设想说清性质,让别人能够理解我们的表达与选择。
练习与继续探索
1. 分清回答怎样形成。AI解释“为什么要记录纸桥的摆放条件”,与AI回答“我昨天放了多少枚硬币”,分别需要什么信息?先搜索再回答、直接提供记录再回答,怎样与模型已有能力配合?
2. 给一句话寻找依据。只看材料A,判断下面三句话分别与材料是什么关系:“第一次托住了24枚”“第一次用胶带固定纸桥”“第一次最多只能托住24枚”。指出对应原句,区别有依据、与材料不符和依据不足。
3. 看懂检索与生成。应用收到纸桥问题后,先找记录,再把记录交给模型回答。哪一步属于检索?为什么找到一个反复出现“纸桥、硬币、24”的段落,还不能保证它能支持结论?把新记录加入可查询资料,是否等于重新训练模型?
4. 检查一次引用。一段回答写道:“任何人照着做都能托住24枚,参见材料B。”引用确实指向了这句话,为什么仍然不足以证明它?若要继续研究,还需要什么材料?
5. 比较数字背后的条件。根据材料A和C,说明24÷8=3为什么不能直接解释为两次最大承托数量之比。第二份记录出现以后,第一份记录中的哪些内容仍然有效?
6. 为下一次探索留下问题。回看最终说明,选一项暂时不知道的内容,提出一种能够增加依据的做法。也可以换成自己的作品或第1章的问题,说明准备找什么资料、做什么观察,以及新结果可能怎样改变判断。
本章资料来源
[1] Google for Developers. LLMs: Fine-tuning, distillation, and prompt engineering. 用于核对利用现有参数处理输入,与通过训练调整参数的区别。访问日期:2026-09-20。https://developers.google.com/machine-learning/crash-course/llm/tuning
[2] Google Cloud. Grounding overview. 用于核对将模型输出与可核验外部资料联系起来,以及搜索与自有资料的不同接入方式。访问日期:2026-09-20。https://cloud.google.com/vertex-ai/generative-ai/docs/grounding/overview
[3] Google for Developers. In-depth guide to how Google Search works. 用于核对发现网页、建立索引、返回相关结果及搜索覆盖范围,不将检索结果视为对全部信息的穷尽。访问日期:2026-09-20。https://developers.google.com/search/docs/fundamentals/how-search-works
[4] LEWIS P, PEREZ E, PIKTUS A, et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. 2020. arXiv:2005.11401. 用于核对检索外部材料与语言生成相结合的基本思路。https://arxiv.org/abs/2005.11401
[5] Microsoft Learn. Vector search in Azure AI Search. 用于核对问题与资料的向量表示、相似性检索,以及与关键词检索结合的基本方法。访问日期:2026-09-20。https://learn.microsoft.com/en-us/azure/search/vector-search-overview
[6] Microsoft Learn. Retrieval-augmented generation (RAG) in Azure AI Search. 用于核对检索问答的组成、资料分段、输入长度与相关内容选择;不要求学习具体产品配置。访问日期:2026-09-20。https://learn.microsoft.com/en-us/azure/search/retrieval-augmented-generation-overview
[7] LIU N F, ZHANG T, LIANG P. Evaluating Verifiability in Generative Search Engines. 2023. arXiv:2304.09848. 用于参照回答是否有依据、引用是否支持对应陈述的核对方法;正文不沿用该研究中的历史产品表现或统计值。https://arxiv.org/abs/2304.09848
[8] C2PA. C2PA and Content Credentials Explainer, version 2.2,3、7.1.2、7.2.2节等。用于核对内容来源与修改记录的作用,以及这类记录不能单独保证内容事实正确的限制。访问日期:2026-09-20。https://spec.c2pa.org/specifications/specifications/2.2/explainer/Explainer.html
第三单元 与AI共同创造:从表达走向作品与行动
第7章 与AI一起创作和设计
样章 v0.1 | 2026年9月21日
那块补丁,要不要留下
设想你准备介绍一只用过很久的笔袋。它的一个角磨破了,后来补上一块蓝布。蓝布与原来的颜色不同,针脚也有些不齐。
你拍了张照片,想请AI帮忙做成一页作品。它可能建议把背景收拾得干净一些,让笔袋放在画面中央,再配上醒目的标题。也可能提出:把布面上的旧痕和针脚一起修整,图片会更整齐。
可是,你看着那块补丁,犹豫了一下。别人也许把它看成需要修掉的地方,你却正想让人看见它。原来,这页作品要讲的是一次修补,以及修补后仍然继续使用的日常。
背景可以怎样处理,标题应该写什么,补丁在画面中占多大位置,都与这件事有关。AI能够帮助构思和制作;你需要逐渐想清楚,什么值得留下,怎样才能把它讲给别人。
前几章,我们学习了表达、感知、生成和核对。本章把这些认识带进一次创作:选一个关心的主题,比较不同表达,完成一页图文作品。你也可以选择一段简短的声音作品,不必同时制作所有形式。
笔袋只是贯穿讲解的例子。自己的小作品、一处熟悉的变化,或者一件让你想继续追问的事,都可以成为创作的起点。
学完本章,你将能够:从具体材料中选择主题;考虑作品给谁看;与AI比较不同方案;让文字、图像或声音相互配合;根据实际阅读效果修改作品,并说明自己的选择与材料来源。
7.1 找到自己想表达的内容
7.1.1 从经验、兴趣和观察中选择主题
面对一个空白页面,容易先问:“我该做什么?”如果直接让AI回答,它可能给出许多题目。读过一遍,我们仍然需要判断:哪一个与自己有关,手头有什么可以讲?
可以先从已经留下的材料找起。第2章的观察记录、第3章的一次模型测试、第6章尚未解决的问题,都可能继续发展。也可以暂时关上对话窗口,看看身边有什么东西,让自己愿意多看一眼。
这次选中的是一只笔袋,围绕它可以讲的事情却有很多:怎样安排内部空间,一次修补怎样完成,为什么一直愿意使用它,或者希望下一只笔袋增加什么功能。
作品集中表达的主要意思,可以称为主题。主题帮助我们选择材料,也帮助读者理解这些材料为什么被放在一起。
下面是一份可用于练习的材料:
这是一只灰色布笔袋,边角磨破后,补上了一块蓝布。补丁颜色与原来的布面不同,四周的针脚有些不齐。补好后的第二天,我把常用的几支笔放回里面,带它上课。我想保留那块蓝色,让人看出这里经过一次修补。
从这份材料出发,可以把主题写成:“让别人看见,一件日常物品怎样带着修补的痕迹继续被使用。”它比“旧物改造”更具体,能够帮助我们判断后面的选择。
例如,放大补丁,是在突出修补;把笔袋放回书本旁边,是在表现继续使用。若把针脚全部处理成看不见,可能会削弱这次表达最在意的内容。
主题也可以从兴趣和想象中产生。你想设计一个不同的笔袋,让每支笔的位置一眼可见,就可以画出设想,并说明它打算解决什么问题。想象中的结构可以大胆尝试,完成后再区分已经做出的部分和仍待试做的部分。
有时,我们还没有形成一句完整的主题,只有一个细节:一块颜色不同的布,一次意外成功的试验,一段反复听到的声音。可以先保留它,再追问:“我为什么想让别人注意这里?”
开始自己的创作。选一件愿意介绍的事物,或一段想讲述的经历,留下几句话、一张照片或一小段录音。再写一句:这次我最希望别人注意到什么?
不必把题目一下放得很大。讲清一次选择,表达一种感受,或者提出一个自己真正在意的问题,都可以形成作品。主题的范围小一些,往往更容易找到可以认真展开的细节。
也不要急着让AI替自己补齐所有背景。没有留下修补前的照片,就可以用文字说明此前的情况;想象一段故事时,则让读者知道是在讲一个设想。第6章关于依据的认识,仍然能够帮助我们守住材料与表达之间的联系。
7.1.2 考虑作品给谁看、希望带来什么
主题逐渐清楚以后,还要想一想:谁会看到这件作品?他原来知道什么,可能会关心什么?
把笔袋交给一个想学习缝补的人,他可能最想看针怎样走、布怎样固定。把它介绍给第一次看到的同学,对方可能先问:“为什么补丁用了另一种颜色?”
这两种关注点都合理,却会带出不同作品。修补说明需要清楚的过程与细节;一次日常经历的介绍,则可以从补丁的颜色和继续使用的动作展开。
这里的表达对象,指我们主要想与之交流的人。他不一定是一个统计出来的群体,也可以就是身边某位尚不了解这件事的人。
还要考虑观看的情境。展板前匆匆经过的人,可能先看到标题和大图;愿意点开一页作品的人,可以继续读一小段说明;选择听声音的人,则需要跟着时间顺序接收内容。
不必要求作品让所有人都产生同一种感受。我们能够做的是提供清楚的内容、选择合适的形式,并了解别人实际接收到了什么。
笔袋例子的创作方向,可以先这样确定:
我要做一页图文作品,给没有见过这只笔袋的同学看。希望他们先注意到蓝色补丁,再读到修补后继续使用的经历。我想保留针脚和布面的旧痕,文字简短一些,让人能够停下来看看。
这段话说明了谁来看、主要讲什么、希望突出哪些细节,以及准备做成什么。它已经足以帮助我们开始,不必再增加一套复杂表格。
现在补充自己的主题。把“准备给谁看”与“希望他注意什么”写在一起。再看看手头材料是否够用:要讲的部位能否看清,要说的经历有没有记录,还需要补拍、重听或询问什么?
还可以找一位接近表达对象的人,问一个具体问题。例如:“看这只笔袋,你最想知道哪件事?”对方可能注意到我们没有想到的地方。了解他人的真实想法,是设计中值得保留的一步。[1]
本章仍以一件小作品为范围。选择图文,就完成一页能够阅读的内容;选择声音,就完成一段能够听懂的表达。不同形式可以以后再扩展。
7.2 探索不同的表达方式
7.2.1 借助AI提出和比较不同方案
同一份材料,可以有不同讲法。先比较几个方向,再决定采用哪一个,能够避免刚出现一个想法,就把全部精力花在装饰上。
设计中常把这种过程理解为:先打开可能性,再逐渐作出选择;做出初步结果以后,根据观察继续调整。[1] 本章只需比较两个有实际区别的方向,不要求生成一长串方案。
打开AI对话工具,附上刚才的材料和创作方向。可以提出这样的要求:
我想用这份笔袋记录做一页图文作品,给没有见过它的同学看。请提供两种不同的表达方案:一种让人先看到修补的细节,另一种从继续使用的日常展开。
每种方案写一个标题,说明主要图像放什么、文字怎样安排。只提出构思,先不生成完整页面。请指出它们分别突出了什么、可能少表达什么。
这里比较的应当是内容和观看方式的区别。仅把同一张图换两种边框颜色,通常还没有改变主要讲法。
下面是两种方案的示例:
| 比较的内容 | 方案一:从细节进入 | 方案二:从日常进入 |
|---|---|---|
| 标题 | 这块蓝色,我想留下 | 第二天,它又回到书包里 |
| 主要图像 | 笔袋与补丁的近景,保留一部分整体轮廓 | 笔袋放在书本旁,露出补丁和常用的笔 |
| 文字安排 | 先说原来的破损,再说为何保留不同颜色 | 先说第二天继续使用,再回到此前的修补 |
| 需要留意 | 裁得过近,读者可能不知道这是什么 | 画面东西过多,补丁可能被忽略 |
先读标题,再想象图像。第一种把一次选择放在前面,第二种把继续使用的动作放在前面。它们没有天然的高下,要看我们更想把读者带到哪里。
你也可以不采用AI提出的任何一种。它的回答也许使你意识到:真正想讲的是“第一次自己动手修补时的犹豫”,于是需要补充新的材料,重新构思。交流帮助我们发现方向,方向可以继续变化。
把方案画得足够简单。在纸上画两个小长方形,用一个方框表示图片的位置,用两三条线表示文字。标出标题,再写下图中最重要的细节。这样的简略安排称为草图,它能让想法变得可以比较。
此时不需要先找齐字体和装饰。看草图,已经可以问:读者从哪里开始?重要细节看得见吗?他读完标题以后,能否在图文中找到相应内容?
借助AI继续讨论时,追问也要具体。例如:“第一种方案能突出针脚,但可能看不出是笔袋,怎样保留一点整体?”它可以提出放宽画面、增加小图或补上一句说明等办法,再由你挑选。
第5章解释过,同一个模型可以生成不同结果。作品方案增加以后,我们有了更多可比较的对象;仅凭重复生成的次数,还不能判断哪个更符合自己的目的。
因此,比较以后最好写下一句暂时的选择。例如:“我先采用第一种,因为这次想突出那块不同颜色的补丁;画面同时保留拉链和袋口,让人能够认出笔袋。”
“暂时”意味着可以修改。先作出有理由的选择,才能进入制作,看到纸上设想与实际效果之间的差别。
继续自己的练习。把两种方案并排放好,选出一个准备制作的方向。指出你最希望保留的一项特点,以及需要处理的一处不足。
7.2.2 组织文字、图像与声音
方案选定以后,需要把材料组织成能够被阅读或听见的作品。先想清楚每一种材料起什么作用,制作就会有方向。
在笔袋例子中,图像可以展示蓝布与原有布面的颜色差别,文字可以解释修补与继续使用的经历。如果加入声音,语气和停顿还能带来另一种表达节奏。
这些作用可以互相补充。文字不必把图中每个东西都念一遍,图像也不必只做文字周围的装饰。
先确定图像让人看见什么。
把主体和其他内容放在画面中的什么位置,常称为构图。同一只笔袋,既可以放得很小,让人看到周围的日常环境;也可以靠近一些,让补丁和针脚成为主要内容。
按照前一节的选择,我们先让补丁容易看见,同时保留拉链与袋口。太远时,针脚看不清;太近时,笔袋可能变成一块无法辨认的布。可以从同一张照片试着裁出两个范围,再比较。
这里就用到了第4章关于图像尺寸的知识。假设照片宽1200像素、高800像素,宽和高都缩小一半,就得到600×400像素,物体的比例保持不变。
如果直接把它拉成600×600像素,宽高的缩放程度不同,笔袋会显得比原来更高。若先把原图裁成800×800像素,再等比例缩到600×600像素,物体比例不变,但两侧有一部分内容不再出现在画面中。
因此,缩放、拉伸和裁剪会带来不同结果。安排图片时,需要看重要内容有没有被截掉,也要看物体是否变形。作品需要正方形图片时,还可以保留完整横图,在上下留出空白。
配图可以使用自己的照片或手绘图。若选择AI生成插画,可以先说明主体、关键细节和表现方式,例如:
画一幅用于说明构思的简洁插画:一只灰色布笔袋,边角有一块蓝色补丁,补丁四周能看见不完全均匀的针脚。画面保留笔袋的袋口和拉链,背景简单。先不要加入标题和其他文字。
这是一幅按描述生成的插画。它可以帮助表达设想,却不能代替某只笔袋的实物记录。要讲自己的真实经历,配上实际照片、手绘观察图和相应说明,也能完成作品。
让AI改局部,也要说明哪些内容需要保留。
有时,主体已经合适,只想调整背景。支持局部编辑的图像工具,可以结合原图、选定的区域和文字要求,重新生成指定部分。这类操作通常称为局部重绘(inpainting);具体支持方式要看所用工具。[2]
可以把任务说成:“简化笔袋外面的背景,保留笔袋轮廓、蓝色补丁和针脚。”能圈选范围时,先选背景,再提出要求。修改以后,对照原图检查:想保留的内容有没有一起变化?
也可以直接裁掉多余背景,不使用生成编辑。选择哪种方法,要看它能否达到当前目的。为了调整标题的位置,更适合在排版时移动文字,没有必要重新生成整张图。
这种局部修改还可以帮助我们比较选择。把“背景较满”和“背景简化”的两版并排看,补丁是否更容易被注意?其他重要信息有没有因此消失?修改是否有效,要看结果。
再让文字与图像相互补充。
标题让读者知道可以从哪里进入,正文补充图像不能直接告诉我们的经历,图注则帮助识别某个具体细节。它们可以长短不同,也不需要反复说同一句话。
下面是这页作品的文字部分示例:
这块蓝色,我想留下
笔袋的边角磨破后,我补上了一块蓝布。它与原来的颜色不同,针脚也有些不齐。
第二天,我把常用的几支笔放回里面,照常带它上课。拍照时,我想把这些针脚留在画面里,让人看见这只笔袋经过一次修补,又回到了每天使用的东西中间。
如果图片已经清楚展示了蓝色补丁,正文就可以把篇幅留给“第二天继续使用”和“为什么保留针脚”。标题中的“留下”指什么,也能在图文之间得到解释。
排版时,先用标题、一张主要图片和一小段正文组成一页。把相关内容放得近一些,让标题与正文有适当区别,再看看阅读顺序是否清楚。不要让花纹遮住字,也不要把说明缩小到难以阅读。
把自己的作品实际做出来。打开熟悉的文档、演示或排版工具,新建一页,放入选好的图片和文字,按照草图调整位置。照片不合适时可以换手绘图;暂时没有配图,也可以画一幅简单示意图,注明它表达的内容。
先保存一份初稿,再打开看看。对话中出现了一段排版建议,和一页真正能够打开的作品,是不同的结果。
如果选择声音,怎样安排?
声音作品按时间展开。听者还没有听到后半段时,无法像阅读一页图文那样,直接看到结尾。因此,可以先交代对象,再讲发生了什么,最后留下自己的想法。
笔袋的声音版本可以这样起草:
这是我每天带着的笔袋。它的一个角磨破了,后来多了一块蓝色补丁。针脚有些不齐,第二天,我还是把常用的几支笔放了回去。现在看见这块蓝色,我就会想起那次修补。
先自己读一遍,听听是否绕口,哪里需要停顿。可以请AI建议两种读法,例如平静叙述和轻快介绍;使用语音生成工具时,再根据实际效果调整语速、句子和停顿。
AI给出的朗读稿仍然是文字。选择声音作品时,要进一步自己录音或使用语音工具生成音频,并从头听完一次。稿中没有说清的内容,也不会仅因声音好听就自动变清楚。
若拉链声能够帮助听者进入场景,可以录一小段放在开头;若它遮住了第一句话,就应调整或省去。音乐与音效都需要有用处,安静同样可以是表达的一部分。
让不同观看条件下的人都能接近作品。
图像承担重要信息时,可以加上一句文字说明,例如“灰色笔袋的边角补着蓝布,四周针脚清楚可见”。网页中的图片也可以提供文字替代,帮助不能直接看清图像的读者获取相应信息。[3]
声音作品旁保留文字稿,可以帮助听不清或不方便播放的人阅读;若某个非语言声音对理解内容很重要,也应在文字稿中说明。[4] 这些安排让表达有更多到达读者的方式。
完成一页图文,或者完成一段声音及其文字稿,就可以进入下一节。本章不要求把同一主题同时做成图文、音频和视频。
7.3 完成体现自己选择的作品
7.3.1 说明采用与舍弃某种方案的理由
初稿做好以后,先回到开头那句话:这次最希望别人注意到什么?把作品放在旁边看一遍,它是否把那个重点带了出来?
笔袋作品中,补丁应当容易被看见,读者也应知道它与一次修补有关。如果图片很精美,却把针脚处理得完全消失,就需要重新考虑是否符合这次主题。
不过,选择不总是“保留细节”与“抹掉细节”这么明显。同样保留补丁,一张近景可能更突出针脚,一张较完整的照片可能更容易让人认出笔袋。我们需要在不同好处之间作出取舍。
可以这样解释:“我保留了稍远一点的照片。近景能看清线,却不容易看出物品是什么。现在仍能看到补丁,同时保留了袋口。”
这句话说明了目标、比较和选择,比“第二版更高级”更容易讨论。别人可以不同意,也可以提供一个新的办法。
请一个人实际看看。把作品交给一位还没听过你解释的人,先让他自行阅读或听完,再问:“你觉得这件作品主要在讲什么?哪一处最让你注意?有没有不清楚的地方?”
先听对方怎样说,不急着用长篇解释把他带到预定答案。若读者需要听完作者的额外说明才能理解,作品本身可能还缺少一项重要信息。
下面是可能遇到的情况,实际练习按真实反馈处理:
| 读者的反应 | 可以回看哪里 | 一种可能的调整 |
|---|---|---|
| “蓝色很好看,但我不知道这是笔袋” | 画面是否裁得太近 | 保留袋口,或加一句简短说明 |
| “这张像在介绍一只新商品” | 图片是否过度修整,文字是否像广告 | 恢复需要保留的细节,改用具体经历 |
| “我看懂了修补经过,但更喜欢整齐的针脚” | 对方是否已理解主要内容 | 可以保留原作,也可以继续交流偏好的理由 |
第三种反应很重要。读者理解了内容,却有不同审美,并不自动表示作品失败。创作可以邀请人们交流,也允许不同的人喜欢不同形式。
你也可以接受这种意见。如果希望作品更安静,愿意重新拍一张照片,只要能说明原因,就不必为保留初稿而保留初稿。
AI还可以帮助检查。把作品内容交给它,请它找出标题、正文和图像说明之间是否有不一致。能够读取图片的工具,也可以帮助提出画面问题;只有文字输入时,就提供真实的布局与图像描述。
模型的反馈是另一组待考虑的意见。它没有代替那位读者的实际阅读,也没有亲身使用这只笔袋。一个人给出的反馈,则能帮助我们改进当前作品,还不足以代表所有人的反应。
根据观察作一次有理由的决定。你可以调整一处文字、画面或声音,也可以保留已有安排,并说明为什么暂时不改。若已经达到本次目的,不必为了凑出修改记录而再生成许多版本。
完成以后,写一句采用或舍弃的理由。例如:“我去掉了背景花纹,因为它与针脚叠在一起,读者看不清这次想突出的细节。”
作品中的个人选择,也可以是采用AI提出的一个好办法。想法由谁最先提出,并不能独自说明你是否理解了它。你能够解释为什么采用、怎样调整、结果是否合适,才便于继续讨论这次协作。
从主题到画面,从文字到停顿,这些选择逐渐使作品形成自己的样子。它可以朴素,也可以鲜明;能够表达这次真正想讲的内容,就有了继续发展的基础。
7.3.2 交代材料来源和AI参与的部分
一页作品中,照片可能是自己拍的,插画可能由AI生成,文字可能经过几次共同修改。把这些情况交代清楚,读者就更容易理解作品怎样形成,也能找到原来的材料。
先看素材来自哪里。自己的观察、照片和录音可以直接说明由自己提供;借用他人的图片、文字或声音,则要查看对方允许怎样使用,并按照相应要求标明来源。
例如,采用知识共享(Creative Commons,CC)许可的材料,不同许可对改编、用途和再分享的条件可能不同。标注作者与来源,并不能自动代替许可中的其他条件。[5]
找到适合的材料时,可以同时记下名称、作者、原始位置和使用条件;做了修改,再简要说明改动。知识共享组织也以这些信息作为署名实践的重要内容。[6]
本章用自己的材料即可完成练习,没有必要为了装饰再加入许多来源不明的图像和音乐。需要画一处细节时,自己画简单示意图,也是一种可行选择。
接着看AI参与了什么。只写“AI辅助”比较笼统,写清具体部分会更有用。例如:“我提供观察记录和照片;AI提出两种图文安排,并帮助压缩正文;我选择构图、核对内容,完成排版。”
采用AI生成的插画或配音时,也把对应部分说明白。生成插画与实拍照片、合成旁白与现场录音,形成的过程不同;用在作品中的作用也应让读者能够理解。
下面是一段制作说明的示例,按实际发生的情况填写即可:
材料:笔袋记录与照片由我提供。AI协助比较两种构思、修改正文。我选定近景,保留补丁与针脚,并完成排版。照片只作裁剪,没有使用生成图像替换笔袋。
若作品使用的是插画,最后一句可以改成:“配图为根据材料生成的插画,由我选择并调整,不作为实物照片。”若只是用本章示例练习,则写“根据本章笔袋示例材料创作”,不要把示例经历写成自己真实做过的事情。
说明应当与作品一致。请AI帮忙写这段说明,也要自己核对;没有拍照、没有录音的环节,不应被补写成已经完成。
自己的署名表达了参与与选择,对他人材料的注明则保留了他们的贡献。作品公开分享时,材料说明也应当一同保留,让后来看到它的人能够了解这些内容从哪里来。
完成本章作品。为作品配上题目和简短的制作说明,保存可以继续修改的文件,以及能够直接观看或播放的成品。再次打开,确认图像与文字能够显示;声音作品则从头到尾听一遍。
保留成品、一个方案取舍的理由和必要的材料说明,本章基本练习就完成了。工具名称可以在制作说明中按实际填写,不必把全部对话都放到作品旁边。
再看一眼章首那块补丁。它可以被处理得更整齐,也可以清楚地留在画面里。经过比较、制作和交流,你已经能够说明自己的选择,也知道作品接下来还可以怎样变化。
本章回望
创作从我们愿意关注的事情开始。一段经历、一个细节或一个设想,经过材料选择,逐渐形成主题。考虑谁会看到作品,能够帮助我们决定需要讲到哪里、采用什么形式。
AI可以参与构思、起草、生成和修改。比较两个真正不同的方向,往往比不断更换同一套装饰更能帮助我们想清楚问题。草图让构思可以被看见,实际制作则让我们发现设想与效果之间的差别。
图像展示形状、关系和细节,文字补充经历与解释,声音通过顺序、语气和停顿展开。每一种材料都应当有自己的作用,也可以为不同观看条件提供其他理解方式。
完成作品以后,真实阅读能够带来新的发现。我们根据反馈修改,也可以保留有理由的选择。清楚说明材料与AI的参与,让协作过程中的贡献能够被看见。
下一章,这件作品还可以向前走一步:把一页内容做成能够点击、查看或播放的小工具。你会继续决定,增加哪一个功能,能够给观看的人带来实际帮助。
练习与继续探索
1. 从对象走向主题。同样介绍一只笔袋,“怎样修补”与“为什么愿意继续使用”会需要哪些不同材料?从自己的物品、经历或兴趣中,选一个对象,写出一个能够展开的主题。
2. 比较两种表达。为同一主题提出两种方案,可以先自己画草图,再请AI补充。说明它们在内容或阅读方式上有什么区别,避免只比较边框、颜色和字体。
3. 让形式服务内容。一张1200×800像素的横图,需要放入600×600像素的区域。直接拉伸、先裁剪再等比例缩放、保留横图并留白,分别可能带来什么结果?对你的主题来说,哪项信息最需要保留?
4. 为一次修改说明理由。请一位读者看看初稿,记录一条实际反馈。它反映了内容不清楚、观看不方便,还是审美偏好不同?据此修改一处,或说明暂时保留原作的理由。
5. 换一种接近作品的方式。为重要图片写一句说明,或为声音作品保留文字稿。再想一想:没有看到图像、没有播放声音的人,还能理解哪些主要内容?哪项信息需要补充?
6. 交代自己的协作过程。指出作品中由自己提供、由他人提供和由AI生成或修改的部分,只填写实际用到的内容。再提出一个可在下一章尝试的小功能,例如点击查看一处细节,或播放一段已经完成的声音。
本章资料来源
[1] Design Council. Framework for Innovation. 用于参照了解使用者、探索不同方向、初步制作与反馈改进之间的关系;正文采用小型创作活动,不要求掌握整套设计流程模型。访问日期:2026-09-21。https://www.designcouncil.org.uk/resources/framework-for-innovation/
[2] Google Cloud. Insert objects into an image using inpaint. 用于核对原图、选定区域与文字要求共同参与局部图像编辑的基本方式,不要求使用该产品或具体模型。访问日期:2026-09-21。https://docs.cloud.google.com/vertex-ai/generative-ai/docs/image/edit-insert-objects
[3] W3C Web Accessibility Initiative. Informative Images. 用于核对按图像在作品中的作用提供文字替代的做法,不把图中每个视觉细节都列为必写内容。访问日期:2026-09-21。https://www.w3.org/WAI/tutorials/images/informative/
[4] W3C Web Accessibility Initiative. Transcripts. 用于核对声音作品文字稿的作用,以及对理解有用的非语言声音也需要说明。访问日期:2026-09-21。https://www.w3.org/WAI/media/av/transcripts/
[5] Creative Commons. Sharing Openly, Sharing Globally(The CC Licenses节). 用于核对不同知识共享许可的使用条件,区分署名与其他许可要求;正文不对某项具体作品的权利归属作法律判断。访问日期:2026-09-21。https://creativecommons.org/cc-licenses/
[6] Creative Commons. Recommended practices for attribution. 用于核对材料名称、作者、来源、许可及修改说明的记录方式。访问日期:2026-09-21。https://wiki.creativecommons.org/wiki/Recommended_practices_for_attribution
第8章 把想法变成能运行的小工具
样章 v0.1 | 2026年9月21日
按一下,再靠近一点
上一章,我们把一只笔袋做成了一页作品。灰色的布面、蓝色的补丁,以及修补后继续使用的经历,都留在了图文中。
设想一位同学看过以后说:“我想再看看补丁周围的针脚。”你可以把细节图和说明全部放到首页,也可以留一个按钮,让愿意多看的人自己展开。看完以后,他还能把这部分收起来,回到原来的阅读节奏。
这个想法不大,却改变了读者接近作品的方式。他开始能够参与决定:什么时候继续看,什么时候停在这里。
请AI给出建议,它可能写下:“增加一个查看细节的按钮。”这仍然是一句建议。要让按钮起作用,还需要一些可以被计算机执行的内容:按下时查看当前情况,显示或收起细节,并把按钮上的文字一起改好。
这些内容可以写成程序。本章就从这个小动作开始,借助AI把想法变成能够打开、能够操作的小网页,再读懂其中几处关键安排,亲手改变一次行为。
你可以继续使用第7章的作品,也可以采用本章的笔袋材料。基本练习只做一个功能:展开与收起补丁细节。完成后,再考虑它是否真正帮助了读者。
学完本章,你将能够: 把一个功能说成具体的输入、处理和结果;借助AI制作并运行小网页;解释一处判断怎样影响页面;根据实际表现修改程序;分清生成代码、运行程序与调用工具之间的关系。
8.1 把需要的功能说明白
8.1.1 输入什么,得到什么结果
面对上一章的作品,可以先问:“观看的人想做什么,现有页面还不能帮助他完成?”这个问题比“还能加什么技术”更容易把我们带到有用的地方。
笔袋作品希望让人注意一次修补。主要介绍已经能够读懂,一部分读者还想知道针脚和布面有什么细节。因此,我们先增加一个可以展开的区域,把这些补充内容放进去。
暂时没有细节照片时,用一句清楚的观察说明也能开始。先让阅读方式发生变化,之后再放入自己的图片。
下面的材料可以直接用于练习:
标题:这块蓝色,我想留下
主要介绍: 笔袋的边角磨破后,我补上了一块蓝布。第二天,我把常用的几支笔放回里面,照常带它上课。
补丁细节: 蓝布与灰色布面不同,四周的针脚有些不齐。我想把这些针脚留在画面里,让人看见这只笔袋经过一次修补,又回到了每天使用的东西中间。
这里的“我”属于示例中的叙述者。采用这份材料时,作品旁可以保留“根据本章笔袋示例材料制作”的说明。
接着,把想要的变化说清楚:打开页面时,标题和主要介绍能够看到,细节先收起。按钮写着“看看补丁”。按一下,细节展开,按钮变成“收起细节”;再按一下,细节收起。
这个过程已经包含三个相互联系的部分。
输入 是程序收到的信息或动作。在这个例子中,读者按下按钮,就是一次输入。输入不一定是一段文字,也可以是一次选择、一张图片或设备测到的数值。
处理 是程序根据已有信息执行的步骤。这里要先查看细节是否收起,再决定展开还是收起,同时更新按钮上的文字。
输出 是程序产生的结果。读者能够看到细节区域和按钮文字发生变化,原来的标题与主要介绍仍然留在页面上。
可以把它连成一句话:读者按下按钮,程序查看细节当前是否可见,再改变细节和按钮的显示。
注意,同样按一下按钮,在不同情况下会产生不同结果。细节收起时,按一下应当展开;细节已经展开时,按一下应当收起。要理解这个功能,除了知道输入,还要知道操作之前是什么情况。
保存这类当前情况的信息,常称为程序的状态。本章只需要理解一个很具体的状态:细节现在是展开还是收起。它会影响下一次按下按钮时做什么。
确定自己的一个小功能。 你可以沿用展开细节,也可以让已经完成的声音作品能够播放。先写清使用者做什么、页面怎样回应,再选定一种做下去。不同功能不必同时加入。
若一段文字直接放在页面上就足够清楚,保留原样也合理。这里选择按钮,是为了让读者可以决定是否继续查看补充内容。
8.1.2 用具体例子说明预期行为
“做得方便一点”“让页面更智能”表达了愿望,却还没有说明怎样才算做到。计算机最终要执行具体操作,AI协助编写时也需要知道我们期待的变化。
把动作前后的情况摆在一起,就容易检查:
| 操作前的情况 | 读者做什么 | 应当看到的结果 |
|---|---|---|
| 刚打开页面,细节收起 | 暂时不操作 | 标题与主要介绍可见,按钮写着“看看补丁” |
| 细节收起 | 按一下按钮 | 细节展开,按钮改为“收起细节” |
| 细节展开 | 再按一下按钮 | 细节收起,按钮改回“看看补丁” |
这几个例子还说明了什么不应改变:标题没有被替换,主要介绍没有消失,按钮一直能够找到。我们期待的是阅读区域的变化,不需要每按一次都重新生成一篇介绍。
这些可以观察的要求,能够帮助人和AI共同理解功能,也能在完成以后帮助我们判断结果。此时不必先知道具体代码怎样写。
本章选择把内容做成一个网页文件。网页 可以包含标题、段落、图片和按钮,浏览器根据文件中的安排显示内容、执行相应操作。[1][3] 基本练习在自己的电脑上打开即可,不需要先建立一个公开网站。
打开AI对话工具,附上刚才的材料,再提出这样的要求:
请把这份笔袋材料做成一个简单网页。保留标题、主要介绍和材料说明,只增加“展开与收起补丁细节”这一个功能。
初次打开时,细节收起,按钮写“看看补丁”。按一下后显示细节,按钮改为“收起细节”;再按一下恢复。标题和主要介绍始终保留。
请提供一个完整的HTML文件,页面样式和交互代码都放在其中,可保存为patch.html后用浏览器打开。先使用文字,不加载外部图片、字体或其他网络资源。
请使用真正的按钮,让它能够通过鼠标或键盘操作。代码后简要指出:在哪里接收点击,在哪里判断,在哪里改变页面。
HTML是超文本标记语言(HyperText Markup Language) 的英文缩写,用于描述网页内容及其结构。[1] 现在先把它理解为浏览器可以读取的一种页面写法,下一节再看它如何与其他部分配合。
“完整文件”与“其中几行示例”也要分清。若AI只给出一个按钮和几行操作代码,可以继续说:“请把它们放入一个能直接打开的完整页面。”你可以要求它解释,也可以要求它把解释与文件内容分开。
本章配套材料中的patch.html提供了一种完整写法。可以先尝试自己与AI生成,再用配套文件对照;也可以从配套文件出发,修改成自己的作品。两种方式都需要实际运行,并理解关键变化。
把自己的要求再读一遍。 它是否说明了初次打开时的样子、第一次操作后的结果,以及接着操作会怎样?同学只看这段话,能否知道你准备做出什么?
若对方理解与你不同,先修改要求,再继续制作。这样能够减少程序已经写出很多内容以后,才发现双方讨论的是两件不同事情。
8.2 与AI一起生成和修改程序
8.2.1 读懂关键输入、判断与输出
AI给出的文件中可能出现许多带尖括号的文字、样式设置和英语单词。可以先沿着刚才的功能寻找,不必从第一行开始背诵全部写法。
一个常见的交互网页会用到三类内容。HTML 安排有哪些标题、段落和按钮;层叠样式表(Cascading Style Sheets,CSS) 安排字号、间距等外观;JavaScript 是一种编程语言,可以用来编写点击以后执行的操作。[1][2][3]
本章把这三类内容放在同一个文件里。它们一起形成页面,但承担的事情不同。改变标题文字,主要涉及内容;调大按钮,主要涉及样式;让按钮展开细节,则涉及交互行为。
我们先看页面上的按钮和细节区域。下面是其中一部分:
<button id="detailButton" type="button">看看补丁</button>
<section id="detail" hidden>
<h2>补丁细节</h2>
<p>蓝布与灰色布面不同,四周的针脚有些不齐。</p>
</section>
button表示按钮,section把一组相关内容放在同一区域中。id为它们设置名称,后面的程序就能找到这个按钮和这块区域。这里分别用了detailButton和detail,名字需要前后一致。[1]
hidden表示细节区域开始时隐藏,因而页面先只显示主要内容。文字仍然写在文件里,展开时才让它出现在页面中。[4]
接下来,找到控制按钮的JavaScript。下面保留了主要行为:
const button = document.getElementById("detailButton");
const detail = document.getElementById("detail");
function toggleDetail() {
if (detail.hidden) {
detail.hidden = false;
button.textContent = "收起细节";
} else {
detail.hidden = true;
button.textContent = "看看补丁";
}
}
button.addEventListener("click", toggleDetail);
先看开头两行。它们按刚才的名称找到按钮和细节区域,分别用button和detail来指代。后面写detail.hidden,就是在查看或改变这块细节区域的隐藏情况。
这里的const为找到的对象建立一个后续使用的名字。暂时不需要展开全部语法,只要能够把名字与页面上的对象对应起来。
再看中间的if与else,可以读成“如果……,否则……”。程序检查detail.hidden:若细节当前隐藏,就执行前一组操作;若当前没有隐藏,就执行后一组。
在本例中,true表示“是隐藏的”,false表示“不是隐藏的”。所以,detail.hidden = false会让细节显示;detail.hidden = true会让它收起。等号在这里表示把右边的值设置给左边的项目。[4]
细节变化时,按钮上的文字也应一起变化。textContent用来读取或设置对象的文字内容。[6] 细节展开后,按钮写“收起细节”,告诉读者再按一次会发生什么。
中间这一组操作用function toggleDetail()组织起来,成为一个可以调用的函数。函数把一组步骤放在一起,需要时执行;这里的名字表示“切换细节”。[3]
最后一行把按钮与这组步骤连接起来。浏览器把点击等已经发生的动作作为事件,程序可以为某个事件安排处理操作。[3] 这行代码的意思是:按钮收到点击时,执行toggleDetail中的步骤。
现在可以把代码重新读成日常语言:
找到按钮和细节区域。按下按钮时,检查细节是否隐藏。若隐藏,就显示它,并告诉读者可以收起;若已经显示,就隐藏它,并告诉读者可以再看。
这段程序没有询问模型“现在应该怎么办”。它依据当前情况执行已经写好的判断。AI参与了编写;页面运行时,这段代码由浏览器执行。
跟着程序走两次。 假设刚打开时细节隐藏。第一次按下,判断会进入哪一组?执行完以后,detail.hidden变成什么?再按一次,为什么会走另一组?先自己想,再运行检查。
配套完整文件还包含文字排版、键盘焦点,以及把展开情况提供给辅助阅读工具的设置。[5] 它们帮助不同方式操作页面的人使用这个功能。上面的节选用于看清主要判断,无需一次记住所有属性。
你的程序也可能采用另一种写法。可以请AI指出其中相应的输入、判断和输出,再结合页面核对。判断是否真正相同,要看执行过程与结果,不能只看变量是否取了同样的名字。
8.2.2 实际运行,发现问题并修改
读过关键部分,就把它放到浏览器里试一试。运行程序,就是让相应环境按照程序中的安排执行。本例中,浏览器显示HTML内容,并运行其中的JavaScript。[1][3]
将AI给出的完整文件内容放入文本编辑器,保存为patch.html,再用浏览器打开。代码块外面的解释和围住代码的三条反引号不用复制进去。若所用工具已经生成可下载的HTML文件,直接下载并打开即可。
使用文本编辑器保存,不把Word文档简单改成.html。若浏览器显示了一页代码,可以检查实际文件名是不是patch.html.txt,以及是否用浏览器打开了正确文件。具体按钮位置可按所用编辑器操作。
有可运行网页预览的环境,也可以先在预览中试。看到一张页面图片,还不足以判断交互;要实际按下按钮,观察内容是否改变。
先完成一次完整操作。 打开页面,找到标题、主要介绍和“看看补丁”。按一下,阅读展开的细节;再按一下,看它能否收起。整个过程中,主要介绍应当保持可见。
顺利完成,就已经得到了一个能够使用的小功能。若结果与你想的一样,可以保留它,不必为了练习修错而故意破坏程序。
遇到差异时,先描述发生了什么。例如:“初次打开时,细节已经显示,但按钮仍写着‘看看补丁’。”这比“网页不对”提供了更多可以查找的信息。
另一种情况是:“第一次点击后,按钮变成‘收起细节’,可是细节文字没有出现。”这说明至少有一部分点击处理已经执行,需要继续查看细节区域的名称、显示设置和相关代码。原因要结合实际文件确认,不急着凭现象下结论。
可以把当前完整文件与这段观察一起交给AI:
我打开这个文件后,第一次点击,按钮文字改变了,但细节没有出现。预期是细节和按钮文字同时变化。请根据这份代码检查原因,说明需要改哪里,保留原来的标题、主要介绍和其他已经正常的部分。
若使用的AI不能直接读取电脑文件,就粘贴代码或上传这个练习文件。它需要看到正在运行的内容,不能只凭我们心中的旧版本修改。
收到修改后,再运行原来那次操作。找到问题、检查原因、修改并重新观察的过程,称为调试。它可以很小,只围绕一个按钮展开,也可以用于以后更复杂的程序。
接着主动改变一项要求。 假设你比较之后觉得,这页内容很短,读者一打开就应看到补丁细节,同时保留收起的选择。现在要把“开始时收起”改为“开始时展开”。
先写出新的预期:打开时细节可见,按钮写“收起细节”;按一下以后细节收起,按钮写“看看补丁”;再按一下恢复展开。
在前面的简化HTML中,这项修改涉及两个直观的地方:去掉细节区域开始标签上的hidden,把按钮的初始文字改成“收起细节”。点击后的两种判断仍然可以沿用,因为它们查看的是当时的实际情况。
配套完整文件还要把初始的展开信息一起改好。可以请AI完成这次局部调整,并指出改动位置;也可以对照配套材料中的patch-open.html阅读。先保留原文件,再把修改后的文件另存一个名字,便于比较。
用同一组动作比较修改前后。 分别打开两个文件,各按两次按钮。初次显示不同,后续都应能够正常展开和收起。若只修改了按钮文字,细节仍然隐藏,就还没有完成新要求。
刷新本章配套页面,会按各自文件中的初始设置重新开始。因为这两个示例没有保存上一次的展开情况,浏览器当前显示的变化没有被写回源文件。需要“下次继续上次状态”时,还要另行设计保存与恢复,基本练习暂不增加。
功能能运行以后,再看它是否便于操作。按Tab键,把焦点移到按钮上,再按Enter或空格,应当能完成相同操作。[5] 缩窄浏览器窗口,看看按钮和文字是否仍然容易找到,不必横向拖动才能读完一句话。
还可以把上一章的照片放进细节区域。让AI使用你实际保存的图片文件名,并说明图像内容。照片与网页分开存放时,网页中的引用需要能找到对应文件。[1] 这属于内容替换,展开与收起的主要判断不必因此改变。
本章先用文字完成整个功能,加入照片是可选的一步。无论采用哪种材料,都让一位读者试一次,看看他是否知道按钮会做什么、展开后是否得到了想了解的信息。
8.3 理解模型、程序与工具的关系
8.3.1 生成说明与调用工具执行操作
做到这里,可以回看:这件作品从一句想法到能够运行,中间分别发生了什么?
你先用文字说明要求,AI生成页面代码。随后,你把代码保存为文件,浏览器读取文件,按规定显示内容和处理点击。人的表达、模型生成和程序执行共同参与了这个过程。
这里有两个容易混在一起的时刻:编写程序时 和使用程序时。
编写时,模型根据要求生成或修改代码,帮助我们比较做法、解释问题。使用时,本章的按钮执行文件里已有的判断,没有再次请求模型生成答案。这个网页借助AI制作完成,运行本身不需要调用AI。
因此,使用AI编写的工具,可以是一个普通网页;一个页面能响应点击,也不自动意味着其中运行了大模型。判断它用了什么,应当看实际组成和运行过程。
反过来,有些AI应用配备了读取文件、写入文件、运行代码或操作浏览器的工具。这时,模型可以根据任务发出工具调用请求,由配套的执行程序完成相应操作,再把结果返回给模型。[7]
工具调用 可以先这样理解:模型提出要执行的操作以及所需信息,系统通过相应工具执行,并返回发生了什么。至于工具在哪台计算机上运行、能够操作哪些文件,取决于具体环境,不能从一句自然语言回答中推断。
下面是一个过程示例,用普通语言表示其中的关系:
你提出要求:把这份材料写成patch.html。
模型请求写入工具:将指定的页面内容保存到patch.html。
工具执行后返回:文件已写入,或说明未能写入的原因。
配有浏览器工具时,还可以继续打开文件,操作按钮,返回页面变化或遇到的问题。
工具真正执行以后,环境中的文件或运行结果才会发生相应变化。只输出“我已经写好了”这句话,不能代替写入操作。[7]
如果当前工具只有文字对话能力,你可以自己保存和打开文件,照样完成本章。配有文件与运行工具时,则可以让它们承担部分操作。学习重点是分清哪些步骤已经发生,以及怎样查看结果。
程序与模型也可以通过工具结合。例如,模型帮助理解“把照片等比例缩小到600像素宽”的要求,计算工具负责计算尺寸,图像工具执行缩放。最后还要查看图片是否保持比例、重要内容有没有被截掉。
其中,文字要求需要被理解,计算需要输入正确数值,文件处理需要拿到正确图片。这些环节各有作用。工具返回了结果,也仍然需要检查它是否回答了我们原来的问题。
本章不要求搭建这类工具连接。先把自己完成的保存、打开和检查看清楚,下一章再观察AI怎样把几项行动接起来,并根据实际结果继续处理。
8.3.2 检查计算、读取或保存是否真正完成
第6章讨论过,一个回答需要有根据。到了程序与工具这里,我们还可以直接检查行动留下的结果:算出了什么,读到了什么,文件里保存了什么,页面实际怎样变化。
先看计算是否与要求相符。 第7章用过一张1200×800像素的图片。现在要把它等比例缩小到600像素宽,缩放比例是600÷1200=0.5,高度应为800×0.5=400像素。
可以请AI计算,也可以用计算器核对,最后得到600×400像素。若工具输出600×600像素,要进一步看它做了什么:可能是拉伸,也可能是裁剪或增加留白,单看两个数字还不能判断具体处理过程。
这个小例子提醒我们,计算结果要与“等比例缩小”的要求一起核对。数字正确、动作正确、符合用途,是相互联系却需要分别查看的事情。
再看是否读取了正确材料。 让AI解释当前网页时,可以请它指出标题、按钮初始文字,以及细节区域是否带有hidden。把它说出的内容与实际文件对照,就有了可以核查的对象。
例如,你已经把初始状态改为展开,AI却仍说“打开时细节隐藏”,就要确认它看到的是哪个文件。也许读取了修改前的版本,也许只根据上一次对话推断;需要回到读取内容本身检查。
把一张照片的文件名写在对话中,也不意味着模型已经看过照片。要判断读取是否完成,应当看实际提供的材料或工具读取结果。复制了一段代码给AI,则应如实说它依据这段代码分析,不把它写成已经浏览过整个项目。
最后看保存与运行的结果。 页面代码出现在对话里,说明我们得到了一份可以采用的内容;保存后,才有一个实际文件;用浏览器打开并操作,才能看到这份文件运行得怎样。
可以把几个结果这样区分:
| 已经发生的事情 | 目前能够说明什么 | 还需要怎样检查 |
|---|---|---|
| 对话中出现完整代码 | 已生成一份程序内容 | 保存并运行,查看实际行为 |
| 写入工具报告成功,或编辑器完成保存 | 操作报告文件已写入 | 重新读取或打开对应文件,确认内容 |
| 页面打开,按钮能够展开与收起 | 当前环境下,这组操作能够执行 | 对照要求,查看内容与使用效果 |
不必为每一次点击保存大量记录。对这个小工具,亲自完成“打开—展开—收起”,再指出一处修改后的变化,就能形成有用的检查。
也要看清检查覆盖了什么。按钮能点击,尚不能证明同学容易理解按钮文字;在自己的电脑上能打开,尚不能说明它已经发布给所有人使用。需要哪一种结果,就针对那种结果再做确认。
若通过工具修改文件,可以把范围说得具体:“只修改当前练习网页中细节的初始显示,其他内容保持不变。”涉及覆盖已有作品或删除材料时,先确认自己要保留什么。
完成自己的小工具。 保留能够继续修改的网页文件,运行选定的功能,再写两三句话:它帮助观看者做什么;哪一段判断决定了结果;你改变了哪一项要求,实际表现怎样变化。
沿用第7章的材料说明,补充AI这次协助了什么。例如:“AI帮助生成网页和解释点击程序;我确定展开方式,对照实际页面修改,并检查按钮操作。”按照真实过程写即可。
再把页面交给一个人使用。若他想看细节,能够自己找到按钮,并顺利回到主要介绍,这个小功能就帮助作品多打开了一种阅读方式。若他始终没有注意到按钮,就还有一个具体问题值得继续改进。
本章回望
创造一个小工具,可以从一项很小的需要开始。先说明谁要做什么,再用具体例子描述输入、处理与结果,就能把模糊的愿望变成可以讨论和检查的功能。
AI可以帮助生成代码,我们沿着关键行为读懂程序。按钮收到动作,程序查看细节是否隐藏,再选择相应操作。同样的输入与不同的当前情况结合,会带来不同输出。
实际运行让设想接受检查。能够说明“我做了什么、看到什么、原来希望怎样”,就更容易找到需要修改的地方。原本运行正常时,也可以主动改变一项要求,观察程序怎样随之改变。
模型、程序和工具在协作中承担不同作用。生成内容、写入文件、运行操作和达到使用目的,需要分别看清。工具的执行结果提供了检查依据,人的判断让这些结果与最初的需要保持联系。
上一章,你决定让别人看见什么;这一章,你进一步决定别人能够怎样接近它。下一章,我们将观察AI怎样连续完成读取、修改和检查等工作,以及什么时候应当由自己作出下一步选择。
练习与继续探索
1. 说清一个行为。 为自己的作品选择一个小功能,写出操作前的情况、使用者的动作和预期结果。请同学只读这段话,说说他认为页面会怎样变化。
2. 跟着判断走。 本章基本示例从细节隐藏开始,连续点击三次,每次以后细节是展开还是收起?按钮分别写什么?先推想,再运行核对。若从展开开始,结果又怎样?
3. 改变一项要求。 把“打开时收起”改为“打开时展开”,或为自己的功能提出另一项小调整。说明需要改变哪些内容,以及原来的哪些行为可以保留。保存后重新运行,不只比较代码或截图。
4. 区分几种完成。 AI输出了一个文件名,提供了完整代码,报告写入成功,以及实际打开并点击页面,这几种情况分别说明什么?选其中两种,说明还缺少哪一步才能得到你要的结果。
5. 检查一个具体结果。 一张1200×800像素的图片等比例缩小到300像素宽,高度应是多少?若工具输出300×300像素,需要继续查看哪种处理?把这种“先说明要求,再核对结果”的方法用于自己的程序。
6. 为下一次尝试留下问题。 请一位读者实际操作作品,选择一条值得继续处理的反馈。想一想:其中哪一步可以请AI或工具协助,哪项选择还需要自己决定?本章不要求立即增加新功能。
本章资料来源
[1] MDN Web Docs. HTML: Creating the content. 用于核对HTML的内容结构、元素与文件引用,以及保存HTML并用浏览器打开的基本方式。访问日期:2026-09-21。https://developer.mozilla.org/en-US/docs/Learn_web_development/Getting_started/Your_first_website/Creating_the_content
[2] MDN Web Docs. CSS: Styling the content. 用于核对CSS安排网页外观的基本作用。访问日期:2026-09-21。https://developer.mozilla.org/en-US/docs/Learn_web_development/Getting_started/Your_first_website/Styling_the_content
[3] MDN Web Docs. JavaScript: Adding interactivity;Introduction to events. 用于核对浏览器交互、函数、条件判断与事件处理的基础解释。访问日期:2026-09-21。https://developer.mozilla.org/en-US/docs/Learn_web_development/Getting_started/Your_first_website/Adding_interactivity ;https://developer.mozilla.org/en-US/docs/Learn_web_development/Core/Scripting/Events
[4] MDN Web Docs. HTMLElement: hidden property. 用于核对本例中隐藏属性与JavaScript的true、false值之间的关系。正文仅使用隐藏与显示两种情况。访问日期:2026-09-21。https://developer.mozilla.org/en-US/docs/Web/API/HTMLElement/hidden
[5] W3C Web Accessibility Initiative. Disclosure (Show/Hide) Pattern. 用于核对展开/收起按钮的键盘操作与展开状态说明。配套示例保留相应设置,正文不要求掌握全部属性。访问日期:2026-09-21。https://www.w3.org/WAI/ARIA/apg/patterns/disclosure/
[6] MDN Web Docs. Node: textContent property. 用于核对设置对象文字内容的行为。访问日期:2026-09-21。https://developer.mozilla.org/en-US/docs/Web/API/Node/textContent
[7] Anthropic. Tool use with Claude. 用于核对模型发出操作请求、执行程序调用工具、结果返回的基本关系。仅用于原理核对,不指定课堂产品,也不引入接口配置。访问日期:2026-09-21。https://platform.claude.com/docs/en/agents-and-tools/tool-use/overview
第9章 让AI连续完成几件事
样章 v0.1 | 2026年9月21日
再大一点,让我看清楚
上一章的网页已经可以展开补丁细节。按下按钮,蓝布与针脚的说明出现;再按一下,它们又收回去。我们把一段介绍变成了能够操作的小作品。
设想一位读者看着页面说:“文字能不能再大一点?”你意识到,自己看着合适的字号,未必适合每一位读者。于是,一个新的想法出现了:在页面上留一个“放大文字”的按钮,需要时放大,读完也能恢复。
这个想法听起来只比原来多一个按钮。真正做起来,却需要先读懂已有文件,找到正文与样式,增加操作,再打开网页试用。文字变大后会不会挤出页面?原来“看看补丁”的按钮还能不能用?这些问题要到实际运行时才能看得更清楚。
第8章中,你可能亲自完成了保存、打开与检查。现在,我们尝试把其中一些连续的工作交给配有工具的AI。你说明想改善什么,它读取文件、实施修改,再根据运行结果决定是否需要调整。
在这个过程中,值得观察的不只是最后多了什么功能,还有每一次行动与下一步之间的联系:它得到了什么新信息?为什么接着做这件事?哪些地方需要停下来,听听你的意见?
本章仍然围绕这一页作品展开,不要求另外开发一个智能体平台。你可以使用上一章自己的网页,也可以采用配套的笔袋页面。先完成一次小而清楚的委托,再考虑怎样把这种协作方式用到新的事情上。
学完本章,你将能够: 说明一项任务中步骤的先后关系;分清人、模型和工具各自完成了什么;根据实际返回的结果解释下一步选择;初步理解工作流与智能体的区别;确定可以交给AI继续处理的范围,以及需要自己判断的地方。
9.1 把事情的先后关系安排清楚
9.1.1 一项任务中的固定步骤
先把“文字大一点”说成可以看见的变化。
笔袋页面打开时,继续保持原来的正文和补丁按钮。新增按钮写着“放大文字”。按一下,主要介绍、补丁细节的正文和两个按钮上的字一起变大;新按钮改为“恢复字号”。再按一下,恢复原来的大小。
标题和文字内容不改。放大时,原来的补丁细节仍然可以展开、收起。缩窄窗口后,正文能够自然换行,读者不必左右拖动才能读完一句话。让文字变大时仍然保留内容和操作,是有意义的阅读要求。[1]
本例选用正文从18像素变为24像素。这里的“像素”用于网页排版,与第4章照片中记录颜色的像素用途不同。现在只需知道:在其他条件相同时,较大的字号通常会显示得更大。
浏览器也提供缩放功能。本章的按钮给作品增加一种直接的阅读选择,但不应妨碍浏览器原有的缩放。[1]
开始前,先打开原网页操作一次。 读一遍主要介绍,展开并收起细节,确认自己准备保留什么。若采用第8章的另一版本,细节开始时已经展开,就把这一点写进要求;后面的修改不必把它改回收起。
接下来,想一想怎样把新功能做出来。可以先安排这样的顺序:
读取当前网页 → 增加字号切换 → 保存新文件 → 打开试用 → 对照要求检查。
这几个步骤有先后联系。没有读过正在使用的文件,就容易按旧印象修改;尚未保存新内容,打开的可能还是原来的页面;只看代码,不能代替实际按下按钮。
前一步产生的结果,也会成为后一步需要的材料。读取后得到页面内容,修改后得到新的程序,保存后得到可以打开的文件,试用后得到具体的观察。把这些材料传到下一步,事情才能接着进行。
把一项任务中的步骤及其衔接安排起来,可以称为工作流(workflow)。工作流可以由人按步骤完成,也可以把一些环节交给程序自动执行。在AI应用中,常见做法是预先安排主要路径,让模型和工具分别参与其中。[2]
例如,一个程序可以固定安排“读取文件—请模型修改—保存—打开检查”。每次接到同类任务,就沿这条路径执行。我们不需要为每一步重新发出指令,也能够看到任务逐渐完成。
固定步骤也可以包含判断。例如,程序预先写好“文件存在就读取,不存在就提示选择文件”。这仍然是提前安排的路径。能在两种情况之间切换,本身还不能说明下一步是由模型临时决定的。
我们已经在第8章见过这样的判断:细节隐藏时就展开,已经展开时就收起。输入不同、当前情况不同,程序可以得到不同结果;决定怎么处理的规则早已写在代码里。
给自己的小任务安排一条路线。 用几句普通话写出先做什么、后做什么,指出至少一处“后一步要用前一步结果”的地方。写到能帮助开始工作即可,不必把所有可能情况都画成复杂图表。
9.1.2 人、模型与普通程序怎样分工
有了路线,再看看每一步由谁完成。
你了解作品为什么保留那些针脚,也知道想改善的是阅读。模型可以根据要求阅读代码、提出修改并生成新的程序。文件工具负责读取和保存;浏览器负责显示页面、执行按钮里的代码。若环境配有浏览器操作工具,AI还可以借助它打开页面、点击按钮并取得结果。[3]
这几种作用需要配合。模型提出“读取patch.html”,执行程序才会调用相应工具;文件内容返回以后,模型才能据此继续处理。页面上的字号变化,则由浏览器执行实际代码产生。
不必给每一步都安排一个新的AI角色。对这个小任务,一个能够使用必要工具的AI就可以参与多个环节,普通程序完成适合直接执行的操作。怎样分工,取决于任务需要与环境实际提供的能力。
现在开始这次委托。 在能够读写文件、预览并操作网页的AI编程环境中,放入第8章的patch.html。保留原文件,把新作品另存为patch-large.html。本章配套材料也提供了原始页面,可以直接作为起点。
可以这样说明要求:
请读取当前的patch.html,在保留原文件的前提下,制作patch-large.html。
增加一个“放大文字”按钮。按下后,主要介绍、补丁细节正文和两个按钮的字号从18像素变为24像素,按钮文字改为“恢复字号”;再按一下恢复。标题、介绍内容和原来的细节展开方式保持不变。
保存后,请实际打开新文件,依次试用放大、展开细节、恢复字号和收起细节,并在较窄的窗口中检查正文与按钮。我先用390像素宽的预览查看。遇到与要求不符的地方,依据实际结果继续调整,不增加其他功能。
完成后告诉我改了哪里、实际检查了什么。修改本次新文件可以继续进行;改写作品内容、覆盖原文件或对外发布,先与我商量。
这段话同时交代了要做什么、保留什么,以及怎样判断已经完成。它给AI留出了处理代码的空间,也让你能够追踪结果是否仍然符合最初的想法。
工具没有提供某项能力时,可以由你补上相应操作。例如,只有文字对话时,你可以自己保存、打开并把观察告诉AI;有文件工具却没有浏览器操作工具时,可以请AI修改后由你试用。此时,要按实际分工描述过程,不把人的点击写成AI已经操作过。
先观察一次读取,再观察一次修改。 看看AI是否取得了当前文件,是否保留了标题与原有按钮,新的文件叫什么。不要只盯着页面中不断增加的文字,也要找出实际发生的操作。
模型也可以先给出简短的工作安排。这样的安排方便交流,但列出计划与执行计划是两件事。下一节,我们沿着实际操作返回的结果继续看。
9.2 根据结果选择下一步
9.2.1 工具执行以后返回了什么
AI请求工具做一件事以后,工具需要把执行结果送回来。这些结果可以是文件内容、写入位置、计算得到的数值、页面截图,也可以是未能完成操作的说明。不同工具返回的形式不同。[3]
模型接着处理时,依据的是这些已经取得的信息,以及原来的任务要求。若只是继续沿用自己刚才的猜测,就可能错过页面实际发生的变化。
下面是一段示例。我们用普通文字列出几次操作和结果:
| 已执行的操作 | 返回的主要内容 | 这些内容怎样帮助继续工作 |
|---|---|---|
| 读取patch.html | 标题、主要介绍、细节区域和原有按钮代码 | 找到可以保留的部分及需要增加功能的位置 |
| 写入patch-large.html | 写入成功,给出文件位置 | 可以重新读取并打开这份新文件 |
| 打开新页面,按下“放大文字” | 主要介绍字号变为24像素,按钮显示“恢复字号” | 可以继续检查细节是否也变大,以及原功能是否保留 |
| 展开细节,再恢复字号 | 细节仍然可见,正文恢复为18像素 | 可以检查两个功能是否互相干扰 |
表中的每个结果只回答相应的问题。写入成功说明工具报告完成了写入;它还没有说明页面一定符合阅读要求。字号达到24像素,说明选中的文字确实变大;它还没有说明读者一定觉得合适。
因此,检查时既看程序可以读取的数值,也看实际页面。浏览器能够提供文字最终采用的字号等样式信息,工具可以利用它们进行比较。[4] 页面是否挤在一起、按钮是否容易找到,则需要结合显示和实际操作判断。
例如,工具报告主要介绍的字号由18变为24像素。可以算一算:
24 ÷ 18 ≈ 1.33。
在这次设置中,字号约为原来的1.33倍,增加了约三分之一。这里比较的是字号数值,不能据此断言所有字形的高度都恰好增加三分之一,更不能把它写成“阅读效果提高三分之一”。
跟着新页面操作一遍。 先放大文字,再展开补丁细节;保持细节展开,恢复字号;最后收起细节。你应该看到,改变字号不会让细节自行展开或收起,改变细节也不会把字号改回去。
这两个小功能可以组合使用。读者可以看普通字号的主要介绍,也可以看放大后的补丁细节。它们帮助同一个阅读目标,但各自保存的当前情况应当分清。
键盘操作也可以顺手检查:用Tab键移到相应按钮,按Enter或空格,看看能否得到同样的变化。[5] 这一步让我们不只依赖一种点击方式。
如果实际结果与要求一致,就继续完成后面的检查,不需要专门制造一次错误。若出现差异,先把差异说清楚,再看需要补充哪一种信息。
例如,按钮文字变成了“恢复字号”,正文却看起来没变大。可以继续读取正文的实际字号,查看改变样式的代码,而不是立即换掉整张页面。若得到的字号确实是24像素,就要再比较前后的显示与所选文字,不能只凭一个印象判断程序失效。
还有一种情况:浏览器工具没有打开文件。此时,得到的是一次打开失败的信息,不是网页内容有问题的证据。先核对文件位置或交由人打开,才能继续判断功能。修改页面内容并不能自动解决所有工具问题。
留下一个具体的行动结果。 选择刚才的一次读取、写入或点击,用一句话说明它取得了什么,以及你据此做了哪项检查。无需抄下整段操作记录,能够回到具体文件或页面核对即可。
9.2.2 智能体怎样选择后续行动
到这里,最初安排的步骤可能已经全部完成,也可能在试用中出现了新的情况。
现在只改变一个条件:把预览窗口进一步缩窄到320像素,或者把窗口拖得比刚才更窄。保持较大的字号,再展开细节。看看文字是否仍然换行,两个按钮是否还在能够操作的位置。
这一次,我们没有增加功能,而是把已有作品放到另一种显示条件下。新的观察,会影响是否需要继续修改。
如果页面仍然清楚,AI可以依据检查结果结束这次调整。如果一行文字超出边缘,它可以读取相关样式,看看是否把区域宽度固定得过大;若定位到具体原因,再修改这一处并重新打开。若只能知道“页面不对”,却看不到实际文件或显示情况,则需要补充材料或请你说明。
这些是可能的处理方向。究竟应该采取哪一种,要看本次工具真实返回了什么,不能要求每个模型都演出同样的过程。
请AI接着检查这个变化。 可以说:
保持刚才的新文件和放大状态,把预览宽度改为320像素,展开细节后再看一次。根据实际结果决定是否需要修改。若已有做法满足要求,就保留;若需要调整,说明新结果改变了哪一步安排。
在以大模型为核心的AI应用中,模型能够围绕目标,利用工具取得信息,并根据结果选择后续行动,这种系统常称为智能体(agent)。本章讨论的就是这种能够使用工具、连续处理任务的智能体。[2]
可以把其中反复发生的联系读成一句话:
带着任务要求,取得当前结果;据此选择下一步;执行以后,再查看新的结果。
例如,模型发现正文超出边缘,先读取样式;读取结果表明一块区域被固定为较大的宽度,再选择修改宽度;随后重新运行,检查问题是否消失。这里的后续行动由模型结合结果作出选择。[6]
与之相比,如果程序事先规定“超出边缘就套用某一段固定样式,再运行一次”,它也能自动处理这种情况,但处理路径已经预先规定。两种方式都可能有用,判断区别需要看步骤怎样产生,不能只看屏幕上是否连续发生了许多动作。
工作流可以包含判断,智能体也可以使用固定步骤。 例如,固定安排“生成以后一定打开检查”,而让模型根据检查结果选择要修改的代码。实际应用可以把两种方式结合起来。[2]
因此,一段长对话、一次重复尝试,或网页自身的两个按钮,都不足以单独证明其中运行着智能体。需要看模型是否真的参与了后续行动的选择,以及相应工具有没有执行。
还有一个容易混淆的地方:帮助你修改网页的智能体,与做好的网页,是两个对象。本章完成的网页仍然可以用普通JavaScript控制字号和细节。读者按按钮时,并不需要再次询问大模型。AI参与了制作过程,作品运行可以沿用固定程序。
连续工作时,系统还需要保留本次任务中有用的信息。例如,正在修改哪个文件,正文已经采用哪一种字号,刚才在哪个宽度下检查过,哪件事尚未完成。这些信息帮助下一步接上前面的工作。
它们可以保留在当前对话、工具记录或项目文件里。模型根据这些信息继续处理,并不等于每改一次网页就重新训练一次模型。第5章讲过的“提供当前材料”与“调整模型参数”,在这里仍然需要分清。
新开一次对话时,也不要默认对方已经知道前面的过程。把当前文件和一句简短进展交给它,例如:“已完成字号切换,390像素预览正常,接下来检查更窄的显示。”这样,继续工作有了具体起点。
指出一次由结果影响的选择。 它可能是发现问题后修改某处,也可能是确认原有做法适用后停止修改。观察你这次实际发生的过程,说清“得到了什么—因此决定做什么”。如果全程只按预先列好的步骤执行,就如实记录这条工作流,不必为了给它取名而补写一次不存在的选择。
9.3 在委托中保留自己的判断
9.3.1 哪些操作需要先征得同意
当AI可以连续执行操作,我们不必再为每一次读取和点击重新发出指令。与此同时,开始时约定的范围变得更加重要。
这次你同意的是:保留原文件,制作新文件,增加字号切换,并完成相关检查。为完成这项要求,读取练习文件、修改新文件、重新打开和试用,可以在约定范围内继续进行。
假设AI又提出:“为了让页面更简洁,我把针脚的描述删掉了。”页面也许少了几行字,却改变了作品想表达的内容。第7章中,你选择留下针脚,是为了让读者看见修补的经历。怎样取舍这段表达,仍然需要由你判断。
这时可以回应:
保留关于针脚的原文。我们这次只调整阅读方式,不缩减作品内容。若放大后空间不够,请先调整换行和间距,涉及内容修改时再与我讨论。
这句话说明了保留的理由,也为继续处理指明了方向。人的判断不只是最后选择“通过”或“不通过”,还包括解释哪些东西值得保留。
有些操作影响范围更大。例如,覆盖原作会减少比较的依据,删除材料可能使后续修改失去来源,把网页发到公开网站则会改变谁能够看到它。这些都超出了本次“在新文件中调整阅读”的委托,需要另行确认。
确认时,最好明确到具体对象和动作:“可以用这份新文件替换原文件”,或“只在当前文件夹内保存,暂不发布”。一句“你看着办”留下的空间很大,不利于判断哪些选择已经获得同意。
用一句话划清本次范围。 例如:“读取原网页,在新文件中修改与检查;作品文字保留,覆盖原作和发布另行确认。”范围清楚之后,已经同意的低影响操作可以连续完成,不必每点一次按钮都停下来询问。
还要区分任务要求与实际权限。我们在对话中说明“不修改其他文件”,是在表达约定;环境还可以通过权限设置限制哪些文件能够写入、哪些操作需要确认。两者共同发挥作用,不能把一句提示当作已经设置好了全部限制。[7]
对于这个练习,使用单独的作品副本和相应工具范围即可。你需要理解允许发生什么,以及操作是否与约定一致;不需要在本章编写一套权限管理程序。
如果环境请求一项新权限,先看它准备做什么。完成一个本地字号按钮,通常无需把作品发布到外部网站。没有必要的额外操作,可以不批准,让任务回到原来的范围。
再请一位读者试用。 数值检查可以确认字号是否变大,实际读者则能告诉你,按钮是否容易找到、文字是否更适合自己。不同人可能有不同偏好,因此作品保留“恢复字号”的选择,也保留读者自己的决定。
9.3.2 什么时候继续,什么时候停下
“再优化一下”很容易说出口,却未必有明确的终点。AI能够继续生成建议,不代表这页作品需要一直增加内容。
回到最初的要求:正文和按钮可以放大、恢复;原来的细节功能保留;文字内容没有被改写;在已经检查的窄窗口中能够阅读和操作。若这些已经做到,就可以完成这次任务。
在这样的条件下停下来,意味着一项具体改进已经完成。以后有新的需要,再开始下一次尝试。保留一个能够使用的版本,比不断改变却说不清改进了什么更有帮助。
还有一种停止,是把需要判断的地方交还给人。比如你和试用者对字号大小有不同意见,或者希望同时保留两种完全不同的版式。AI可以整理差别,最终采用哪种做法,应当结合你们的用途和体验决定。
也可能暂时无法完成某一步。浏览器工具不可用时,可以说清“文件已经修改,实际点击尚未检查”,然后由你补上。不能因为后面的检查没有进行,就把前面已经完成的工作全部作废;也不能把未检查的部分写成成功。
反复尝试却没有新的信息时,同样值得暂停。例如,每次都重新生成整张页面,问题却没有被定位。更有用的做法可能是重新读取当前文件,补充一张页面截图,或把需要修改的范围缩小。
可以约定:围绕同一个问题尝试了几次仍没有进展,就先说明当前文件、已经尝试的办法和还缺少的信息。自动执行的系统还可以设置运行时间或尝试次数的上限,防止任务无限继续;具体数值按实际任务安排。[2]
这里的关键是让继续与停止有依据。还有可以核对的新信息、下一步与目标有关,就继续;需要人的选择、缺少必要条件,或已经满足要求,就在合适的位置结束或暂停。
完成一次清楚的交接。 可以请AI用几句话说明:“改了什么;依据什么结果判断;还有什么未做。”下面是一段示例:
新页面保存在patch-large.html,原文件保留。主要介绍、细节正文和两个按钮可以在18与24像素之间切换。
已在390与320像素宽的预览中操作两个按钮,字号切换没有改变细节的展开情况,文字未出现横向超出。当前结果满足本次要求。
页面没有公开发布。实际读者是否觉得更便于阅读,还需要请他试用。
按本次真实过程写这段说明。没有做过320像素预览,就不写这一项;由你完成的检查,就明确写成你的观察。这里需要的是清楚交代结果,不是列出尽可能多的完成项目。
配套的patch-large.html提供了一种完成写法,可以打开对照。它本身是一份普通网页,不会演示或重放智能体的制作过程。学习连续协作,需要观察自己的实际操作,以及模型怎样接着处理。
回看这次委托。 找到一项已发生的工具操作、一次受到结果影响的安排,以及一项需要自己决定的事情。再问问自己:AI接过部分操作以后,我是否更清楚作品要改善什么?实际结果是否帮助我形成了新的想法?
一个小按钮的价值,来自它回应了一个具体需要。能够连续完成工作,让我们有机会把更多注意力放在这样的需要上,也要求我们对目标与结果保持理解。
本章回望
一项任务可以拆成相互衔接的步骤。前一步的文件、计算或运行结果,为后一步提供材料。提前安排主要路径,有助于让工作稳定地接续起来。
模型、工具和人承担不同作用。模型根据要求与已有信息提出下一步,执行程序调用工具,工具返回真实发生的结果。读取了什么、保存到哪里、页面怎样变化,都应当能够回到具体对象上检查。
当模型结合结果选择后续步骤和工具,就出现了本章讨论的智能体式工作方式。固定工作流与模型选择可以配合使用。需要哪种方式,应当从任务出发,不以步骤多或自动化程度高作为唯一目标。
连续协作还需要清楚的委托。我们可以让已经同意的操作继续进行,也可以保留对内容、影响范围与完成标准的判断。知道什么时候继续、什么时候结束或交还给人,是完成任务的一部分。
第7章,你选择怎样讲述一件作品;第8章,你让读者能够操作它;本章,你又尝试组织AI与工具共同改进它。下一章,我们将把感知到的环境变化与作品的回应接起来,看看屏幕之外还有哪些值得探索的问题。
练习与继续探索
1. 说明步骤怎样衔接。 选择本次任务中的三个连续步骤,分别说出每一步需要什么、产生什么。若跳过中间一步,后面的判断可能缺少什么?
2. 比较两种“根据结果继续”。 一个程序预先规定“找不到文件就提示重新选择”;另一个应用由模型阅读返回信息后,决定检查文件名、换一种查找方式或向人提问。它们在哪里相似,下一步的产生方式又有什么不同?
3. 改变一个条件。 把预览窗口变窄,或使用自己原先设为默认展开的页面,重新完成一次相关检查。记录实际结果与下一步。结果正常时,说明为什么可以保留原有做法。
4. 判断一项新操作。 为了让页面更短,AI建议删去作品中的一句经历;为了让别人看到新页面,它建议立即发布。分别说清原来的委托是否包含这些动作,以及你需要了解什么才能作出决定。
5. 写清完成到哪里。 新文件已经保存,浏览器未能打开,AI写下“全部功能检查通过”。把这句话改成符合实际情况的说明,并指出下一步需要补上什么。
6. 把协作方法带到新事情中。 回到第1章留下的问题,或选择自己关心的一件小事。哪些步骤已经清楚,哪些需要看实际结果再决定?说明一项可以交给AI与工具的操作,以及一项你希望保留的选择。暂时不必增加新的软件平台。
本章资料来源
[1] W3C Web Accessibility Initiative. Understanding Success Criterion 1.4.4: Resize Text. 用于核对文字放大时保留内容与功能、允许浏览器缩放的基本原则。本章18至24像素的切换是教学示例,不据此宣称完成全部无障碍要求。访问日期:2026-09-21。https://www.w3.org/WAI/WCAG22/Understanding/resize-text.html
[2] Anthropic. Building effective agents. 原文发表于2024-12-19。用于核对预设工作流、模型选择行动、两者组合及停止条件的基本区分。本章限定讨论以大模型为核心的智能体,不把这一用法作为全部智能体研究的唯一界定。访问日期:2026-09-21。https://www.anthropic.com/engineering/building-effective-agents
[3] Anthropic. Tool use with Claude. 用于核对模型发出工具请求、执行程序调用工具并返回结果的关系。仅作原理参考,不指定课堂品牌、模型版本或接口配置。访问日期:2026-09-21。https://platform.claude.com/docs/en/agents-and-tools/tool-use/overview
[4] MDN Web Docs. Window: getComputedStyle() method. 用于核对浏览器读取元素最终样式值的基本能力。访问日期:2026-09-21。https://developer.mozilla.org/en-US/docs/Web/API/Window/getComputedStyle
[5] W3C Web Accessibility Initiative. Disclosure (Show/Hide) Pattern. 用于核对展开与收起按钮的键盘操作和展开信息。访问日期:2026-09-21。https://www.w3.org/WAI/ARIA/apg/patterns/disclosure/
[6] Google Research. ReAct: Synergizing Reasoning and Acting in Language Models. 2022-11-08。用于参照行动、环境观察与后续处理之间的联系,不要求学生复现论文系统或读取模型内部思考过程。访问日期:2026-09-21。https://research.google/blog/react-synergizing-reasoning-and-acting-in-language-models/
[7] Anthropic. Configure permissions. 用于核对工具执行中的允许、拒绝与人工确认机制,支持区分自然语言约定与实际权限设置。访问日期:2026-09-21。https://code.claude.com/docs/en/agent-sdk/permissions
第10章 让作品感知环境并作出回应
样章 v0.2 | 2026年10月8日 | 续写候选
杯子放上去,介绍出现了
一只杯子、一块橡皮,还在我们的桌面上。第3章,我们让模型学习区分它们;第4章,又比较过照片改变以后,模型给出的结果。
现在设想一个小小的介绍牌:把杯子放到摄像头前,屏幕出现你写的杯子介绍;换成橡皮,屏幕换成另一句话。来看作品的人可以移动实物,看看介绍怎样跟着变化。
这件作品与上一章的网页有什么不同?以前,读者按下按钮,程序改变文字。现在,摄像头持续提供图片,模型给出分类结果,程序再决定显示哪一段介绍。读者的动作进入了作品,作品又通过屏幕回应。
不过,杯子已经移走,屏幕可能还停在上一句话;模型可能把橡皮认成杯子;程序也可能收到结果,却没有改变显示。把这些环节接起来以后,我们需要看看每一步实际发生了什么。
本章以“桌面介绍牌”为主要尝试,复用杯子和橡皮的图像材料,输出选择屏幕文字。简单指示灯作为选做比较,不必同时完成。我们还会改变一个条件,观察结果,并保留自己直接选择介绍和停止自动回应的办法。
学完本章,你将能够:说明采集、模型判断和程序控制各自做了什么;观察一次真实输入带来的屏幕变化;区分发出要求与实际回应;解释延迟和输入变化的影响;说明何时需要自己操作。
10.1 从屏幕走向真实环境
10.1.1 摄像头、麦克风与其他传感器
第8章的小网页接收按钮点击。本章的介绍牌接收摄像头记录的图像。两者都有输入,只是输入与人的动作发生联系的方式不同。
摄像头把进入镜头的光记录成图像数据。图像中的杯子位置、明暗和颜色,会随着现场变化而改变。程序可以不断取得新的画面,再交给模型处理;连续图像分类的实际应用就会采用这样的做法。[1]
画面还在更新,是开始观察的重要条件。把杯子缓慢从左边移到右边,看看预览中是否出现相应变化。如果屏幕一直停留在一张照片上,先弄清它显示的是静态图片,还是正在接收摄像头的新画面。
静态照片也可以交给真实模型分类,但它记录的是拍摄时的情况。读取一张昨日拍摄的照片,不能说明模型已经观察了此刻的桌面。
换成声音任务,输入设备可以是麦克风。第4章讲过,声音变化经过记录成为按时间排列的数字。程序可以把一段新的音频交给声音分类模型,得到敲击、说话等类别。摄像头提供空间中的外观信息,麦克风提供一段时间内的声音信息。
设备还可以记录别的变化。光线传感器测量光照,温度传感器测量与温度有关的数值,加速度传感器感受运动变化。把某一种物理变化转成可供程序处理的信号,是传感器的基本作用。具体传感器有自己的测量范围和使用条件。[2]
这些输入不一定需要AI才能使用。若要求是“读数低于某个值时显示较暗”,普通程序比较数值就能完成。若要根据图像区分杯子与橡皮,则可以使用第3章形成的分类模型。是否引入模型,要看判断需要什么信息。
先查看这次实际输入。 将杯子移到镜头中央,停一会儿,再换成橡皮。先只观察预览,不急着看类别。画面是否清楚?物品有没有被截去一部分?镜头拍进了多少背景?你要先知道模型会收到怎样的材料。
把采集范围限制在桌面和练习物品上。自己的脸、同学的脸和屏幕上的私人内容,都不需要成为这个作品的输入。结束观察后,关闭采集。使用哪些设备和怎样开启,由课堂环境另作安排。
10.1.2 模型判断与现场实际情况
摄像头记录了一张图片,模型再处理这张图片。于是,我们面对两个可以分别检查的对象:现场实际摆着什么,模型给图片分配了什么类别。
下面是一段示例,数值用于理解结果。
| 我们看到的物品 | 模型输出:杯子 | 模型输出:橡皮 | 分数较高的一类 |
|---|---|---|---|
| 一只杯子 | 0.91 | 0.09 | 杯子 |
| 一块橡皮 | 0.44 | 0.56 | 橡皮 |
| 一件没有参与训练的新物品 | 0.83 | 0.17 | 杯子 |
第三行尤其值得留意。模型只在已有两类中计算,新的物品仍然可能得到“杯子”这一结果。分数较高,说明在这次计算里该类别更占优势;它不能证明现场确实有杯子,更不能表示这件新物品有83%的可能安全可用。[1]
如果我们希望“没有杯子也没有橡皮”时显示等待,仅凭两类模型的最高类别,未必能做到。增加“其他”或“空桌面”的训练材料,可以扩展本次任务,但这些材料也只能覆盖提供过的情况。人还需要检查作品在不同输入下的表现。
本次先保持已有模型和类别,研究结果怎样进入介绍牌。每次只放一种练习物品,换物品时观察类别是否及时变化。空桌面或陌生物品的结果作为限制讨论,不把作品用于自动确认物品是否齐全。
现场事实还包含图像没有记录的信息。画面中有杯子,不能因此知道杯子里是否有热水;类别为“橡皮”,也不能说明它是否干净、能否擦掉某种笔迹。作品只能围绕已经获得的信息回应。
因此,介绍文字要与实际能力相配。例如“模型当前选择了杯子这一类,下面是我为杯子写的介绍”,就交代了结果的来处。直接显示“你手里这只杯子可以安全装开水”,已经超出了图片分类支持的判断。
选一次实际结果来解释。 对照预览、物品和类别,说清模型收到了什么、回答了什么。若结果与现场一致,就记录一致;若不同,就指出具体差别。不要为了完成活动,补写一条没有出现的错误。
10.2 把判断变成可观察的回应
10.2.1 屏幕、声音与指示灯等输出
得到“杯子”这一类别以后,介绍牌还需要做一件事:选出相应文字,并把它显示出来。模型通常不会替我们完成所有页面操作。
先为两件物品各写一句介绍。可以写杯子怎样握持、橡皮留下了什么使用痕迹,也可以写自己为什么选择它们。文字来自你的观察和选择;模型提供类别,程序据此在两段文字中选择。
例如,杯子的介绍可以是:“这只杯子的把手比较宽,我习惯用两根手指握住它。”橡皮的介绍可以是:“这块橡皮的一角已经磨圆,保留了许多次修改的痕迹。”换成自己的物品,就重新观察和改写,不照搬示例经历。
程序接到分类结果,可以按事先写好的对应关系处理:杯子类对应杯子介绍,橡皮类对应橡皮介绍。屏幕显示内容,是普通程序的输出。计算机系统通过处理输入改变输出,这个基本关系也适用于按钮、屏幕、声音和灯。[3]
这里可以看清三种工作:摄像头采集图像,模型根据图像计算类别,程序按规则选取文字。只改介绍文字,不会让模型重新学习;只改模型,也不会自动把旧介绍改成新内容。
程序还可以决定何时采用结果。下面是一种用于讨论的规则:当分数较高的类别达到0.80时,显示该类介绍;不足时,显示“暂时不能确定,请调整物品位置,或手动选择介绍”。0.80只是教学设定,应根据实际表现比较,不是各类模型通用的可靠界线。
根据前一节的示例,0.91的杯子结果会显示杯子介绍,0.56的橡皮结果会显示等待。0.83的陌生物品仍然可能显示错误介绍。所以,加入一道分数条件,可以改变程序采用哪些结果,却不能消除所有模型错误。
把一项回应接起来。 在已经准备好的课堂练习环境中,为两类结果填写自己的介绍,先确认手动选择时两段文字都能显示,再开启图像输入。依次放入两件物品,观察模型类别与介绍是否对应。对照一次具体结果,说明是哪一个部分改变了屏幕。
若改为声音输出,可以播出一段简短提示;若使用教学板的指示灯,可以把类别对应到两种灯光状态。每种输出都要让人知道它代表什么。只有一种颜色的灯若亮起,应明确它表示“采用了某类结果”,不能让读者误以为作品确认了某项安全事实。
本章先完成屏幕回应即可。增加声音或灯以后,需要另外检查它们是否实际发生,不能直接沿用屏幕成功的结论。
10.2.2 检查回应是否真正发生
“准备显示杯子介绍”“程序已执行显示操作”“屏幕上看到了杯子介绍”,是逐步接近结果的三句话。我们应当根据自己取得的信息,说到相应的一步。
例如,模型给出杯子类,页面上的结果栏也写着“杯子”,介绍区域却仍然保留橡皮介绍。这时,图像分类可能已经完成,文字选择或显示还需要检查。重新训练模型,未必能解决介绍区域的问题。
又如,程序显示“已发送点亮要求”,桌上的灯却没有亮。发出要求和灯实际发光之间,还隔着通信、设备和供电等环节。仅看发送记录,无法确认结果已经发生。
我们通过观察或新的测量,得到实际回应的信息,这就是本章所说的反馈。屏幕文字可以直接看,声音可以听,灯光可以观察;提高活动还可以用其他传感器测量。收到一条设备消息,也要看它具体说的是“已接收”,还是已经取得了关于输出的测量。
这里可以做一次很小的检查。把杯子放好,先看预览中的输入,再读分类结果,最后看介绍区域。换成橡皮,沿同样顺序再看一次。把“模型选了哪一类”和“介绍出现了什么”分别说清,不需要抄下整段程序记录。
如果屏幕已正确显示,再读一遍文字,看它是否仍然符合自己的物品。程序执行成功和内容合适,也是两个问题。物品有磨损、介绍想表达什么,仍然由你决定。
比较一次手动与自动回应。 先用手动按钮选杯子介绍,再让模型触发同一段介绍。如果手动显示正常,自动显示不对,问题更可能出在输入、分类或两者与显示之间的连接;如果两种方式都无法显示,就先检查文字和页面输出。这样的比较能帮助缩小需要了解的范围。
反馈还决定作品怎样继续。灯没有亮时,连续发送许多次点亮要求,并不能证明每次都有效。先停止自动发送,检查连接或请人查看,再决定是否继续。本章用低风险的文字提示讨论这种关系,不让未确定的结果去控制门锁、加热装置或其他可能伤害人的设备。
有时只能完成部分尝试。用照片导入真实模型,观察到介绍变化,可以说明“照片分类与屏幕回应完成”,但现场连续采集还没有检查。按示例类别手动切换介绍,可以说明“输出规则的模拟完成”,此时没有摄像头感知,也没有模型推理。清楚交代做到哪一步,后面才知道还需补什么。
10.3 让作品适应变化
10.3.1 延迟、噪声与设备变化
把杯子换成橡皮,屏幕可能过一会儿才改变。现场发生变化与作品完成回应之间的时间差,称为延迟。
一次回应需要经历采集、模型计算和输出更新。不同设备和模型的处理速度不同,程序安排也会影响等待时间。模型在某台设备上的一次计算时间,不能直接当作整个作品从现场到输出的总时间。[1]
下面是一段用于计算的示例:图像采集和准备用了0.05秒,模型计算用了0.18秒,选取介绍并更新屏幕用了0.02秒。若这三部分依次完成,这次总共约需0.25秒。实际作品还可能有其他等待,要以实际观察为准。
0.25秒看起来很短,但读者把物品快速掠过镜头时,它可能已经离开,介绍才出现。于是,屏幕正在呈现的结果,可能对应稍早的一张图片。看到输出时,也要留意输入是什么时候取得的。
做一个缓慢变化的比较。 先把物品放稳,等介绍出现;再换成另一件,也放稳。随后可以稍微加快交换,观察屏幕是否跟得上。不要先断言“实时就是没有延迟”,也不需要为了测到小数点后的数值增加复杂设备。先说明是否有可察觉的等待,以及这种等待对读者有什么影响。
同一件物品放着不动,分数也可能有小幅变化。光线、阴影、摄像头自动调整和画面中的细微移动,都会影响输入。对当前任务无帮助、又让结果难以稳定的干扰,常被称为噪声。它可以来自采集环境,也可以出现在信号和处理过程中。
如果分数刚好围绕0.80变化,按“每次超过就显示、不足就等待”的规则,文字可能反复切换。这个现象与模型偶尔把类别完全认错不同,修改方法也需要对准实际原因。
一种可以比较的做法是:同一类结果连续三次达到条件,再采用该类介绍。下面是一段构造序列,每次都是杯子类分数较高,采用条件为达到0.80。
| 更新次序 | 杯子分数 | 连续达到条件的次数 |
|---|---|---|
| 第1次 | 0.86 | 1 |
| 第2次 | 0.77 | 0 |
| 第3次 | 0.88 | 1 |
| 第4次 | 0.90 | 2 |
| 第5次 | 0.89 | 3 |
按这一规则,要到第5次才显示杯子介绍。第2次不足条件,连续次数重新开始。连续判断可以减少短时变化立即触发的机会,同时增加等待;同一个错误类别若一直满足条件,仍然会被采用。连续三次也不能当作三位互不影响的观察者都同意。
除了输入变化,换一台摄像头也可能改变画面。新镜头的视角更宽,同一只杯子占的画面比例变小;电脑处理较慢,输出等待更长。这些都需要重新观察,不能只说“文件没有变,作品就一定一样”。
本次只选择一项变化:换背景、调整距离或改用另一台现有设备。保持其他条件尽量一致,比较变化前后实际发生了什么。结果保持正常,同样是一次有效观察;若变化明显,再讨论它最先影响了输入、模型判断还是回应速度。
10.3.2 调整方法并保留人工操作方式
一次变化以后,可以先改最容易核对的一处。画面被裁去了一半,就调整摆放;等待太久,就让物品停留得久一些,或减少不必要的重复处理;介绍频繁跳动,再比较是否需要持续满足条件。
如果某种背景下模型反复认错,还可以回到第3章检查数据。补充这种条件的训练材料,形成新模型,再用没有参与补充的新图片检查。这是对模型的修订。调整采用分数或连续次数,改变的是程序使用结果的办法。
要分清这两种修改。提高采用分数,可能让错误介绍少出现,也可能让许多正确结果进入等待;补充数据可能改善分类,也需要重新检查。不能只靠一项参数不断升高,就宣布作品已经可靠。
选择一个有依据的小改动。 从自己的观察中选一个需要处理的地方,先说清要改变什么,再改一处并复看。可以保留一句前后比较:“背景变暗后杯子常被选成橡皮;调整照明后,这次杯子介绍恢复出现,暗背景下的其他角度还没有检查。”若没有明显问题,也可以解释为什么暂时保留原来的做法。
介绍牌还应允许人直接选择内容。读者可以按“杯子介绍”或“橡皮介绍”,不必一直等待模型;也可以按“停止自动回应”,让作品回到手动模式。手动结果应标明由人选择,避免与模型判断混在一起。
停止以后,要实际看看:移动物品是否还会改变介绍?输入是否已经结束?如果只是把按钮文字改成“已停止”,摄像头和自动更新却继续运行,人的选择还没有真正生效。
重新开始也要清楚。用当前的新画面重新判断,不把停止以前留下的分数立即当作新输入。摄像头没有提供新图像时,页面应说明暂时不能自动判断;旧介绍可以保留供阅读,但要标明它来自上一结果或手动选择。
这些办法让作品在条件不足时仍然能被使用。模型帮助减少一部分操作,人保留理解物品、选择内容和停止采集的能力。自动回应是否值得采用,要看它给读者带来了什么,而不只看它能否一直自动运行。
让摄像头、模型和输出共同参与,我们已经接触到AI与物理环境发生联系的一种基本形式。更复杂的物理AI作品还可能移动、抓取或改变环境,需要处理更多现场反馈。桌面介绍牌帮助我们先看清采集、判断、回应和检查之间的关系,不要求在本章制作机器人。
请一位读者看一看。 如果课堂条件允许,请他缓慢放入两件物品,读一次自动介绍,再试一次手动选择。问一个具体问题:“你能看出介绍来自模型选择还是手动选择吗?”根据实际反馈修改一句提示,或说明为什么暂时保留。没有组织试用,就记下这一项仍待完成。
本章回望
作品通过摄像头等设备取得环境信息,模型计算它能够处理的判断,普通程序把结果转成文字、声音或灯光。各部分相互接续,也各有需要检查的地方。
现场物品、模型类别和实际输出分别提供不同信息。分数不能代替现场事实,发出要求也不能代替回应已经发生的观察。反馈帮助我们了解结果,并决定继续、调整还是停止。
延迟让当前看到的输出可能来自稍早的输入;环境和设备变化会影响采集及处理。等待连续结果可以改变回应方式,却不能保证分类一定正确。根据具体观察作出一项修改,比盲目增加规则更有帮助。
这一次,我们只把两种物品与两段介绍接起来。下一章,你将从自己的需要出发选择一个小问题,决定采用哪些已经学过的方法,也可能发现一种直接、简单的做法更合适。
练习与继续探索
1. 说清三个环节。 杯子进入画面,模型给出杯子类,屏幕出现一段介绍。分别指出设备采集了什么、模型计算了什么、普通程序改变了什么。只修改介绍文字,会不会让模型更会认杯子?
2. 判断一条说明。 两类模型把陌生物品判断为杯子,杯子分数为0.94。有人写下“现场有杯子,判断已经核实”。这条说明还缺少什么依据?你会怎样表达已经取得的结果?
3. 检查回应。 程序报告已发送亮灯要求,灯没有亮。你现在能够确认到哪一步?若改用屏幕文字输出,应观察什么才能确认显示完成?
4. 算一段等待。 采集和准备用了0.04秒,模型计算用了0.21秒,页面更新用了0.03秒,三步依次完成。总共约多少秒?这个数能否保证换一台电脑后仍相同?
5. 读一串结果。 五次较高类别都为杯子,分数依次为0.82、0.84、0.79、0.86、0.88。若要求连续三次达到0.80,是否会采用杯子介绍?若下一次为0.90,会怎样?解释连续判断改变了什么、仍没有保证什么。
6. 留下自己的选择。 本次作品在一种背景下工作正常,在另一种背景下结果不稳定。选一项可检查的调整,并说明手动操作怎样保留。没有真实输入条件时,可以在构造序列上比较规则,同时明确现场采集和模型运行仍未验证。
本章资料来源
本章表格与时间数值为教学示例;活动结果由实际观察填写。配套的桌面介绍牌已经提供手动、照片模型和构造序列入口;摄像头现场与课堂活动仍须据实际条件核验。教师资源说明模型路线、验证范围与开展条件。
[1] TensorFlow 官方仓库. Image classification;Android image classification example。用于核对图像分类的输入、类别输出、连续摄像头分类及性能与设备有关的基本关系。文中示例未复现官方具体模型。访问日期:2026-10-08。
[2] Micro:bit Educational Foundation. Sensors。用于核对运动、光照、温度等传感输入的基本用途,不指定课堂硬件或采购。访问日期:2026-10-08。
[3] Micro:bit Educational Foundation. Inputs, outputs and processors。用于核对输入、程序处理与可观察输出的关系。访问日期:2026-10-08。
第四单元 形成自己的选择,参与未来
第11章 发现问题,做出自己的改变
候选样章 v0.1 | 2026年10月8日
胶棒放在哪里
设想你参加一次纸卡制作活动。桌上有彩笔、胶棒和便签,分别放在几个盒子里。熟悉这里的人伸手就能拿到,需要第一次使用的人却可能先翻开两个盒子,再问旁边的同学:“胶棒放在哪里?”
你想到,可以做一个小工具。拍照识别材料、按语音查询、自动提醒归还,都像是有趣的办法。不过,认真看过桌面以后,又有一个更简单的问题:盒子上没有清楚的名称,原来的位置说明也被压在材料下面。先让人知道哪个盒子放什么,会不会就有帮助?
前面几章,我们已经体验表达、生成、程序运行和环境回应。这一章,你可以从自己关心的事情中选择一个小问题,做出能够让别人试用的作品,再看看原来的想法是否需要改变。材料桌只是用来说明方法的例子,你可以继续改进自己的网页,也可以选择一页说明、一段声音或一个简单的交互作品。
作品不必很大,选题也不必相同。我们要认真完成的是:了解谁遇到什么情况,判断哪项改变值得先做,让实际结果帮助自己作出下一步选择。
学完本章,你将能够:从观察和交流中说明一个具体问题;比较已有办法与AI的可能作用;选择一项主要功能并做出可试用的成果;根据真实反馈修改或说明保留理由;交代作品的帮助与尚未验证的部分。
11.1 找到一个值得尝试的问题
11.1.1 观察和了解实际使用者
一个问题,常常藏在平常的小动作里。有人反复询问同一个位置,有人把说明放大以后仍然找不到关键信息,也有人完成一次操作后,无法判断是否已经保存。这些细节值得留意,但需要先看清发生了什么。
在材料桌的例子中,“大家找东西都很困难”还比较笼统。我们可以先观察一次取用:来的人想拿什么,从哪里开始找,在哪个位置停下,最后怎样找到。这样得到的内容,更容易帮助我们决定该改变哪里。
下面是一段观察记录的示例:
一位第一次使用材料桌的人想拿胶棒。他先看了桌面上的两个盒子,没有看见物品名称,随后问旁边的人。得到“左边的蓝盒”这个回答后,他打开盒子,拿到了胶棒。桌旁有一张位置说明,但当时被纸张遮住了。
这段记录让我们看见了寻找的过程,还没有证明每个人都会遇到同样的问题。它也没有直接说明对方想使用什么技术。接下来可以问:“刚才你先找了哪里?”“你原来以为胶棒会放在哪里?”让他补充我们看不到的想法。
这里的使用者,指实际会阅读、操作或接受这件作品帮助的人。做材料位置说明时,他可能是第一次参加活动的同学;改进声音作品时,他可能是不方便看屏幕的听者。想清楚给谁用,才能理解哪些细节有关系。
询问时,先谈对方要完成的事情。直接问“你是不是需要一个AI助手”,容易把我们的方案放进对方嘴里。问“上次找材料时,哪一步最费事”,更有机会听到他自己的经历。了解使用者的过程,也可能让最初的问题发生变化。[1]
例如,对方说:“我知道胶棒在哪,主要是不知道用完以后该放回哪里。”这时,作品需要帮助的是归还。再漂亮的查询页面,如果只说明怎样拿取,仍然可能漏掉实际需要。我们可以把问题改为“让第一次使用的人知道材料从哪里拿、用完放回哪里”,再决定本次先处理哪一部分。
观察与猜测也要继续分开。“他问了一次位置”是可以记录的事情;“他记性不好”则超出了这次观察。不要用对人的评价代替对情境的理解。说明被遮住、名称不清、盒子移动,都可能影响寻找,需要进一步确认。
开始自己的选题。回看前面留下的问题,或者观察一次熟悉的活动。选一件自己愿意继续了解的事情,记下发生了什么,再向一位愿意交流的人询问其中一处疑问。保留与问题有关的动作和回答即可,不需要收集姓名、联系方式或私人经历。
暂时找不到合适的人时,可以先写出自己的观察与疑问。需要了解谁、准备问什么,也能成为下一步。AI可以帮助整理问题,但它代拟的一段“使用者回答”,不能当成已经进行的交流。
11.1.2 比较已有办法,判断AI是否有帮助
明确问题以后,先看看人们现在怎样处理。材料桌上的口头询问、盒子名称、位置说明,都属于已有办法。它们可能各有作用:问熟悉的人容易得到回答,纸面说明不用打开设备,网页则可以让读者展开自己需要的部分。
原来的办法为什么还没有解决问题,需要具体分析。如果说明已经准确,只是被遮住,重新摆放可能比制作新网页更直接;如果每个人关心不同细节,能够选择展开内容的页面可能有帮助。改变应当回应发现的原因。
AI也有不同参与方式。它可以帮我们把长说明改短,比较两种排版,或者生成一个能运行的页面。这些工作发生在制作过程中。作品做好以后,展示固定的材料位置,可以由普通程序或纸面文字完成,使用时未必还要调用模型。
另一种想法是让模型阅读资料,再回答不同问法。它可能适合较多、较复杂的内容,却也增加了需要检查的事情:有没有取到当前资料,回答是否补写,给出的地点能否核对。第6章讲过的依据问题,在这里仍然存在。
因此,先问“它能帮助哪一步”。已有准确资料需要重新组织,可以请AI起草;位置经常变化,需要先决定谁更新资料;物品究竟放在哪里,则要查看现场。让模型生成一个地点,不能代替最后这一步。
可以比较两种办法,再选一个开始。例如,材料桌先做一张清楚的位置图;另一种办法是在网页中按按钮展开同一张图。前者便于直接放在桌边,后者可以接到已经完成的数字作品中。哪种更合适,与使用地点、读者习惯和手头条件有关。
比较时,可以请AI说明每种办法可能方便在哪里、需要什么材料。随后用实际条件核对:桌边是否能放纸张,读者是否会打开页面,图中的位置是否容易更新。回答提供了考虑方向,现场条件决定了这些方向能否采用。
也要留意,新办法会不会让事情多绕一步。原来抬头就能看见的说明,移进一个很难找到的页面,可能增加寻找时间。功能多、回答长、画面复杂,都不能单独证明它更有用。
为自己的问题作一次选择。用几句话说清目前的办法、仍有哪处不方便,以及准备先尝试什么。愿意使用AI时,指出它负责帮助哪一部分;决定暂时不用AI时,也说明理由。两种选择都需要与已经了解的情况相连。
选题可以随着了解继续调整。发现位置说明已足够清楚,真正的问题是材料盒被随意移动,就可以改为帮助归位;发现问题主要涉及活动组织,也可以先与有关人员商量。知道什么需要改变,比守住最初的技术想法更有价值。
11.2 做出一个可以试用的小作品
11.2.1 选择最重要的一项功能
有了方向,容易接着想到更多功能:查询、录音、提醒、统计、拍照识别。每一项都可能有用,但把它们同时加入,就很难判断哪一项解决了最初的问题。先完成最重要的一项,才能较快地让想法接受实际尝试。
在材料桌例子中,可以先把目标写成:“第一次使用的人能根据说明找到胶棒所在的盒子。”这个目标说明了人、情境和要完成的事情。它也留下了可以观察的结果:他查看说明以后,去了哪个位置,是否还需要别人指出。
“让活动更智能”暂时无法这样观察。“页面看起来不错”也没有告诉我们是否找到物品。可以继续追问:完成以后,使用者能够比现在更清楚地做什么?答案往往会帮助我们缩小作品的范围。
为了尝试一个主要想法而制作的初步作品,可以称为原型(prototype)。它可以是一张纸面位置图、一页能打开的说明,或者已经能够操作的小工具。原型让使用者接触具体内容,帮助我们发现设想中的遗漏。[1]
不同原型能检验的事情不同。纸上画出一个按钮,能够讨论按钮名称与位置;若由作者在旁边翻页,只能说明一次模拟操作。要检查程序是否能自己响应点击,还需要实际运行网页。说清当前做到了哪一步,就能选择适合的试用任务。
开始制作前,准备直接有关的材料。材料位置图需要知道盒子实际在哪里、放着什么,还可以准备一张不含无关人员的桌面照片或手绘图。不能靠AI补出尚未查看的布局。用假设摆放练习时,让人知道这是一套练习材料。
再想清楚使用时需要看到什么。只写“胶棒在蓝盒里”,可能遇到两个蓝盒;加上号码,则需要让桌上的盒子也有对应号码。说明中的名称、图中的位置和现场的标记,应当能够互相找到。缺少这一联系,读者还是要猜。
可以先写一小段制作说明:
我准备做一张材料位置图,放在活动桌旁。图中显示三个盒子及对应名称,胶棒放在2号盒。本次先帮助第一次使用的人找到胶棒。盒子号码和位置按当前摆放核对,归还提醒和材料数量暂时留到后续考虑。
这只是说明例。自己的作品可以选择别的目标,例如让读者找到一段声音的播放位置,或者知道按下按钮以后会出现什么。主要功能明确以后,再写出一个人可以亲自尝试的动作,以及完成时能够看见的结果。
确定这次做完到哪里。基本功能已经能够被阅读或操作,材料准确,可以请别人完成那件事,就可以进入试用。尚未形成实际文件、页面或可用作品时,先完成制作;只写了一个想法,还没有得到可试用的成果。
11.2.2 组合已经学过的方法和工具
制作时,从已经会用的办法开始。第2章帮助我们把观察写具体,第6章帮助核对材料,第7章帮助选择图文与声音,第8章帮助读懂并运行一个功能。按当前需要组合其中几种,就能完成小作品。
材料位置图可以在熟悉的文档或排版工具中制作。先画出桌面与盒子,再加上名称,调整到能够看清的大小。想使用网页时,可以沿用第8章的展开功能:读者按“查看摆放位置”,页面显示位置图与说明,再按一次可以收起。
这样,页面的输入是点击,程序根据当前显示情况作判断,输出是展开或收起。位置内容来自我们准备的资料。模型可以协助写代码和解释行为,浏览器执行已有程序。需要用到的对象与第8章相同,不必重新搭建一套复杂应用。
让AI帮助制作时,把当前材料与选定功能一起提供。可以先要求整理一段说明,也可以给出已经能够运行的文件,要求修改局部。每次都看看它实际取得了什么,完成了什么,哪些内容仍需要自己核对。
下面是一段制作要求的示例:
请依据这份已经核对的摆放说明,帮助修改我的练习网页。保留原来的标题和主要介绍,把展开部分改成三个材料盒的位置与名称,按钮写“查看摆放位置”。只能使用我给出的号码和位置,不补写材料数量。请指出哪一段控制展开,保存后让我实际操作比较。
AI给出的内容可能采用不同排版。先看关键事实有没有变化,再运行主要功能。出现一个不存在的盒子号码,需要改材料;按钮不能展开,需要检查程序;图像显示不出来,则要检查实际文件与引用位置。根据发生的情况寻找原因,比同时改动整页更容易看清。
纸面作品也需要检查实际效果。屏幕上看得清的小字,打印后未必适合站在桌旁阅读;俯视图容易说明盒子的排列,却可能让人不清楚应当站在哪一侧看。做出一份能拿到现场的初稿,才能研究这些情况。
作品内容与现实变化也要保持联系。材料换了盒子,旧位置图可能仍然清楚,却已经给出错误方向。先重新核对摆放,再修改对应文字或图像。自动生成、自动显示与及时更新,是不同事情,需要知道由谁处理。
对于简单交互装置,可以沿用第10章已经安全完成的输入与回应,只选其中一种。先在熟悉条件下检查是否真的出现提示,再让使用者尝试。新的小项目不承担消防、医疗或其他安全保障作用,屏幕提示也能形成完整的学习成果。
把初稿实际做出来。保存能够继续修改的版本,并亲自完成一次主要动作:读位置图找到目标,按按钮查看内容,或者让装置产生一次低风险提示。内容和行为基本符合预期,就邀请使用者试用;暂时没有完成的地方,写清当前限制。
11.3 让实际反馈改变设计
11.3.1 邀请试用,观察实际效果
自己熟悉作品,很容易知道下一步该做什么。使用者刚接触它时,可能不知道应该先看哪儿。这种差别让试用有价值:我们能够观察作品本身提供了多少帮助,哪些理解还依赖作者在旁边解释。
请一位愿意参与、实际会遇到这个问题的人试一试。可以说明我们正在检查作品,希望了解它是否清楚;对方遇到困难,也是在帮助我们发现需要改进的地方。暂时请同学代替使用者时,记录他与你原来设想的人有哪些相同和不同之处。
试用需要一件具体的事情。材料桌可以说:“假如你第一次参加活动,现在需要一支胶棒,请根据这张说明找到它。”不要接着说“先看2号盒”,因为这会把要观察的选择替对方完成。让任务明确,保留他自行理解与操作的过程。[2]
开始以后,先看和听。对方先看了标题还是图片,在图上找了多久,是否走向对应位置,哪里停下来询问。可以请他说出正在想什么。需要帮助时也可以提供,但说明帮助发生在哪一步,不能把得到提示后的完成写成全程独立完成。
不必为一次小试用安排复杂录像。选择一处最值得了解的动作,留下几句话就够。例如“他先看了左边的盒子,随后问我图中的左边是哪一侧”。这个记录能够指向具体修改,比“他觉得还行”提供更多信息。
完成以后,再问:“哪一步不清楚?”“你刚才为什么去那个位置?”“有没有哪项信息没有用上?”问题可以跟着实际情况变化。先理解回答的意思,不急着请对方评价整个作品,也不要求他提出完整解决办法。[2]
要把行为与意见放在一起看。一个人说页面很好看,却没有找到按钮,外观评价没有解决操作问题;另一个人顺利找到胶棒,但更喜欢另一种颜色,两项反馈可以同时成立。功能是否支持目标,与个人偏好,需要分别讨论。
试用也可能顺利。使用者看懂说明,找到对应盒子,没有提出新困难,就如实记录。接着可以问他依靠了哪一项信息,从中了解当前设计的作用。没有必要制造障碍,或者等到别人出错才承认这次尝试有意义。
完成一次真实的小试用。让使用者尝试主要功能,保留一项动作或原话,再问清其中一处原因。对方不愿继续时就结束;暂未邀请到合适的人,则把作品保留为待试用,写明准备检查什么。让AI扮演使用者,可以讨论可能性,不能代替这一步真实观察。
11.3.2 修改作品,说明价值与尚未解决的问题
得到反馈以后,先回到原来的目标。某项意见反映了使用困难、材料错误,还是另一种喜好?改变要回应具体原因。每条意见都值得理解,是否采用仍需要结合用途与自己的选择判断。
下面是材料位置图可能遇到的一段试用示例:
使用者看了图以后,先去桌子的另一侧找胶棒。他说:“我站在这里,图里的左边跟我看到的左边不一样。”作者发现,图中只用了左、右,没有说明观看方向,也没有给实物盒子加对应号码。
这段示例提示了一种原因,却不说明你的作品必然出现同样的问题。实际试用遇到别的情况,就研究自己的记录。可以请AI整理几种改法,再用原来的目标逐一比较,最终采用哪种由你决定。
针对示例中的方向问题,能够尝试给盒子加号码,让图与盒子使用同一标记。也可以加入桌沿或固定物作参照,帮助读者认出观看方向。选择时看看这项调整会不会遮住物品,换位置以后是否仍然清楚。
先改一处,再检查。把“胶棒在左边蓝盒”改成“胶棒在2号盒”,需要同时确认图上的2号与现场盒子对应。如果只改文字,没有完成标记,读者还是找不到。一次修改涉及哪些相互联系的内容,要看它实际怎样工作。
改完以后,重新尝试原来的任务。可以请刚才的人再试,了解修改有没有帮助;他已经见过位置,第二次更快也可能来自记忆。若条件允许,再请一位尚未看过的人尝试,能够补充新的观察。说明比较条件,才容易判断结果意味着什么。
收到审美意见时,可以修改,也可以保留。例如,对方建议把整张图改成动画,我们发现他已经顺利找到物品,而桌旁主要使用纸张,就可以保留静态图,并说明原因。采用反馈与解释取舍,都能体现认真考虑后的决定。
作品的价值,可以从它给使用者带来的具体帮助讨论。找到一个位置、听懂一句说明、少做一次重复操作,都是可能的帮助。需要看实际发生了什么,不把画面精美、调用了模型或功能较多直接当作价值证明。
表达帮助时也要说明范围。“这位第一次参加活动的同学,根据图找到了胶棒”能够对应这次记录;“所有人都会立即找到任何材料”还需要更多依据。没有计时,就不用写节省了多少秒;未使用新环境,就把适用情况留待检查。
可以用一小段话收束项目:“我想帮助谁做什么,做出了什么;试用时看见了什么,因此修改或保留了哪一处;还有什么没有确认。”再说明材料和AI参与的部分,保留可继续修改的作品。正在等待试用时,最后两项按实际情况写,不补写结果。
完成本章的小项目。基本学习保留问题说明、可试用成果、一项真实反馈与处理理由;尚未试用的作品明确写“待试用”,同时提出具体的下一步。已经试用并完成一次有依据的调整,或者说明了保留理由,就可以结束这一轮。新功能、新场景与更多使用者,留给以后逐步研究。
本章回望
一个值得尝试的问题,可以从一次寻找、一处停顿或一句询问开始。观察告诉我们发生了什么,交流帮助我们了解原因;比较已有办法,能够让新的想法与实际需要相连。
做小作品时,先选最重要的一项功能,准备有关材料,组合已经学过的方法。AI可以帮助思考与制作,普通工具也能够完成合适的部分。选择哪种办法,要看它帮助了哪一步,以及怎样检查结果。
真实试用让作品接受另一双眼睛、另一种操作习惯的检查。我们据此修改,也可以保留有理由的选择。写清实际帮助与尚未解决的问题,就为继续探索留下了依据。下一章,我们将回看这些经历,讨论AI怎样影响学习、工作和生活,以及自己愿意继续关注什么。
练习与继续探索
1. 把问题写具体。“大家都不会使用这个页面”和“一个人先点了图片,随后询问怎样播放声音”,分别提供了什么信息?选择身边一个小问题,写下一次可以观察的动作,再提出一个需要询问的问题。
2. 比较两种办法。同一个材料位置问题,可以增加纸面标记,也可以制作查询网页。分别说明它们需要什么、可能帮助哪一步。结合实际使用地点作出选择,允许不采用AI。
3. 缩小一次制作。你准备做一件包含查询、朗读与提醒的作品。当前使用者最需要哪一项?选一个主要功能,说明要准备的材料、使用者的动作和完成时可观察的结果。
4. 设计一次试用。把“请先按蓝色按钮,再告诉我这个功能很方便吗”改成适合观察实际使用的邀请。说明准备看哪一项行为,以及遇到停顿时怎样进一步了解。
5. 解释修改后的结果。同一位使用者第二次很快找到了材料,为什么还不能只凭这一点证明新图更清楚?提出一种补充观察。没有条件继续检查时,怎样写一份与已有结果相称的说明?
6. 说明一次取舍。从自己的作品中选一项反馈,指出采用、暂不采用或继续了解的理由。保留一处尚未验证的情况,并提出能够开始的下一步。观点可以不同,已经完成的行动与结果按事实填写。
本章资料来源
[1] Design Council. The Double Diamond. 用于参照通过了解相关人群发现问题、比较办法、初步制作与小规模尝试改进之间的关系。本章采用学生可进入的小项目,不要求掌握完整设计流程模型。访问日期:2026-10-08。原始资料。
[2] Government Digital Service. Using moderated usability testing. 用于核对给试用者提出明确任务、避免提示做法、观察操作并追问原因的基本方法;正文没有把一次小试用当作完整使用研究。访问日期:2026-10-08。原始资料。
第12章 与AI共同生活的未来
候选稿 v0.1 | 2026年10月8日
再看最初的那个问题
第1章里,我们从一张旧包装纸开始:它除了包东西,还能用来做什么?有了纸和手电筒,怎样向同学展示一种会变化的影子?AI可以提出做法,但纸能否立起来,影子有什么变化,同学看到了什么,都需要实际尝试。
你也许选择了另一个问题,想介绍一件熟悉的物品,弄懂一种现象,或者让一份说明更容易阅读。现在,再找出当时写下的问题。它可能已经有了回答,也可能变得更具体了。最初想“做一个好看的网页”,后来发现自己更关心的是:第一次打开它的人,能不能看清那处值得注意的细节?
几章之间,我们接触了数据、模型、生成和证据,也尝试让内容变成可以运行的小工具。我们学习怎样说明要求,怎样看待不同结果,怎样听取别人的反应。这些经验还会延伸到以后怎样学习、与人交流、参与工作,以及怎样对待不断变化的技术。
本章不要求再增加一项程序功能。我们把已有的问题、作品和经历放在一起,看看认识发生了什么变化,也想一想接下来愿意探索什么。面向未来,可以保留期待,可以提出疑问,还可以带着理由作出暂时的选择。
学完本章,你将能够:结合一个实例说明工作任务怎样变化;用自己的解释和尝试检查学习情况;讨论AI参与交流时的信任与人的联系;考虑技术的使用机会与代价;回看一个问题,形成有经历、有理由的继续探索方向。
12.1 工作和学习正在发生什么变化
12.1.1 工作任务的变化与新的协作方式
设想你要向一位新读者介绍笔袋作品。完成这件事,可能包括选择照片、说明修补经过、安排文字、制作网页、检查按钮,以及听取读者意见。它看起来是一件事,里面却有多种任务。
第7章中,AI可以提出图文安排,你比较后选择自己的表达。第8章中,AI可以生成程序,你打开页面,看看按钮是否产生了需要的变化。第9章中,配有工具的AI还可能参与读取、修改和检查文件。随着工具能力变化,同一件事的分工也会变化。
工作中也有类似问题。一份物品介绍以前可能需要人从头起草,现在可以先生成候选文字;逐份整理的材料,也可能由工具先分类。随后仍要确认讲的是哪件物品,向谁介绍,哪里需要补充。环节怎样分配,要结合实际结果决定。
工作任务的变化,包括原有步骤被调整,一些步骤交给工具,也可能出现过去没有安排的新任务。例如,生成介绍后,需要辨认哪些细节来自观察,哪些是模型补充;多人协作时,还需要让后来接手的人知道材料和修改的来路。任务的多少、先后和要求,都可能随之改变。
国际劳工组织在2025年的研究中,按职业包含的任务分析生成式AI可能带来的影响。技术影响部分任务,不能推算为相同比例的人已经失去工作;潜在影响与实际变化需要分开理解。[1]
因而,听到“某种职业会被AI替代”时,可以先问:说的是哪项任务?依据什么能力和条件?现场是否实际采用了这种做法?一种职业还包含哪些事情?这些问题帮助我们理解消息,也避免仅凭一张职业清单安排自己的未来。
技术的作用还受到组织方式影响。同样能生成介绍的工具,可以被用于减少重复填写,让人有时间了解使用者,也可能被用于要求人完成更多份材料。我们需要继续问:时间用在了哪里,质量有没有改变,参与的人能不能表达意见?这些选择由实际使用技术的人和组织共同面对。
回看自己的作品,也可以把一次协作讲清楚:AI提出了哪些办法,程序实际做了哪些事,自己与同伴作出了哪些决定。若一项工作由人完成,就按实际情况说明。把过程中的贡献看清楚,才能讨论哪些分工值得保留,哪些需要改变。
你也可以选择亲手写下一段介绍,先画一张草图,再请AI帮助比较。亲自练习、了解材料或与人共同做一件事,本身就可能是目的。采用哪种方式,需要联系此时想得到的结果和愿意经历的过程。
12.1.2 借助AI学习,同时保持自己的理解
遇到一段不明白的解释,可以请AI换一种说法,补一个例子,或者提出问题帮助自己检查。第3章里的参数怎样影响分类,第5章里为什么要区分当前输入与训练,都可以由不同的例子逐步理解。
但读完一段顺畅的解释,还需要观察自己是否能够运用它。熟悉的句子有时会让人觉得已经懂了;换一份材料、一个数字,才发现不知道该从哪里开始。我们可以通过说明理由、实际计算和改变条件,让理解变得可以看见。
例如,第6章的纸桥材料写到,纸桥托住24枚硬币后,因为硬币用完而停止。有人据此说“这座纸桥最多能托住24枚”。读过解释以后,试着暂时合上材料,用自己的话说明这句话缺了什么依据。能够指出试验没有继续到塌下,就比只记住“要核对信息”更接近这个问题本身。
再把数字改成30枚,停止原因仍是硬币用完。你的解释是否还能成立?如果另一份记录确实写到放上第31枚时塌下,判断又会怎样变化?在改变条件后继续说明理由,有助于分清自己记住的是原来的句子,还是理解了材料与结论之间的关系。
AI可以参与这一过程。你可以先给出自己的解释,请它指出哪一步还不清楚;也可以请它提出一道条件稍有变化的问题,自己作答后再比较。准备新的练习材料时,要核对其中的事实和计算。模型给出的评语,也可以与原文、演算或实际运行结果对照。
学习的目的不同,使用方式也可以不同。想理解按钮怎样改变页面时,自己读一段关键程序并实际点击,能够帮助建立联系;想尽快把已经理解的重复格式整理完,可以更多地借助工具。开始之前说清此时要练什么,更容易决定哪些步骤值得亲自经历。
还有一些学习需要与他人相遇。向同伴解释一次计算,听见对方追问,可能让你发现省略的条件;请读者试用网页,才能知道他怎样寻找按钮。AI可以提供练习和建议,同伴、教师、书籍以及亲手尝试,也提供不同的帮助。
联合国教科文组织的学生AI能力框架,把基础知识、批判判断、创造和以人为本的思考联系起来,也关注持续学习。[2]在本书里,这可以落实为一个具体习惯:得到帮助以后,再留下一次自己的解释或尝试,看看自己能否在新条件下继续思考。
不必为每段学习都填写记录。选一个真正困惑过的地方,讲清原来怎么想、现在能够解释什么,以及仍有哪一点不确定,就已经留下了有意义的变化。
12.2 技术怎样影响人与人的关系
12.2.1 交流、信任与真实的人际联系
第7章里,一位读者可能喜欢笔袋上不整齐的针脚,另一位读者可能觉得更整洁的画面好看。他们理解了同一份材料,却有不同偏好。倾听这样的分歧,可以帮助我们了解对方,也看清自己的选择。
AI可以提出另一种看法,帮助整理不容易说清的句子。不过,模型给出的意见,与一个人看过作品后说出的感受,形成过程不同。第5章已经讨论过,模型利用训练中学到的关联和当前材料生成回应。具体读者的意见,则来自他这一次的观看与经历。
例如,你想解释为什么留下蓝色补丁,却担心话说得太生硬。可以先请AI提出几种表达,选一段符合自己意思的文字,再与同伴交流。对方可能提出AI没有考虑到的问题:“我不知道这是谁修的”“我最想看的是修好后能不能继续用”。认真回应这些话,交流就会向前推进。
信任涉及我们愿意依据谁的信息作判断,也涉及相信对方会怎样对待自己。它在长期来往与具体事情中逐渐形成。一次准确的回答可以成为依据,说明错误以后愿意修正,也可能帮助维持信任;只让语气显得亲切,还不能说明事情已经办妥。
第9章的工具协作提供了一个例子。AI说“网页已经改好了”,你仍要打开它,查看实际结果。同伴答应帮你试用,也需要真正看过页面,才能反馈。对象不同,我们都可以把一句承诺与已经发生的事情联系起来,而不只依靠表述是否流畅。
说明AI参与的部分,也是在帮助别人理解交流的来路。如果一段作品介绍经过AI协助,可以具体交代自己提供了材料、工具帮助修改了句子,以及最后怎样选择。别人既能读作品,也能进一步问作者为什么这样表达。简单署上自己的名字,不能代替对作品内容的了解。
同样的道理也适用于照片、声音和转述。生成的一段声音、整理过的文字,可以传达信息;它们是否记录了某个人实际说过的话,需要另外确认。第6章对原始材料和转发配文的比较,提醒我们回到具体内容及其形成过程。
技术有时能帮助人们更容易交流。例如,把已经允许使用的声音材料转为文字,可以给不便听音频的人另一种阅读方式。帮助应当联系对方的实际需要。有人希望看文字,有人希望先听口头说明,直接问一问,比替所有人预先决定更合适。
当有人愿意向你讲一件重要的事,倾听、陪伴和回应也有自己的意义。一起修补物品,一起看完一次试验,记得对方关心的细节,都构成了人与人之间的关系。我们可以在这些事情中使用技术,也保留面对面交流和共同经历的时间。
想一想,你曾经获得的一条帮助来自哪里?它可能是一段解释,也可能是一个人耐心等你再试一次。说清它为什么重要,有助于认识自己希望怎样与人相处,而不只比较哪一种工具回应得最快。
12.2.2 使用机会、个人数据与技术带来的代价
做出一个网页以后,我们开始问谁能打开它,谁看得清,谁可以操作。第9章增加放大文字的功能,正是从一位读者的需要出发。不同使用者还可能有不同设备、网络条件、语言习惯和阅读方式。
技术提供的机会,只有在实际条件允许时才能被利用。一个需要持续联网的活动,可能让连接不稳定的人难以参与;一段只有音频的说明,可能让当时不便播放的人错过内容。工具收费、设备配置和是否有人指导,也会影响学习的起点。
这些差异提醒我们,评价一份作品时,可以同时考虑内容与参与条件。有人采用简单文字,有人使用声音或图像,只要能够说明目的、讲清原理并展示实际结果,都可以形成值得讨论的成果。漂亮的生成画面,不能独自代表学习过程的全部价值。
改善机会也可以从小处开始。已有网页能否保留文字说明?不播放声音时,是否仍能找到主要信息?没有图片时,能否先完成表达?第7—9章提供过这些选择。具体条件有时需要学校和资源提供者一起改善,个人的一次调整未必解决所有差异,却可以让一个真实的人更方便参与。
使用技术时,我们还会提供材料。其中,一些信息能够与具体的人联系起来,如姓名、照片、声音或一段个人经历。别人向你讲述的事情,可能同时包含他的想法与处境。处理这样的材料时,要考虑他是否知道它将被怎样使用。
假如你只想请AI帮助修改笔袋介绍,可以先提供物品的颜色、用途和修补过程。是否需要同时放入同学姓名、照片和私下谈话,要另作判断。材料与任务之间有什么联系,哪些部分可以省去,可以在输入之前想清楚。
第4章中,录音留下的是采集到的声音。设备放在什么地方,可能影响还录到了谁、哪些内容。我们可以调整材料和采集方式,让注意力集中在本次要研究的对象上。只修改文件名,不能说明原来的照片或声音已经与人无关。
联合国教科文组织关于生成式AI教育应用的指导,关注人的自主选择、数据隐私、参与机会以及文化与语言差异。[3]这些问题并不都能由使用者独自回答。当我们不清楚材料会怎样保存、由谁接触,可以先询问学校安排的使用方式,再决定提供什么。
技术的代价还包括运行所需要的设备和资源。AI模型的训练与使用通常涉及数据中心中的计算设备;设备处理数据需要电力,保持工作温度也需要相应系统。国际能源署的报告对此作了说明。[4]屏幕上的一次生成很轻便,背后仍有实际运行条件。
不同任务、模型和设备的耗用情况会有差别。缺少相应测量时,我们不能把每一次提问都换算成同一个用电量。可以先考虑自己是否需要继续生成,已有材料能否修改后使用,以及简单程序能否完成当前功能。第8章的展开按钮在运行时就由普通程序完成,并不需要每次点击都调用模型。
技术可以带来帮助,也占用时间、资源并改变一些安排。比较时,把受益的人、需要的条件和可能付出的代价放在同一个问题里,能帮助形成更具体的看法。我们不必为技术贴上永久的“好”或“坏”标签,可以依据此时的目的和条件决定怎样使用。
12.3 面对未来,形成自己的选择
12.3.1 工具不断变化时怎样继续学习
未来你接触的AI工具,界面和功能可能与今天不同。某个按钮移了位置,一项过去需要手动完成的操作可能进入了工具,新的材料形式也可能出现。学习这些变化时,可以先从一个自己熟悉的小任务开始。
例如,把已经做过的物品介绍交给另一种工具,观察它接收了什么,生成了什么。它能读取照片吗?能够实际保存文件吗?回答引用的材料在哪里?只比较“看起来更好”还不够,选择一项与你的目的有关的结果,才容易把两种做法放在一起讨论。
此前学过的区别可以继续帮助你。模型训练与一次对话中的材料不同,生成操作说明与实际操作不同,某次测试通过与各种条件下都能使用不同。新工具出现时,回到这些问题,可以较快看清它的作用范围。
阅读说明也值得练习。先找与当前任务有关的一小段,确认它说明的版本和条件,再实际试一次。碰到不明白的词,可以查阅资料、请教师解释或向AI追问。必要时把多个解释对照起来,看看它们是否谈论同一件事。
持续学习,可以理解为在新的问题和条件下继续形成认识,并调整自己的做法。它包含学习新工具,也包含重新观察熟悉的东西。知道某一步可以省去,理解一项旧知识在新情况下仍然有用,都是学习的变化。
继续学习也需要适当安排。你可以选定近期真正想弄清的一件事,不必追赶每个新名称。完成一次小尝试,知道下一步该找什么材料,比收集许多尚未理解的术语更便于推进。若问题暂时超出当前条件,也可以留下疑问,等有更多帮助时再处理。
同时,给其他经验留出位置。阅读一篇写得清楚的文章,观察一件物品怎样被使用,练习一项专业技能,听不同的人说明自己的想法,都可能改变你提出的问题。AI参与其中时,可以扩展资料和表达方式;你对世界的认识仍会从多种经历中增长。
回看第1章那张旧包装纸,今天的工具也许能生成更复杂的方案,但那张纸的厚薄、你想呈现的影子,以及同学的观看感受,仍需要你了解。问题继续存在,我们可以带着更新的知识再次尝试,也可以选择研究另一个更关心的方向。
12.3.2 表达自己关心的问题与行动方向
现在,从第1章的问题和后来完成的作品中,选择一项认真回看。不必挑最精美的成品,也可以选择一段修改过的说明、一次比较,或一个仍没有完成的尝试。重要的是,你能联系具体经历说明自己的认识。
先读最初写下的那一两句话。你当时想弄清什么,已经知道什么?再看看后来的材料和作品,找出一项实际变化。问题可能缩小了,材料可能更完整了,也可能发现最需要解决的事情与原来想的不一样。
下面是一段回顾示例:
我最初想让AI把笔袋介绍写得好看。补充观察以后,我更想说明这件物品怎样继续使用。做成网页时,我注意到读者还需要看清补丁细节。我现在愿意保留简短正文和展开按钮,暂时不加背景音乐。下一步,我想请另一位读者试试看,了解他能否找到那处细节。
这段话把愿望、观察和选择联系了起来。它没有宣称所有读者都喜欢这个页面,也留下了下一步需要了解的事。你可以采用另一种选择:保留长一点的文字,改成声音作品,或者决定先把实物修好。选择不同,只要能够说明目的与依据,就可以继续交流。
接着,考虑作品和谁发生了联系。它可能帮助一位读者看清内容,帮助你向同伴说明经历,也可能只是让自己更理解一个原理。把作用说具体,能够看见已经得到的结果,也能够发现还有谁的需要没有了解。
如果第11章的作品已经得到真实反馈,可以选一条回看:你修改了什么,或者为什么保留原作?如果尚未有人试用,就说明自己现在依据哪些观察作判断,还准备向谁请教。未来设想可以大胆一些,已发生的事情仍按实际情况描述。
再提出一个愿意继续探索的方向。它可以是怎样让文字更容易读,怎样辨认材料支持的结论,怎样观察声音变化,也可以是如何向身边的人讲清技术选择。尽量给它一个能够开始的小动作,如重新拍摄一张图、读一份原始材料或邀请一次试用。
你可以写成几段话,也可以边展示作品边说明。说出一个问题、一次认识变化、一项选择和接下来准备做的事,就足以展开有内容的交流。无需为自己制定一份永久职业路线,也不要求此时回答未来的所有问题。
与同伴交换回顾时,可以询问:“哪件事让你改变了想法?”“这个选择帮助了谁?”“如果条件变化,你愿意怎样调整?”先听对方的经历,再谈自己的意见。不同方向可以并存,讨论帮助我们把各自的理由讲得更清楚。
技术还会继续变化,我们也会获得新的经验。一个现在合适的选择,后来可能需要修改。能够认真观察,学习必要知识,听取他人并说明自己的理由,让我们有机会参与这些变化,也决定自己愿意怎样生活。
本章回望
工作由多种任务组成。AI参与其中,会改变一些步骤、分工和要求。分析变化时,需要联系具体任务、实际条件和采用后的结果,不用职业名称替代对过程的了解。
借助AI学习,可以获得解释、例子和练习。自己的理解还可以通过复述理由、改变条件和实际尝试来检查。教师、同伴、书籍和现场经验,继续为我们提供不同的帮助。
技术参与人与人的交流,也带来关于信任、材料来路和参与机会的问题。关心使用者怎样接近作品,考虑提供哪些数据、运行需要哪些条件,有助于把便利与代价放在一起讨论。
回到最初的问题,我们可以看见认识怎样增长。有些问题得到回答,有些引出新的探索。对未来的判断可以暂时保留,自己的经历与理由则能够成为继续学习、创造和选择的起点。
练习与继续探索
1. 看清一项任务。选择本书中做过的一件事,说明它包含哪些步骤,以及人、模型和普通程序分别参与了什么。指出一处可能因工具变化而改变的分工,并说明还需要了解什么。
2. 检查一次理解。从第3—6章选一个曾经困惑的地方,先合上原文用自己的话解释,再改变一个条件继续讨论。哪些部分能够说明,哪些需要重新阅读或尝试?
3. 讨论一句完成承诺。有人说“我已经检查过网页,读者都会觉得方便”。这句话包含了哪些不同判断?你可以找什么材料或实际观察,分别了解它们?
4. 让另一位读者参与。回看第7—9章的作品,选一种不同使用条件,如不播放声音、没有图片或需要更大文字。提出一项小调整,并说明它帮助了谁。没有实际试用时,把预期与已经观察到的结果分开。
5. 比较一次技术选择。选择一种你使用过或想使用的功能,说明它带来的帮助,以及所需的材料、时间或设备条件。提出一个可以继续调查的问题,暂时不必给出统一结论。
6. 回到自己的问题。完成一份简短回顾,联系第1章的起点和一项后来经历:认识改变了什么,依据是什么,自己选择了什么,下一步愿意尝试什么。请一位同伴阅读,听取一个问题后再决定是否修改。
本章资料来源
[1] International Labour Organization. Generative AI and jobs: A 2025 update;How might generative AI impact different occupations? 2025-05-20。用于核对以任务分析职业影响、潜在技术影响与实际采用结果的区别;不用于预测个人就业结果。核对日期:2026-10-08。研究简报、研究方法说明。
[2] UNESCO. AI competency framework for students. 2024;官网页面更新于2026-01-16。用于参照基础知识、批判判断、创造、人的选择与持续学习之间的联系,不作为我国技工院校课程标准。核对日期:2026-10-08。官方出版页面。
[3] UNESCO. Guidance for generative AI in education and research. 2023;官网页面更新于2026-01-16。用于核对教育应用对人的自主选择、隐私、参与机会和文化语言差异的关注。核对日期:2026-10-08。官方出版页面。
[4] International Energy Agency. Energy and AI: Energy demand from AI. 2025。用于核对AI训练与使用涉及数据中心,以及计算、存储、网络和冷却设备的用电需求;本章没有估算单次提问的耗用或采用未来预测数字。核对日期:2026-10-08。报告章节。