第2章 人工智能的发展历程:三次热潮与两次低谷
章首语
第1章已经建立 AI_Project 项目目录,并完成了字符编码工具。从本章开始,我们为班级AI应用系统增加功能模块。班级AI应用系统由一个本地网站、逐章增加的AI功能模块,以及后期可以接入的输入输出设备组成。本章开发的第一个功能模块是规则问答机器人,用于回答实训室开放时间、设备借用流程和账号重置方法等固定问题。
在跨组测试中,另一组把“开放时间是什么”改成“我放学后还能来吗”,页面显示“没有匹配的规则”。输入“我不是来借设备的,只想参观”时,程序检测到“借设备”三个字,反而输出了设备借用流程。继续增加关键词可以解决一部分漏答,也可能使同一个问题同时命中多条规则。这些测试结果提出了一个重要问题:人的知识和语言表达能否全部写成明确规则?
这个机器人不接入大语言模型,而是使用明确的if-else规则。它处理标准问题时快速、稳定,也不会临时生成规则表中没有的回答;问题换一种说法后,它却可能无法匹配,甚至因为关键词相同而答错。本章将用这些测试结果理解规则方法的优点和局限,再按照图灵测试、达特茅斯夏季研究项目、符号方法、专家系统、机器学习、深度学习和大语言模型的发展顺序,分析不同时期研究方法发生变化的原因。
学习目标
完成本章学习后,你将能够:
- 说出人工智能发展中的三次热潮和两次低谷及其主要原因。
- 说明规则系统的基本结构、优点、适用范围和局限。
- 使用AI编程助手生成离线规则问答机器人,并识读关键逻辑。
- 用未知问题测试程序,记录漏答、误答和规则冲突。
- 根据测试证据修订程序,并准确说明它不能完成什么。
本章项目 开发规则问答机器人
本章开发一个使用if-else条件判断的规则问答机器人。小组先从“校园空间问答”“专业实训室问答”或“社团服务问答”中选择一个场景,再把八项固定问答写成规则,使用AI编程助手生成可以离线打开的网页。第一版完成后,不立即增加更多规则,而是先交给另一组进行未知问题测试。
每组设置四个角色。需求负责人决定机器人回答哪些问题;开发负责人向AI编程助手提交任务说明并保存版本;测试负责人设计标准问题、改写问题和干扰问题;记录讲解员整理测试结果并完成模块说明。三人小组可以由开发负责人兼任记录讲解员,但测试负责人不得同时决定全部规则,因为只测试自己熟悉的问题,很难发现程序的实际适用范围。
完成后的两个版本将加入班级AI应用系统的“人工智能技术史”展示页面。页面既要展示机器人能够正确处理的问题,也要展示它的失败类型、失败原因,以及后来的机器学习方法试图解决什么问题。
为机器人编写八条问答规则
2.1 先把知识写成机器可以执行的条件
日常交流中的一句“知道”,往往包含许多没有说出口的条件。例如,回答“实训室什么时候开放”,人会自然考虑工作日、节假日、课程占用和临时通知。程序不能自动获得这些背景。我们需要先把准备回答的范围缩小,再把范围内的知识写成明确条件。
规则是指在某个条件成立时,执行指定动作的明确约定。在规则问答机器人中,条件通常是输入文字包含某个关键词,动作通常是输出一条预先写好的回答。
以“校园创客空间问答”为例,第一版规则可以写成下表。表中不使用真实门禁、账号和个人联系方式,时间与地点均为课堂虚拟数据。
| 编号 | 输入中包含 | 机器人回答 |
|---|---|---|
| R01 | 开放时间 | 周一至周五16:30—18:00开放。 |
| R02 | 地点 | 创客空间位于实训楼二层。 |
| R03 | 借设备 | 填写借用单,经值班员确认后领取。 |
| R04 | 忘记密码 | 请在值班电脑旁查看课堂用重置说明。 |
| R05 | 打印 | 每组每天可使用一次课堂模拟打印服务。 |
| R06 | 社团 | 每周三开展社团活动。 |
| R07 | 报修 | 请记录设备编号和故障现象。 |
| R08 | 联系 | 请在开放时段到现场服务台咨询。 |
表中的开放时间、地点等内容是事实,“输入包含某个关键词时输出指定回答”则是处理规则。程序把这些事实和规则保存在知识库(Knowledge Base,KB)中。知识库是信息系统中集中保存事实、规则或业务资料的集合。在本章程序里,每条记录至少包含规则编号、关键词和回答,程序根据输入内容查询这些记录。
根据任务说明生成网页。 使用AI编程助手开发程序,不能只输入“帮我做一个聊天机器人”。这句话没有说明界面、功能、运行方式和验收条件,生成结果可能依赖网络,也可能包含多个文件和本章不需要的程序库。因此,开发前要先提交一份可以验收的任务说明。
开发任务说明:规则问答机器人 v0.1
目标:制作一个校园创客空间问答页。
运行方式:只生成一个index.html文件,双击后可在浏览器离线运行,不加载外部资源。
输入:一个文本输入框和一个“发送”按钮。
规则:按我提供的八组“关键词—回答”匹配;命中后显示回答;都未命中时显示“这个问题不在我的规则范围内”。
记录:在页面下方显示本次命中的规则编号。
界面:中文,字号清楚,不使用品牌标志。
验收:八个标准问题应分别命中R01—R08;关闭网络后仍能运行;不在范围内的问题必须明确拒答。
输出:先说明你准备怎样实现,再给出完整文件;不要省略代码。
将小组自己的八条规则附在任务说明之后,再提交给学校提供的AI编程助手。获得文件后,把它保存到小组项目目录,不要覆盖任务说明。第一次运行应完成三项检查:页面能否打开,标准问题能否命中,不相关问题能否得到范围提示。如果AI编程助手暂时不可用,可以打开配套资源 labs/ch02/index.html,使用同一组规则完成实验。
检查四处关键代码。 AI编程助手生成的页面可能有几百行。现阶段不要求逐行解释,但仍要检查与任务直接相关的代码。用文本编辑器打开文件,先寻找输入框、规则数据、匹配条件和输出位置。不同工具生成的写法会有差异,关键逻辑通常接近下面的形式:
if (text.includes("开放时间")) {
answer = "周一至周五16:30—18:00开放。";
} else if (text.includes("地点")) {
answer = "创客空间位于实训楼二层。";
} else {
answer = "这个问题不在我的规则范围内。";
}
if 表示先检查一个条件,else if 表示前一个条件不成立时继续检查,else 表示前面的条件都不成立时执行默认分支。代码中的 includes 只检查输入中是否包含指定文字,并不能判断整句话的真实意图。
网页呈现出一问一答的形式,程序实际执行的是确定的条件判断。相同输入在相同规则下得到相同结果,还可以通过规则编号追踪回答原因。结果可控制、过程可检查,是规则方法长期应用于特定任务的重要原因。
用未知问题测试第一版
2.2 标准问题通过,不代表能够处理未知问题
如果只用“开放时间”“地点在哪里”这样的标准问法测试,八条规则很容易全部通过。但是,实际使用者通常不知道程序设置了哪些关键词,也不会完全按照开发者预想的方式提问。测试负责人要把第一版交给另一组,只提供应用场景,不提供关键词。对方从四类问题中至少提出12问。
第一类是同义改写,例如把“开放时间”改为“放学后还能来吗”。第二类是否定或转折,例如“我不是来借设备的,只想看看”。第三类是多意图,例如“今天几点开放,打印要登记吗”。第四类是范围外问题,例如“能不能替我打开实训室门”。测试时不能临时修改规则,每次输入都记录实际回答和命中编号。
| 测试问题 | 期望行为 | 实际行为 | 结果类型 | 命中规则 |
|---|---|---|---|---|
| 放学后还能来吗 | 回答开放时段 | 显示不在范围 | 漏答 | 无 |
| 我不是来借设备的 | 不应介绍借用流程 | 输出借用流程 | 误答 | R03 |
| 几点开放,能打印吗 | 回答两个问题或请拆分 | 只回答开放时间 | 信息不全 | R01 |
| 替我开门 | 明确拒绝执行 | 显示不在范围 | 范围处理正确 | 无 |
跨组测试结束后,先统计回答正确的问题数,再分析错误原因。特别要标出三类现象:没有任何规则命中的漏答;命中了不该命中的规则而产生的误答;多条规则同时可能成立却给出不同结果的冲突。这些记录用于判断程序的适用范围,也为第二版修改提供依据。
比较八条规则和四十八条规则。 面对漏答,最直接的修改方法是继续添加关键词。“放学后还能来吗”没有命中,就加上“放学后”;“几点关门”没有命中,就加上“关门”;“我想用一下打印机”没有命中,就再加“打印机”。配套实训页能够添加一组变体规则,把知识库从八条扩展到四十八条。
规则增加后,一部分旧漏答会消失,但维护问题开始出现。“不要打印”同时包含“打印”;“设备借用报修”同时包含“借设备”和“报修”;“周三社团不开放吗”又把日期、社团和开放三个条件放进同一句话。如果程序总采用第一条命中的规则,那么调整规则顺序也可能改变回答。新增规则还可能与旧规则内容重复,却给出不同答案。
使用实训页的“冲突检测”检查四十八条规则,并记录规则总数、未知题答对数和冲突提示数。把八条规则与四十八条规则的结果并列比较:哪些漏答已经解决,新增了哪些冲突,规则顺序是否改变回答。不能预先认定“规则越多效果越差”,应根据测试记录判断覆盖范围和维护成本发生了什么变化。自然语言的表达方式很多,人工列出的关键词仍可能遗漏新的说法。
这次测试不能证明“规则越多越差”,也不能证明“规则系统没有用”。测试结果说明,在范围固定、表达有限的任务中,规则能够稳定工作;面对表达方式不断变化的开放问题,仅靠人工列出全部规则会越来越困难。人工智能发展过程中多次改变研究方法,也与这些能力限制有关。
从测试结果理解人工智能的发展
2.3 从“机器会不会想”到可以观察的行为
1950年,英国数学家艾伦·图灵发表《计算机器与智能》。他没有一直停留在“思考究竟是什么”的定义争论中,而是提出一种模仿游戏:一名判断者通过文字与看不见的对象交谈,再判断对方是人还是机器。后来,人们常把由此发展出的判断方式称为图灵测试(Turing Test)。
图灵的贡献不只是设计了一场问答比赛,更重要的是把一个抽象问题转成可以观察的行为问题。如果机器在交流中表现得像具有智能,我们就可以研究它用了什么方法、在什么条件下成功、又会在哪里暴露差异。图灵测试并不能直接证明机器具有意识,也不是衡量所有人工智能能力的唯一标准。图像识别、路径规划和故障诊断等系统,就不需要通过自由对话证明价值。
【旁注】本章的规则机器人不能处理开放对话,但它仍适合用来研究规则表示、条件判断、适用范围和方法局限。人工智能研究也不只研究机器能否模仿人的对话。
1955年,约翰·麦卡锡、马文·明斯基、纳撒尼尔·罗切斯特和克劳德·香农等人为下一年夏季研究活动写下计划书,并使用“人工智能”这一名称。1956年,研究者在美国达特茅斯学院讨论学习、语言、抽象、问题求解等主题。这个夏季研究项目常被视为人工智能作为一个研究领域的起点。
人工智能(Artificial Intelligence,AI)是研究和开发能够表现出感知、学习、推理、生成或行动等智能行为的计算系统的领域。这个定义强调计算系统能够实现的功能,不表示机器已经复制人的全部心智。不同年代的研究者关注的能力并不完全相同,因此人工智能包含多种研究方法,不是某一种算法的名称。
2.4 第一次热潮与第一次低谷
第一次热潮中的一种重要方法,是把知识和推理过程表示成符号与规则。早期计算机已经能够完成精确计算,研究者进一步尝试把棋盘状态、逻辑命题、单词和诊断条件表示为符号,再让程序按照规则搜索答案。这类方法后来常被称为符号主义人工智能(Symbolic Artificial Intelligence)。
这种思路取得过真实成果。程序可以证明某些数学定理、解决限定范围的难题,也能在设计好的对话脚本中表现出交流效果。1960年代出现的 ELIZA 程序会寻找输入中的关键词,再用模板把话题转回给用户。它并不理解用户经历,却让人们看到规则和语言模板可以产生近似对话的表面行为。
本章第一版规则问答机器人与这类早期程序采用相似的基本方法:开发者事先规定程序在特定条件下执行什么操作。它的回答稳定,命中过程可以追踪,禁止某些操作也比较直接,而且不需要用大量样本训练模型。对于菜单指令、设备状态判断和高风险流程中的强制条件,这种确定性至今仍有价值。
问题也同样清楚。现实世界中的常识数量巨大,语言表达不断变化,许多规则还存在例外。人知道“鸟通常会飞”,也知道企鹅、受伤的鸟和玩具鸟需要另作判断。程序若只写“如果是鸟,就会飞”,就会在例外处犯错;若为每种例外继续加规则,知识库会越来越难维护。
第一次低谷出现前,一些研究者和资助者对机器翻译、通用推理和机器人能力抱有很高期待。然而,当程序从经过严格限定的实验任务扩展到真实问题时,计算能力、存储空间、可用数据和常识表示都成为限制。早期机器翻译能够替换词语,却难以稳定处理语境;机器人能够在简化环境中规划动作,却很难应对真实环境中的变化。
1970年代前后,部分大型项目没有达到先前承诺,研究资助和社会关注明显下降。这一阶段后来被概括为第一次“人工智能寒冬”。它不是在某一天突然开始,也不能归因于某一条错误规则。技术能力、硬件条件、项目目标、商业回报和社会预期之间的差距共同影响了这一时期的发展。
从工程角度看,这段历史说明:演示成功不等于系统能够扩大到真实应用。一个程序在十道预先选择的问题上表现良好,不能证明它面对大量真实情况时仍然可靠。本章的跨组测试,就是用未提前公开的问题检查标准演示与实际使用之间的差异。
2.5 第二次热潮与第二次低谷
第二次热潮的重要代表是专家系统。面对通用智能研究的困难,研究者把目标限定在具体专业领域,将专家知识整理成事实和规则。1970年代到1980年代,专家系统(Expert System)逐渐受到重视。这类系统通常包含领域知识库,并按照规则对输入事实进行推断,在医学辅助、化学分析、设备配置和故障诊断等限定任务中取得成果。
专家系统的成功说明,缩小问题范围是一种有效工程策略。医生、维修技师和配置专家可以把一部分判断经验写成“如果出现这些条件,那么优先考虑这个结论”。系统还能记录使用了哪些规则,使人检查推断路径。对当时的机构来说,这种保存和复用专业知识的方式具有实际吸引力。
但是,把专家会做的事完整写下来,比想象中困难。专家有时凭长期经验注意到一个微小异常,却难以把整个判断过程说成固定规则;不同专家可能给出不同处理顺序;业务和设备更新后,旧知识库需要持续维护。规则越来越多时,重复、遗漏和冲突也会增加。我们的四十八条规则虽然规模很小,已经让这类维护压力变得可见。
1980年代后期到1990年代初,人工智能进入第二次低谷。一些专家系统在限定任务中继续发挥作用,但市场宣传超过了系统的实际适用范围。获取专家知识耗时,维护规则库需要持续投入,专用软硬件成本也较高;当业务环境改变时,系统不能仅凭新案例自动更新规则。
第二次低谷同样不能简单归结为“专家系统失败”。一些专用系统在限定任务中取得成功,却不能直接扩展为开放、通用、能够持续学习的系统。实际能力与投资者、用户的预期仍有较大差距,后续发展还需要新的数据、算法、硬件和工程方法。
人工智能历史中的两次低谷提醒我们,评价技术既不能只看宣传,也不能因为发展降温就认为原有方法毫无价值。规则方法后来仍用于业务流程、权限控制和安全限制,一些专家系统也长期服务于专业工作。新方法扩大了能够解决的问题范围,但旧方法在适合的条件下仍有实际价值。
2.6 第三次热潮:机器学习、深度学习和大语言模型
面对人工规则难以覆盖大量情况的问题,机器学习逐渐成为重要方法。开发者不再逐条列出所有判断条件,而是向程序提供样本数据,使模型在训练过程中调整参数。
机器学习(Machine Learning,ML)是让计算机利用数据形成模型,并用模型对新输入作出预测或判断的方法。人仍然要选择任务、准备数据、确定评价方式,但不再直接写出每一种输入对应的完整规则。
例如,要区分手绘圆形和三角形,规则方法可能要求人写“有三条边”“轮廓闭合”等条件。机器学习方法则给程序许多已经标注类别的图形,让模型在训练中调整参数。它可能学到人没有明确写出的组合特征,再对新图形进行分类。第3章将用可视化实验完整走过“数据—模型—训练—测试”的过程。
1990年代以后,统计学习方法、数字数据和通用计算设备持续发展。进入2010年代,更强的计算设备、更大的数据集和多层神经网络共同推动深度学习(Deep Learning,DL)在图像、语音和语言任务中取得明显进展。2012年前后的大规模图像识别结果成为一个广受关注的节点,这一进展来自多年算法研究、数据积累和计算能力提升,而不是某一项技术突然独立完成的突破。
2017年提出的Transformer架构改变了许多语言任务的处理方式。进入2020年代,大语言模型(Large Language Model,LLM)通过大规模预训练表现出生成文本、编写代码和处理多种任务的能力,人工智能进入新一轮广泛应用期。第4—6章将分别介绍自然语言处理、计算机视觉和大语言模型的发展,说明这些技术采用的基本原理以及仍然存在的问题。
机器学习减少了人工逐条编写规则的工作,却没有消除错误。训练数据可能不完整或带有偏差,模型可能在新环境中失效,复杂模型的判断过程也不一定像规则编号那样容易检查。因此,机器学习扩大了人工智能的能力范围,同时也带来了数据质量、模型解释和使用责任等新问题。
2.7 用时间线比较主要方法、成果和局限
下表按时间顺序比较七十多年中的主要方法、实际成果和局限。“三次热潮、两次低谷”用于概括总体变化,不同国家、研究方向和产业的发展并不完全同步,因此不必把各阶段的分界背成某个精确日期。
| 阶段 | 主要思路 | 实际成果 | 主要局限 | 本章程序中的对应证据 |
|---|---|---|---|---|
| 1950年代—1960年代:第一次热潮 | 用符号、规则和搜索表现智能行为 | 定理证明、限定问题求解、早期对话 | 常识难以完整表示,真实环境变化复杂 | 八个标准问题能答,换说法就漏答 |
| 1970年代前后:第一次低谷 | 检查早期承诺能否扩展 | 认识到演示与通用能力的距离 | 算力、数据、方法和预期共同受限 | 标准测试不能代表未知测试 |
| 1970年代—1980年代:第二次热潮 | 把专业知识集中到专家系统 | 限定领域的诊断、配置和决策支持 | 获取与维护知识成本高 | 规则从8条增至48条后冲突增多 |
| 1980年代后期—1990年代初:第二次低谷 | 重新评估投入和适应能力 | 一部分专用系统继续使用 | 市场预期、成本和适应性不匹配 | 新情况仍需人工追加规则 |
| 1990年代至今:第三次热潮 | 从数据中学习,并扩大模型与算力 | 识别、生成、预测和多任务助手 | 数据偏差、解释困难、幻觉与责任 | 下一章改用样本训练,但仍要测试 |
根据测试结果完成第二版
2.8 让适用范围和异常处理更加清楚
第一版测试记录显示了三类主要问题:同义表达可能漏答,否定表达可能误答,一个输入还可能同时命中多条规则。第二版不要求把十二个未知问题全部变成正确回答,也不继续无限增加关键词,而是合并重复规则、设置规则优先级、提示用户拆分多意图问题、说明可回答范围,并把涉及真实操作的请求转交现场人员处理。
可以把以下版本升级说明提交给AI编程助手。修改前先复制 index_v01.html,把新文件保存为 index_v02.html,这样才能比较两个版本的运行结果。
版本升级说明:规则问答机器人 v0.2
- 每条规则增加编号、关键词列表和优先级。
- 一个输入命中多条规则时,不直接采用第一条;显示冲突规则编号,并请用户把问题拆开。
- 输入含有“不是”“不要”等否定表达时,不得仅凭被否定的关键词给出操作建议。
- 未命中时说明本机器人只回答哪些主题,不猜测答案。
- 开门、代签、修改账号等请求必须拒绝,并提示联系现场人员。
- 保留命中日志和冲突数量,页面继续离线运行。
修订后的程序仍然可能无法真正理解所有否定句。这里加入的是一条有限保护规则,不是已经解决自然语言理解。测试时要重新运行原来的十二个未知问题,不能只测试刚修好的那一句。比较两版的正确数、漏答数、误答数和冲突数,并说明哪些改善来自新增规则,哪些问题仍然无法靠少量规则解决。
填写模块说明卡。 规则问答机器人需要配有说明卡,写清它使用的方法、适合的任务和已知限制,避免使用者把关键词匹配误认为大语言模型的语言理解。说明卡可以采用下面的结构,但内容必须来自小组自己的测试记录。
| 项目 | 填写要求 |
|---|---|
| 模块名称 | 与场景和功能一致,不使用“全能”“完全理解”等词 |
| 核心原理 | 输入包含关键词时,执行对应规则并输出预设回答 |
| 最适合的任务 | 范围明确、答案稳定、需要说明命中原因的固定问答 |
| 一项真实成功 | 写出一个未知测试问题、实际回答和命中规则 |
| 一项真实失败 | 写出漏答、误答或冲突及其原因 |
| 后续方法 | 从更多样本中学习规律,而不是继续穷举全部表达 |
完成说明卡时,要区分“程序实现问题”和“方法局限”。漏写范围外提示属于程序实现问题,可以直接修复;有限数量的规则无法覆盖全部自然语言表达,则属于规则方法面对开放任务时的局限。我们既要修复程序中可以修复的问题,也要说明当前方法无法在可接受成本下解决哪些问题。
完成技术演示和版本说明
每组展示控制在六十秒。前十五秒介绍应用场景和八条规则;接着用一个未知问题展示正确回答,再用另一个问题展示失败;随后比较v0.1与v0.2的一项变化;最后说明为什么第3章要进一步学习机器学习。展示不能只播放事先录好的成功过程,测试负责人可以现场随机抽取一个新问题。
互评不比较页面装饰,而检查四项证据:程序是否实际运行;未知问题是否由另一组完成;失败原因是否解释准确;适用范围是否说明清楚。程序如果能够稳定拒绝范围外问题,并明确说明限制,就比随意生成无法核验回答的程序更可靠。
班级AI应用系统保存两个程序版本。v0.1展示基本的关键词匹配规则,v0.2增加冲突检查、范围提示和人工转接。两个版本并列保存,使用者可以直接比较程序修改了什么,以及哪些问题仍未解决。
安全与责任
规则写得清楚,不代表规则本身正确;程序回答稳定,也不代表适合高风险场景。本章只使用虚拟校园数据,不录入真实密码、联系方式、健康信息和门禁权限。涉及现实操作时,机器人只能提供公开流程或转接人工,不能返回“已经开门”“已经修改账号”等虚假操作结果。程序对外展示时还要明确标注“规则方法演示程序”,避免使用者误认为它能够理解任意问题。
本章小结
人工智能的发展不是新方法不断完全替代旧方法的直线过程。1950年,图灵提出模仿游戏,把关于机器智能的讨论转化为可以观察的行为问题;1956年的达特茅斯夏季研究项目推动人工智能成为一个明确的研究领域。早期符号方法和后来的专家系统说明,知识可以表示为符号和规则,并在限定任务中产生可以检查的结果。
两次低谷说明,实验室演示、产业应用和开放环境之间存在差距。规则难以覆盖全部常识,专家知识获取和维护成本很高,算力、数据、方法与社会预期也会共同影响技术发展。机器学习逐渐成为重要方法:人提供数据和任务,程序从样本中形成模型。深度学习和大语言模型进一步扩大了能力,也带来了新的错误和责任问题。
本章用一个可运行的规则问答机器人复现了规则方法的基本特点。程序在标准问题上准确、稳定,命中过程容易追踪;遇到同义表达、否定、多意图和规则冲突时,则可能漏答或误答。第二版增加范围提示、冲突处理和人工转接,但没有宣称解决全部语言问题。下一章将进一步学习程序怎样从样本数据中形成模型。
习题
基础题
- 用自己的话解释“规则”和“知识库”,并说明二者在本章机器人中的关系。
- 图灵提出模仿游戏的主要意义是什么?为什么它不能直接证明机器具有意识?
- 按“主要思路—实际成果—主要局限”三个方面,概括专家系统的发展。
- “两次人工智能寒冬都是因为规则数量太多”这一说法是否准确?请说明理由。
应用题
- 某报修机器人规定:“输入中含‘坏了’就创建报修单。”用户说“设备没有坏,是插头松了”,系统仍创建工单。判断这是漏答、误答还是冲突,并提出一种有限修订办法。
- 电商客服、短视频素材分类和汽车故障提醒三个场景中,各举出一项适合固定规则处理的任务和一项更适合从数据中学习的任务,并说明选择依据。
探究题
- 【选做】把同一组12个未知问题分别交给v0.1、v0.2和一个大语言模型回答。自定两项评价标准,比较三者的优势与风险。不得输入个人隐私或真实内部资料。
- 【选做】查找一项今天仍在使用规则的系统。说明规则在其中承担什么职责,以及系统为什么没有把这部分完全交给学习模型。
本章交付物
1. 程序与过程证据
提交一个文件夹,包含 index_v01.html、index_v02.html、开发任务说明、至少12题的跨组测试记录和模块说明卡。两个页面都应能够离线打开。记录表至少包含一项失败证据,并能说明第二版针对哪项测试结果进行了修改。
| 评价维度 | 达成标志 |
|---|---|
| 程序运行 | 两个版本均可离线打开,规则编号与回答可见 |
| 测试证据 | 有跨组未知题,包含正常、改写、干扰和范围外问题 |
| 原理解释 | 能根据测试说明规则方法的优点、适用范围和局限 |
| 修订质量 | 第二版在冲突处理、范围提示或人工转接方面有实质改变 |
2. 自评单
- [ ] 我能指出页面中的输入、规则、匹配和输出四个位置。
- [ ] 我们保留了第一版,没有用最终文件覆盖失败证据。
- [ ] 未知问题由另一组提出,不是只测试自己写的标准问法。
- [ ] 我能解释一次漏答、误答或冲突为什么发生。
- [ ] 我们没有为提高正确数而让机器人猜测高风险答案。
- [ ] 我能说明为什么有限数量的规则难以覆盖开放语言,并由此引出机器学习。