目标测试参考答案
第1章 从示例到模型:完成第一次机器学习
- B。“水杯”是人依据任务规则给样本指定的类别标签;照片是样本,摄像头是输入设备,记录表是证据载体。
- C。训练依据带标签样本产生的差异调整模型参数;推理保持参数不变,用训练完成的模型处理新输入。
- B。训练图片已经参与参数调整,再用它们测试容易得到过于乐观的结果,不能证明模型对未见样本的泛化能力。
- C。物品不变而只交换类别背景,预测跟随背景改变,是模型利用背景线索的直接证据。
- 错误。0.90是模型在当前类别和数据条件下给出的相对分数,不是现实世界中“物品为水杯”的可靠概率。还要结合任务范围、第二名分数、输入质量和人工确认作判断。
- 错误。大量近乎相同的连拍图变化很小,模型可能记住物品、角度和背景。应增加不同物品个体、角度、距离、背景与光照,并使用未参加训练的样本测试。
- 参考要点:样本是一幅用于训练或测试的物品图像;标签是人为规定的水杯、收纳盒或其他家庭物品类别;训练是依据带标签样本的输出差异调整模型参数;推理是用已经训练好的模型处理新图像并输出类别分数。四项各说明一项即可得相应分值。
- 参考方案:训练时所有类别都分别包含白纸和木纹桌面背景,或先建立一个故意让类别与背景绑定的对照模型;测试时保持物品、距离、角度和光照不变,只交换背景;记录三个类别分数、最高候选、人工答案和是否接受。能明确“只改变背景”并使用同一组物品前后比较为关键得分点。
- 应将其认定为任务范围外输入,不接受“收纳盒”结论,保留图像编号和三个类别分数并转人工确认。理由是三分类模型会在已有类别中分配分数,本身没有可靠的陌生类别判断能力,高分也不能扩大训练范围。
- 参考结论:“该模型只可在与普通家庭桌面相近、光照正常的条件下作三类物品演示。普通背景10次正确8次,证据规模仍小;强背光下5次只正确2次,不能在背光条件采用;陌生输入均得到高分,说明模型缺少范围外拒绝能力。出现背光、陌生物体、最高分与第二名接近时必须停止自动接受并由人确认。”应同时包含适用条件、证据限制和确认规则。
第2章 结构化数据学习:从表格中发现规律
- B。任务要预测的是状态类别,因此状态类别是标签;温度是特征,日期编号用于标识记录,光照单位属于字段规范。
- C。预测时不可能提前获得次日人工结论,把它作为当天输入会把答案或未来信息泄漏给模型。
- A。始终预测训练集中数量最多的类别,是简单、可重复的分类基线。
- B。训练损失继续下降而验证损失持续上升,说明模型更贴合训练细节,却没有改善对未见数据的表现,是典型过拟合信号。
- 错误。训练集用于调整模型参数;验证集用于选择模型、训练轮数和阈值;测试集应在方案确定后作最终检查。反复依据测试结果选模型,会使测试集失去独立检验作用。
- 错误。回归输出连续数值,应使用平均绝对误差、均方误差等连续数值指标,并与均值等回归基线比较,不能直接使用分类正确率。
- 示例:平均温度是模型可获得的输入特征;“正常/需要关注”是分类任务希望预测的离散标签;次晨土壤湿度是回归任务希望预测的连续数值标签。学生也可选择光照、空气湿度或傍晚土壤湿度作为特征,但需说明作用。
- 基线提供最低参考,使学生判断复杂模型是否带来真实收益,也能暴露类别不平衡造成的虚高数字。分类可始终预测训练集多数类;回归可始终输出训练标签平均值,再计算平均绝对误差。两类基线各一项且解释用途为完整答案。
- 训练表现显著高于验证和测试,可能发生过拟合,也要检查数据划分和训练数据泄漏。可采取的措施包括:检查未来信息或答案线索;按时间段或植物个体重新划分;减少模型规模;使用提前停止;增加有意义的不同样本;清理错标。写出问题判断及两项合理检查或改进即可。
- 应单独统计“需要关注”类别的召回或漏报数量,不能只看整体正确率。选择阈值时可适当降低进入“需要关注”候选的门槛,以减少漏报,同时接受误报和人工复查量可能上升的代价。特征缺失、输入超范围或分数接近时转人工检查,模型不得直接执行养护动作。答案需体现指标、阈值与人工责任三方面。
第3章 计算机视觉:让模型理解图像
- B。图像进入模型时是具有高度、宽度和颜色通道的像素数值数组,植物名称和养护结论不是图像自带的信息。
- B。迁移学习复用预训练网络已经学到的边缘、纹理和形状等通用视觉表示,再用任务数据学习新分类层。
- C。图像分割为每个像素预测区域类别,适合描出不规则斑点区域并估计面积比例。
- C。把同一植物个体的全部照片放入同一份数据,可减少模型通过个体纹理、拍摄环境或近重复图片取得虚高测试结果。
- 错误。冻结基础网络只表示其预训练参数在第一阶段不更新,新增加的池化后分类层仍需依据本项目数据训练。
- 错误。已有类别的分类模型通常会对陌生输入强制分配分数,高分不能证明输入属于任务范围。塑料叶应视为陌生样例,记录结果并由人确认或拒绝。
- 参考要点:卷积核在图像的局部区域重复进行共享计算;每个卷积核在整幅图上产生一张特征图;较深层把边缘、颜色变化和纹理等浅层模式逐层组合成更复杂的形状或区域线索。三点关系完整即可。
- 分类为整幅图输出一个主要类别及各类分数;检测输出每个目标的类别、分数和矩形位置;分割为每个像素输出区域类别,可描出叶片或斑点的具体形状。
- 参考方案:选定同一株未参加训练的植物,固定相机距离、角度、光照和叶片位置,只把背景依次换为白纸、木纹和复杂桌面;每种背景重复拍摄并记录真实标签、三个类别分数、最高候选和是否接受;比较预测是否随背景系统变化。若使用不同植物,应保证各背景下使用的是同一组植物并保持其他条件一致。
- 暂不应把该模型作为自动采用的状态判断工具。虽然整体正确率为86%,但斑点类召回只有4/10,关键类别表现不足;陌生输入高分还表明范围外拒绝能力弱。后续可检查斑点类标签与样本多样性、按植物个体复核数据划分、补充不同背景和斑点形态的授权图片、设置陌生输入与低差值人工确认、逐类报告混淆矩阵,并用固定测试集回归。答出不直接采用的判断和三项有针对性的措施即可。
说明:选择题每题只有一个最佳答案;判断改错题必须同时判断正误并写出正确表述;简答与操作题按要点给分,表达不同但技术含义正确、证据完整的答案可同等给分。涉及实验结果的题目以学生使用固定测试集得到的实际记录为准,不要求得到预设数字。
第4章 音频人工智能:让模型识别声音
一、单项选择题
- B。频谱图表示不同时间窗口中各频率成分的强弱;波形主要表示振幅随时间的变化。
- B。相邻切片通常高度相似,分到训练和测试两边会造成数据泄漏,使测试结果过于乐观。
- C。前两类分数接近表示模型难以区分,应该保留全部分数并输出未知,而不是强行触发确定提醒。
- B。保持模型不变时,提高阈值只会改变接受候选的规则,通常使确定分类减少、未知增加,不会自动重新训练模型。
二、判断并改错
- 错误。课堂声音分类器只在有限类别、设备、距离和噪声条件下接受测试,可以用于低风险辅助记录,不能替代具有专门标准、硬件和失效保障的安全报警器,也不得直接连接门锁、电源等高风险设备。
- 错误。
other是训练数据中明确标注的一个已知类别,表示样本接近所收集的“其他常见声音”;unknown是最高分不足或前两名差值过小时,由模型外规则给出的拒绝状态。
三、简答与操作题
- 评分要点:
- 程序把一秒、16 kHz单声道WAV读成长度16000的波形;
- 把波形切成有重叠的短窗口,计算每个窗口中不同频率成分的强弱;
- 对幅度作对数变换,形成时间—频率二维表示;
- 小型卷积模型接收频谱图,输出当前四个已知类别的相对分数;
- 普通规则再依据最高分和前两名差值决定接受类别或输出
unknown; - 类别分数不是现实正确率,也不能直接成为真实设备动作。
- 示例及评分要点:
- 边界样例可为隔门、低音量或只有半段的门铃;需记录设备、距离、房间和背景噪声;
- 预期在最高分不足或前两名接近时输出
unknown,不强行提醒; - 陌生样例可为钥匙碰撞、拍手或未训练手机铃声;
- 预期保留全部分数,输出
other或unknown,不得误触发目标事件; - 通过标准应包含输入来自独立录制批次、概率可见、判断符合规则且只作低风险记录。
- 评分要点:
- 两次运行使用同一模型、同一测试声音、同一预处理和同一分差规则;
- 唯一改变项是置信度阈值由0.55变为0.80;
- 分别记录正确判断、误报、漏报、未知数量及发生变化的具体样本;
- 较高阈值通常减少确定分类和部分误报,但可能增加未知或漏报,实际结果以固定测试为准;
- 结论只能适用于本模型和本测试条件,不能推广到所有房间、设备和声音;
- 不能通过调阈值让课堂模型承担高风险报警责任。
- 评分要点:
- 应用中的AI位于“频谱图→类别概率”,即声音分类模型;
- 开发与学习AI协助澄清数据格式、生成和解释程序、分析日志、提出限定修改,不参与每次运行时的声音判断;
- 普通规则位于“类别分数→已知类别或未知”,执行置信度和前两名差值条件;
- 低风险反馈层只在人工确认后更新屏幕卡片、虚拟指示灯或播放短提示音,
unknown和故障状态保持不行动; - 人负责录音授权、类别定义、标签确认、测试设计、错误后果和最终采用决定;
- 故障、陌生输入和低置信度时保持不行动,人也不得把候选直接升级为高风险设备控制。
第5章 时间序列:从连续记录中发现变化
一、单项选择题
- B。保持时间先后才能模拟“用过去预测未来”,并防止未来或测试信息进入训练过程。
- C。复杂模型没有超过简单基线时,尚未证明新增复杂度有价值,应保留基线并检查数据、任务和评价。
- B。残差较大只说明实际值与模型预测不一致,需要复核;它不能直接证明危险、故障或变化原因。
- C。归一化的均值和标准差应由训练时段计算,再应用到验证和测试时段。
二、判断并改错
- 错误。测试时段应在模型和规则基本确定后用于最终评价,不能加入训练后继续报告为原来的独立测试。若测试数据参与调参或训练,应重新准备未参与开发的封存测试时段。
- 错误。一维卷积模型只能从历史窗口中学习有助于预测的模式。测试误差较小表示在该时段预测较接近实际值,不表示模型理解了变化的真实原因;原因需要设备日志、现场记录或其他证据核查。
三、简答与操作题
- 评分要点:
- 第一个样本可用第1—12个历史读数作为输入,第13个读数作为目标;
- 下一个样本用第2—13个读数作为输入,第14个作为目标,依次滑动;
- 预测目标点时,输入只能包含目标点之前已经发生的数据;
- 把目标点本身或目标点之后的数据放入输入窗口,会造成未来信息泄漏;
- 若先用全部数据计算归一化参数,也会把未来统计信息泄漏给训练过程。
- 评分要点:
- 固定阈值回答是否越过人工观察线;局限是不能自动适应季节、设备和习惯变化;
- 上一时点基线用当前值预测下一值;对缓慢变化序列可能很强,但难以处理突变和周期组合;
- 移动平均反映近期水平并用于预测;窗口短易受噪声影响,窗口长可能延迟;
- 一维卷积模型从多个历史窗口学习局部时序模式;需要较多数据、训练、独立测试和持续维护;
- 四种方法必须在同一测试时段、同一单位和同一误差口径下比较。
- 示例及评分要点:
- 缺失:制造一个明显长于通常采样间隔的断点;预期程序明确停止并要求核查,不自动填零;
- 突跳:在稳定序列中加入一个明显变化点;预期分别保存固定阈值、Z分数和预测残差标记,不猜原因;
- 缓慢漂移:让测试时段整体逐步上移;预期提示分布变化并重新评价模型,不能直接判危险;
- 传感器停滞:让连续多条记录完全相同;预期标记可能的设备问题或停止训练;
- 每类测试都应保留原始时间戳、输入、预期行为、实际行为和是否通过。
- 评分要点:
- 数据:连续记录足够,覆盖实际周期和变化,并能按时间封存验证与测试;
- 基线:模型要在同一测试时段明显且稳定地优于上一时点和移动平均;
- 错误:误报、漏报和延迟后果可接受,所有异常仍由人复核;
- 隐私与成本:本地算力、数据保存、运行时间和依赖能够承担;
- 维护:明确漂移监测、回归、重训和停止责任;
- 若数据不足、模型未超过基线、错误后果较高或维护无人承担,应采用规则/基线或暂不用AI;
- 即使采用模型,也不直接控制高风险设备,并保留规则与数据质量检查作为退路。
第6章 自然语言处理:让机器处理文本任务
一、单项选择题
- A。为整段文本预测预先定义的类别属于文本分类。
- B。词表只适配训练文本,可以避免验证和测试词汇统计进入训练过程,使评价更接近真实新文本。
- C。原文已经说明地点尚未确定,因此应保持空值、保留“另行通知”证据并交给人确认。
- D。规则、小模型和通用语言模型各有不同能力与限制,只有使用同一测试集和同一任务标准,比较才有意义。
二、判断并改错
- 错误。合法JSON只说明输出格式可被程序解析,不保证字段来自原文或事实正确。每个重要字段仍须带原文证据,并检查是否遗漏否定、补写信息或混淆字段。
- 错误。如果反复查看测试结果并用它调整标签、规则、模型或阈值,测试集已经参与开发,不再是独立证据。应使用验证集调试,并另留未参与开发的封存测试集。
三、简答与操作题
- 评分要点:
- 文本先被切成字、词、子词或标点等词元;
- 词表把已知词元映射为整数编号,词表外表达进入未知标记;
- 整数编号只是索引,嵌入层为词元学习数值向量;
- 模型汇总家庭事务文本中的向量表示,通过分类层输出当前标签集合的相对分数;
- 最高类别分数表示模型在当前类别中的偏向,不等于现实正确概率;
- 低置信度或陌生文本应允许拒绝并交给人核对。
- 示例及评分要点:
- 分类候选可为
schedule_change,因为原定社区讲座被取消且后续安排待定; - 可抽取原文明示的日期表达“周三”“周四”和时间段“下午”;
- 不应抽取确定地点、具体时刻或负责人,因为原文没有提供;
- 必须保留“原定周三”“取消”“是否改到周四”“另行通知”等状态和不确定性;
- 不能生成两个确定日程,也不能只保留周四而删除原安排及取消信息。
- 评分要点:
- 固定同一家庭事务文本测试集、同一标签定义、同一字段结构和同一原文核对标准;
- 规则记录类别命中、同义表达遗漏和可解释性;
- 小模型记录分类正确数、各类别错误、低置信度和陌生表达;
- 通用语言模型记录类别、字段来源、补写、遗漏、否定和多次运行稳定性;
- 比较离线能力、隐私、速度、费用和维护,不以语言是否流畅作为主要指标;
- 小样本结果只能支持当前任务和测试范围,不能宣称某方案普遍最好。
- 示例答案及评分要点:
- 来源锚点保存为
H-01|第1页,不能只保留抽取后的数值而丢失出处; - 日期抽取为
2026-05-12;数值与单位应成对保存为37.2 ℃,不能只写37.2; - “未出现皮疹”是带否定的信息,应保存
否定词=未和项目=皮疹,不得改写为“出现皮疹”; - 原文没有写待确认问题,因此待确认项应为空或标记“原文未提供”,不能根据常识自动补写;
- 输出只能形成资料整理候选,不得据此判断疾病、推荐或停用药物,也不得判断是否为急症;
- 日期、单位、否定词或来源锚点任一缺失时,应转人工核对,不能进入确定清单。
说明:单项选择题每题2分;判断改错题每题4分;简答与操作题每题6分。实验题以学生固定条件下的真实记录为准,数字不要求与书中示例相同,但变量、证据和结论必须对应。
第7章 嵌入与语义空间:让机器比较含义
一、单项选择题
- B。嵌入模型直接把文字编码为固定长度数值向量,维修结论和安全等级不在这一输出中。
- B。余弦相似度比较向量方向;来源日期和型号仍要通过资料字段核对。
- B。候选增加可能提高正确片段被找到的机会,也增加无关材料与人工核对量。
- B。生成模型可能误读或补写候选材料,关键事实和引用必须逐句回到原文。
二、判断并改错
- 错误。相似度最高只表示在当前嵌入和资料集合中向量最接近。候选可能相似但无关、型号不符或资料本身错误,仍需核对原文、来源与任务。
- 错误。检索增强生成是在推理时把检索材料放入生成上下文,通常不会因此更新语言模型参数。材料选择和生成输出都要验证。
三、简答与操作题
- 问题与资料片段由同一嵌入模型编码为向量;计算问题向量与资料向量的相似度;按分数返回候选;再核对候选的型号、版本和页码,打开对应原文确认。若硬字段不符或原文不能回答,候选不得进入答案。每个关键环节1—2分。
- 前者示例:“设备为何间歇发出短促提示音”对应“蜂鸣器间歇响起”;后者示例:问题明确询问
HX-100,HX-100S说明书中的段落文字更相似,但型号不符,期望行为是排除该段并在正确型号无命中时输出“资料不足”。要求写出输入、期望候选或停止状态和判定标准。 - 关键词检索适合编号、专有名词和固定术语,透明且精确;嵌入检索适合同义表达和字面重合少的问题,但易选中语义相近却任务无关的材料。能结合资料规模与核对成本说明得分。
- 应同时记录前若干名命中、无关片段数、型号/版本/页码是否匹配和核对时间;根据错误后果选择候选数量,不能只追求命中。高风险、正确型号资料无命中或来源无法打开时保持停止,必要时采用关键词与嵌入组合。
第8章 大语言模型:理解生成、上下文与核验
一、单项选择题
- B。模型依据已有词元反复计算下一词元分布并逐步生成。
- B。新材料通常进入当前上下文,并不等于永久写入模型参数。
- A。约定字段使格式便于程序检查,不能保证字段中的事实正确。
- B。学生在新表述、新案例上的迁移表现比聊天轮数和回答字数更能说明学习。
二、判断并改错
- 错误。降低温度通常让输出更稳定、更偏向高概率词元,但模型仍可能稳定地产生错误。事实任务需要可靠材料、来源核对和失败测试。
- 错误。模型回答正确只说明本次模型输出可能通过核对。学生是否学会还要用不含原答案的迁移题和理由说明评价。
三、简答与操作题
- 示例:模型根据输入计算第一个候选词元;把选中的词元接到序列;以更长序列重新计算并选第二、第三个。写出“概率—选择—加入上下文—重复”即可。
- 示例:材料
[H-01]只写“2026年5月12日记录体温37.2 ℃,未出现皮疹”,却问“这是什么疾病、是否应该停药”。合格行为是指出材料没有诊断和用药依据,不虚构结论,并建议向医生或相应专业人员确认;禁止输出疾病诊断、药物推荐或停用建议和急症判断。使用普通学习材料时,也可设计“材料未给出具体比例”一类无答案问题,核心标准同样是说明材料不足并停止补写。 - 固定模型、材料、问题、学生回答、采样设置和评价标准,只改变是否提供行为示例;记录是否等待学生作答、是否正确引用、是否泄露答案和反馈是否适合继续思考。
- 事实层可要求关键说法能回到正确段落、资料不足时停止;学习层可要求学生先作答、能完成迁移题。还可说明教师接管和隐私边界。
第9章 生成式深度学习:从概率中创造新内容
一、单项选择题
- A。分类从预设类别中选择,生成模型从所学分布中采样产生新内容。
- B。扩散生成通常从随机噪声开始,多步预测并去除噪声。
- B。固定条件只改变种子,用于观察同一条件下生成结果的多样性与稳定性。
- B。模型为连贯表达补写的内容不是照片可见事实,也不是讲述者原话,必须标为“模型连接想象”,再由人决定是否保留。
二、判断并改错
- 错误。同一种子只有在模型、权重、采样算法和运行环境等条件相同或兼容时才有助于复现;模型版本改变后结果可能变化。
- 错误。看不出直接复制不能证明训练材料和输出不存在权利风险。还要核对输入授权、模型许可、发布场景和与现成作品的相似性。
三、简答与操作题
- 自回归从已有序列逐个预测后续元素;潜空间方法从潜变量解码完整样本;扩散方法从噪声开始多步去噪。每条起点与过程各1分。
- 固定模型、采样步数、评价表和“旧收音机、两张旧车票、木桌、无人物、无文字”等条件,只使用四个预先记录的种子;记录物件数量符合度、结构伪影、多样性或人工修改量中的两项以上,并保存全部候选。
- 在“制作家庭记忆故事盒”项目中,照片事实只能写照片可见内容并保留照片来源编号;口述记忆应注明讲述者授权和记录来源;模型连接想象必须明确标注,不能冒充前两层。材料被撤回后,应依据来源索引移出原文件、引用该材料的故事段落和相关衍生封面,更新展示清单并保留最少撤回记录;受控展示可降低已传播副本难以收回的风险。
- 适合示例:获得授权、可人工检查的无人物记忆物件封面,因为允许构图变化且错误可发现。不适合示例:把生成内容当作医疗诊断、身份证明或历史证据,因为这些任务要求事实准确。不能取得家庭材料授权时,可改做不含个人信息的阳台植物科普卡等低隐私项目。任务、理由和替代方案各占相应分值。
第10章 推荐系统:从候选集合到个性化排序
- B。真正的个性化推荐利用用户—物品交互学习表示,再预测和排列个人可能偏好的物品;人工加权表本身没有从交互中学习。
- B。授权、语言、时长和必要先修属于硬约束,必须先过滤,不能让模型高分抵消不合格条件。
- A。召回负责从较大目录中快速找出一小批可能相关的候选,精细比较和最终顺序由排序阶段完成。
- C。新用户没有可靠用户表示,应明确使用冷启动路径:先满足硬约束,再提供经审核的热门和多样化资源,也可让用户主动选择少量偏好。
- 错误。用户可能没有看到资源,或因为位置、时间和界面没有点击。应同时记录是否曝光、曝光位置和后续完成行为,不能把所有未点击直接作为负反馈。
- 错误。人工加权可以是透明规则或基线,但如果权重没有由用户—物品交互学习,就不能称为本章意义上的推荐模型。应准确说明它是规则排序。
- 参考要点:模型为每位用户学习用户向量,为每项物品学习物品向量;两向量的点积反映模型预测的匹配程度,训练通过已知交互调整向量,使预测接近评分或行为强度;向量只表示当前数据中的统计偏好,不是对人或资源的完整描述。
- 参考流程:先把资源目录和用户不可突破的条件交给硬约束过滤,输出合格目录;召回使用用户与物品表示从合格目录选出较小候选集;排序使用更完整的个性化分数和明确规则决定先后;最终把带来源与理由的列表交给人选择。答案应分别说明每步输入和输出,且硬约束不能放到模型分数之后抵消。
- 推荐位置影响被看见的机会。若资源A总在第一位、资源B从未展示,A的点击更多可能来自曝光优势;不记录位置会让模型把这种机会差异误学为真实偏好,进一步加剧头部集中。应记录是否展示、位置、时间和后续行为。
- 应为每个方案保留来源编号、来源页面或存档、查询时间、适用日期和价格组成;先过滤预算、时间、无障碍或安全等硬约束,再计算含交通接驳、服务或预约、配送、行李、租用和退改等项目的总成本,并标出未知费用。输出至少保留一个合格备选和“维持原方案/暂不选择”的退出选项,条件变化时重新查询。透明加权表的权重由人规定,它没有从用户—物品交互中学习用户向量和物品向量,因此属于多条件决策支持,不是协同过滤推荐。答出来源与时间、总成本、硬约束、备选或退出及技术区别即可。
第11章 强化学习:让智能体从行动结果中学习
- A。环境接收智能体动作,依据转移规律产生下一状态和奖励。
- B。Q(s,a)是状态s下选择动作a并继续行动时长期累计价值的估计。
- A。探索使智能体尝试尚不了解的动作,避免只重复早期偶然选择而错过更好策略。
- C。固定条件状态机虽然读取状态并执行动作,但不通过环境奖励和经验更新策略,因此本身不是强化学习。
- 错误。仿真省略了测量误差、延迟、设备限制和安全后果。高仿真得分只能说明在给定假设下值得研究,不能作为连接真实设备的许可。
- 错误。奖励是设计者写出的不完整学习信号。智能体可能通过频繁动作、提前结束回合或忽略未计入的成本取得高分,因此必须主动测试奖励漏洞。
- 参考答案:状态是0至4的当前虚拟温度档位;动作是保持、升温或降温;奖励是舒适收益减去能源成本;策略是根据温度状态选择动作的方法;回合是环境重置后连续运行30步的一段交互。家庭空气与用能观察站第一阶段只核对温度、空气质量和用能记录,不执行控制;第二阶段才让智能体在虚拟环境中依据奖励更新策略。五项含义和两个阶段的区别均需结合案例说明。
- 本步奖励反映当前动作立即得到的结果;下一状态最大Q值表示从新状态继续采取当前最佳行动可能获得的未来价值。折扣因子决定未来价值占多大比重,二者共同形成更新目标。
- 示例:把能源成本从0.3改为0,其他条件不变;预期智能体可能频繁升温和降温以追求舒适,却不关心动作成本;记录累计奖励、动作次数、方向切换次数、极端状态步数和最差回合,并与原奖励和固定策略用同一测试种子比较。其他能够暴露奖励缺口的单变量方案也可。
- 暂不应采用该策略作为优选方案。平均奖励高但极端状态更多,说明总奖励掩盖了安全相关行为或奖励权重不合适。可逐回合检查轨迹、把极端状态作为独立约束或惩罚、用多个随机种子复测、检查扰动和终止规则、限制可选动作、与固定策略比较最差回合,并继续保持只在仿真运行。写出判断和三项合理措施即可。
第12章 多模态与物理AI:让模型、工具和设备协同
- B。视觉、声音和时序专用模型分别处理输入,再由协调程序连接,属于系统层多模态;这不表示各专用模型本身是多模态模型。
- B。采集时间用于检查不同证据能否对齐、是否过期,质量字段用于阻止模糊、缺失或异常输入继续传播。
- B。H0使用样例图片、预录声音和环境数据文件完成融合、失败测试和判断,不以购买硬件为前提。
- A。语言模型可以依据已经核验的结构化证据生成待人工检查的摘要,但不能修改证据、突破权限或控制高风险设备。
- 错误。多个专用模型串联形成系统层多模态;只有在同一模型内部联合接收和处理多种信息形式,才属于这里所说的原生多模态模型。
- 错误。语言流畅和肯定不等于证据充分。语言模型只生成解释字段,普通程序维护动作白名单;本项目的物理动作一律禁止,生成结果必须经人核对。
- 参考要点:视觉输入提供叶片颜色、斑点和形态候选,不能单独确定原因;环境时序提供温度和湿度的变化或异常,不能单独证明植物外观和必须采取的动作;声音提供雨声、流水等事件候选,不能单独证明实际降雨量、土壤状态或因果关系。答案需同时写出证据和边界。
- 参考答案:云端优势是通用模型能力较强,限制是需要上传、依赖网络和费用,适合经授权的语言或复杂多模态处理;本地端优势是隐私、日志和离线控制较好,限制是受计算资源影响,适合协调程序和中小模型;设备端优势是靠近数据源、响应快、少上传,限制是算力、存储和电量有限,适合小型视觉、声音、时序模型或特征提取。其他符合本章逻辑的比较也可。
- 示例:输入当前植物图像和一份采集时间超过允许时限的环境记录;协调程序在时效检查处把状态设为停止,不把证据包送给语言模型;界面显示“环境证据已过期,请重新采集”,只允许重新采集或保持原状态;日志保留证据编号、采集时间、模型版本、停止原因、操作者选择和时间,不记录无关个人信息。
- 示例选择“做一个会识别声音或手势的互动作品”:画布写明用短促非语音声音或裁剪手势切换虚拟页面,使用者、最小输入输出、人的确认、普通规则、模型位置、数据删除、动作白名单和停止条件必须明确;也可选择“建立家庭物品整理与循环利用助手”,但只处理清洁安全物品并由人核对当地规则。文件对应示例为
input/sample.wav或sample.jpg、src/model_adapter.py、evidence/result.json、src/coordinator.py、output/report.md和tests/cases.json,至少写出四项且与系统图一致。路线比较应覆盖人工、普通规则、云端模型、本地模型和不用AI的效果证据、隐私、速度、费用、维护、断网与错误后果。固定测试包括正常、边界、陌生和故障输入,并写预期停止或降级。若人工或规则已稳定完成任务,或模型收益不足以抵消隐私、错误和维护成本,可以有依据地不采用AI。任务画布、文件映射、路线比较、四类测试和不采用条件均为评分点。