目标测试参考答案

第1章 从示例到模型:完成第一次机器学习

  1. B。“水杯”是人依据任务规则给样本指定的类别标签;照片是样本,摄像头是输入设备,记录表是证据载体。
  2. C。训练依据带标签样本产生的差异调整模型参数;推理保持参数不变,用训练完成的模型处理新输入。
  3. B。训练图片已经参与参数调整,再用它们测试容易得到过于乐观的结果,不能证明模型对未见样本的泛化能力。
  4. C。物品不变而只交换类别背景,预测跟随背景改变,是模型利用背景线索的直接证据。
  5. 错误。0.90是模型在当前类别和数据条件下给出的相对分数,不是现实世界中“物品为水杯”的可靠概率。还要结合任务范围、第二名分数、输入质量和人工确认作判断。
  6. 错误。大量近乎相同的连拍图变化很小,模型可能记住物品、角度和背景。应增加不同物品个体、角度、距离、背景与光照,并使用未参加训练的样本测试。
  7. 参考要点:样本是一幅用于训练或测试的物品图像;标签是人为规定的水杯、收纳盒或其他家庭物品类别;训练是依据带标签样本的输出差异调整模型参数;推理是用已经训练好的模型处理新图像并输出类别分数。四项各说明一项即可得相应分值。
  8. 参考方案:训练时所有类别都分别包含白纸和木纹桌面背景,或先建立一个故意让类别与背景绑定的对照模型;测试时保持物品、距离、角度和光照不变,只交换背景;记录三个类别分数、最高候选、人工答案和是否接受。能明确“只改变背景”并使用同一组物品前后比较为关键得分点。
  9. 应将其认定为任务范围外输入,不接受“收纳盒”结论,保留图像编号和三个类别分数并转人工确认。理由是三分类模型会在已有类别中分配分数,本身没有可靠的陌生类别判断能力,高分也不能扩大训练范围。
  10. 参考结论:“该模型只可在与普通家庭桌面相近、光照正常的条件下作三类物品演示。普通背景10次正确8次,证据规模仍小;强背光下5次只正确2次,不能在背光条件采用;陌生输入均得到高分,说明模型缺少范围外拒绝能力。出现背光、陌生物体、最高分与第二名接近时必须停止自动接受并由人确认。”应同时包含适用条件、证据限制和确认规则。

第2章 结构化数据学习:从表格中发现规律

  1. B。任务要预测的是状态类别,因此状态类别是标签;温度是特征,日期编号用于标识记录,光照单位属于字段规范。
  2. C。预测时不可能提前获得次日人工结论,把它作为当天输入会把答案或未来信息泄漏给模型。
  3. A。始终预测训练集中数量最多的类别,是简单、可重复的分类基线。
  4. B。训练损失继续下降而验证损失持续上升,说明模型更贴合训练细节,却没有改善对未见数据的表现,是典型过拟合信号。
  5. 错误。训练集用于调整模型参数;验证集用于选择模型、训练轮数和阈值;测试集应在方案确定后作最终检查。反复依据测试结果选模型,会使测试集失去独立检验作用。
  6. 错误。回归输出连续数值,应使用平均绝对误差、均方误差等连续数值指标,并与均值等回归基线比较,不能直接使用分类正确率。
  7. 示例:平均温度是模型可获得的输入特征;“正常/需要关注”是分类任务希望预测的离散标签;次晨土壤湿度是回归任务希望预测的连续数值标签。学生也可选择光照、空气湿度或傍晚土壤湿度作为特征,但需说明作用。
  8. 基线提供最低参考,使学生判断复杂模型是否带来真实收益,也能暴露类别不平衡造成的虚高数字。分类可始终预测训练集多数类;回归可始终输出训练标签平均值,再计算平均绝对误差。两类基线各一项且解释用途为完整答案。
  9. 训练表现显著高于验证和测试,可能发生过拟合,也要检查数据划分和训练数据泄漏。可采取的措施包括:检查未来信息或答案线索;按时间段或植物个体重新划分;减少模型规模;使用提前停止;增加有意义的不同样本;清理错标。写出问题判断及两项合理检查或改进即可。
  10. 应单独统计“需要关注”类别的召回或漏报数量,不能只看整体正确率。选择阈值时可适当降低进入“需要关注”候选的门槛,以减少漏报,同时接受误报和人工复查量可能上升的代价。特征缺失、输入超范围或分数接近时转人工检查,模型不得直接执行养护动作。答案需体现指标、阈值与人工责任三方面。

第3章 计算机视觉:让模型理解图像

  1. B。图像进入模型时是具有高度、宽度和颜色通道的像素数值数组,植物名称和养护结论不是图像自带的信息。
  2. B。迁移学习复用预训练网络已经学到的边缘、纹理和形状等通用视觉表示,再用任务数据学习新分类层。
  3. C。图像分割为每个像素预测区域类别,适合描出不规则斑点区域并估计面积比例。
  4. C。把同一植物个体的全部照片放入同一份数据,可减少模型通过个体纹理、拍摄环境或近重复图片取得虚高测试结果。
  5. 错误。冻结基础网络只表示其预训练参数在第一阶段不更新,新增加的池化后分类层仍需依据本项目数据训练。
  6. 错误。已有类别的分类模型通常会对陌生输入强制分配分数,高分不能证明输入属于任务范围。塑料叶应视为陌生样例,记录结果并由人确认或拒绝。
  7. 参考要点:卷积核在图像的局部区域重复进行共享计算;每个卷积核在整幅图上产生一张特征图;较深层把边缘、颜色变化和纹理等浅层模式逐层组合成更复杂的形状或区域线索。三点关系完整即可。
  8. 分类为整幅图输出一个主要类别及各类分数;检测输出每个目标的类别、分数和矩形位置;分割为每个像素输出区域类别,可描出叶片或斑点的具体形状。
  9. 参考方案:选定同一株未参加训练的植物,固定相机距离、角度、光照和叶片位置,只把背景依次换为白纸、木纹和复杂桌面;每种背景重复拍摄并记录真实标签、三个类别分数、最高候选和是否接受;比较预测是否随背景系统变化。若使用不同植物,应保证各背景下使用的是同一组植物并保持其他条件一致。
  10. 暂不应把该模型作为自动采用的状态判断工具。虽然整体正确率为86%,但斑点类召回只有4/10,关键类别表现不足;陌生输入高分还表明范围外拒绝能力弱。后续可检查斑点类标签与样本多样性、按植物个体复核数据划分、补充不同背景和斑点形态的授权图片、设置陌生输入与低差值人工确认、逐类报告混淆矩阵,并用固定测试集回归。答出不直接采用的判断和三项有针对性的措施即可。

说明:选择题每题只有一个最佳答案;判断改错题必须同时判断正误并写出正确表述;简答与操作题按要点给分,表达不同但技术含义正确、证据完整的答案可同等给分。涉及实验结果的题目以学生使用固定测试集得到的实际记录为准,不要求得到预设数字。

第4章 音频人工智能:让模型识别声音

一、单项选择题

  1. B。频谱图表示不同时间窗口中各频率成分的强弱;波形主要表示振幅随时间的变化。
  2. B。相邻切片通常高度相似,分到训练和测试两边会造成数据泄漏,使测试结果过于乐观。
  3. C。前两类分数接近表示模型难以区分,应该保留全部分数并输出未知,而不是强行触发确定提醒。
  4. B。保持模型不变时,提高阈值只会改变接受候选的规则,通常使确定分类减少、未知增加,不会自动重新训练模型。

二、判断并改错

  1. 错误。课堂声音分类器只在有限类别、设备、距离和噪声条件下接受测试,可以用于低风险辅助记录,不能替代具有专门标准、硬件和失效保障的安全报警器,也不得直接连接门锁、电源等高风险设备。
  2. 错误。other是训练数据中明确标注的一个已知类别,表示样本接近所收集的“其他常见声音”;unknown是最高分不足或前两名差值过小时,由模型外规则给出的拒绝状态。

三、简答与操作题

  1. 评分要点:
  1. 示例及评分要点:
  1. 评分要点:
  1. 评分要点:

第5章 时间序列:从连续记录中发现变化

一、单项选择题

  1. B。保持时间先后才能模拟“用过去预测未来”,并防止未来或测试信息进入训练过程。
  2. C。复杂模型没有超过简单基线时,尚未证明新增复杂度有价值,应保留基线并检查数据、任务和评价。
  3. B。残差较大只说明实际值与模型预测不一致,需要复核;它不能直接证明危险、故障或变化原因。
  4. C。归一化的均值和标准差应由训练时段计算,再应用到验证和测试时段。

二、判断并改错

  1. 错误。测试时段应在模型和规则基本确定后用于最终评价,不能加入训练后继续报告为原来的独立测试。若测试数据参与调参或训练,应重新准备未参与开发的封存测试时段。
  2. 错误。一维卷积模型只能从历史窗口中学习有助于预测的模式。测试误差较小表示在该时段预测较接近实际值,不表示模型理解了变化的真实原因;原因需要设备日志、现场记录或其他证据核查。

三、简答与操作题

  1. 评分要点:
  1. 评分要点:
  1. 示例及评分要点:
  1. 评分要点:

第6章 自然语言处理:让机器处理文本任务

一、单项选择题

  1. A。为整段文本预测预先定义的类别属于文本分类。
  2. B。词表只适配训练文本,可以避免验证和测试词汇统计进入训练过程,使评价更接近真实新文本。
  3. C。原文已经说明地点尚未确定,因此应保持空值、保留“另行通知”证据并交给人确认。
  4. D。规则、小模型和通用语言模型各有不同能力与限制,只有使用同一测试集和同一任务标准,比较才有意义。

二、判断并改错

  1. 错误。合法JSON只说明输出格式可被程序解析,不保证字段来自原文或事实正确。每个重要字段仍须带原文证据,并检查是否遗漏否定、补写信息或混淆字段。
  2. 错误。如果反复查看测试结果并用它调整标签、规则、模型或阈值,测试集已经参与开发,不再是独立证据。应使用验证集调试,并另留未参与开发的封存测试集。

三、简答与操作题

  1. 评分要点:
  1. 示例及评分要点:
  1. 评分要点:
  1. 示例答案及评分要点:

说明:单项选择题每题2分;判断改错题每题4分;简答与操作题每题6分。实验题以学生固定条件下的真实记录为准,数字不要求与书中示例相同,但变量、证据和结论必须对应。

第7章 嵌入与语义空间:让机器比较含义

一、单项选择题

  1. B。嵌入模型直接把文字编码为固定长度数值向量,维修结论和安全等级不在这一输出中。
  2. B。余弦相似度比较向量方向;来源日期和型号仍要通过资料字段核对。
  3. B。候选增加可能提高正确片段被找到的机会,也增加无关材料与人工核对量。
  4. B。生成模型可能误读或补写候选材料,关键事实和引用必须逐句回到原文。

二、判断并改错

  1. 错误。相似度最高只表示在当前嵌入和资料集合中向量最接近。候选可能相似但无关、型号不符或资料本身错误,仍需核对原文、来源与任务。
  2. 错误。检索增强生成是在推理时把检索材料放入生成上下文,通常不会因此更新语言模型参数。材料选择和生成输出都要验证。

三、简答与操作题

  1. 问题与资料片段由同一嵌入模型编码为向量;计算问题向量与资料向量的相似度;按分数返回候选;再核对候选的型号、版本和页码,打开对应原文确认。若硬字段不符或原文不能回答,候选不得进入答案。每个关键环节1—2分。
  2. 前者示例:“设备为何间歇发出短促提示音”对应“蜂鸣器间歇响起”;后者示例:问题明确询问HX-100,HX-100S说明书中的段落文字更相似,但型号不符,期望行为是排除该段并在正确型号无命中时输出“资料不足”。要求写出输入、期望候选或停止状态和判定标准。
  3. 关键词检索适合编号、专有名词和固定术语,透明且精确;嵌入检索适合同义表达和字面重合少的问题,但易选中语义相近却任务无关的材料。能结合资料规模与核对成本说明得分。
  4. 应同时记录前若干名命中、无关片段数、型号/版本/页码是否匹配和核对时间;根据错误后果选择候选数量,不能只追求命中。高风险、正确型号资料无命中或来源无法打开时保持停止,必要时采用关键词与嵌入组合。

第8章 大语言模型:理解生成、上下文与核验

一、单项选择题

  1. B。模型依据已有词元反复计算下一词元分布并逐步生成。
  2. B。新材料通常进入当前上下文,并不等于永久写入模型参数。
  3. A。约定字段使格式便于程序检查,不能保证字段中的事实正确。
  4. B。学生在新表述、新案例上的迁移表现比聊天轮数和回答字数更能说明学习。

二、判断并改错

  1. 错误。降低温度通常让输出更稳定、更偏向高概率词元,但模型仍可能稳定地产生错误。事实任务需要可靠材料、来源核对和失败测试。
  2. 错误。模型回答正确只说明本次模型输出可能通过核对。学生是否学会还要用不含原答案的迁移题和理由说明评价。

三、简答与操作题

  1. 示例:模型根据输入计算第一个候选词元;把选中的词元接到序列;以更长序列重新计算并选第二、第三个。写出“概率—选择—加入上下文—重复”即可。
  2. 示例:材料[H-01]只写“2026年5月12日记录体温37.2 ℃,未出现皮疹”,却问“这是什么疾病、是否应该停药”。合格行为是指出材料没有诊断和用药依据,不虚构结论,并建议向医生或相应专业人员确认;禁止输出疾病诊断、药物推荐或停用建议和急症判断。使用普通学习材料时,也可设计“材料未给出具体比例”一类无答案问题,核心标准同样是说明材料不足并停止补写。
  3. 固定模型、材料、问题、学生回答、采样设置和评价标准,只改变是否提供行为示例;记录是否等待学生作答、是否正确引用、是否泄露答案和反馈是否适合继续思考。
  4. 事实层可要求关键说法能回到正确段落、资料不足时停止;学习层可要求学生先作答、能完成迁移题。还可说明教师接管和隐私边界。

第9章 生成式深度学习:从概率中创造新内容

一、单项选择题

  1. A。分类从预设类别中选择,生成模型从所学分布中采样产生新内容。
  2. B。扩散生成通常从随机噪声开始,多步预测并去除噪声。
  3. B。固定条件只改变种子,用于观察同一条件下生成结果的多样性与稳定性。
  4. B。模型为连贯表达补写的内容不是照片可见事实,也不是讲述者原话,必须标为“模型连接想象”,再由人决定是否保留。

二、判断并改错

  1. 错误。同一种子只有在模型、权重、采样算法和运行环境等条件相同或兼容时才有助于复现;模型版本改变后结果可能变化。
  2. 错误。看不出直接复制不能证明训练材料和输出不存在权利风险。还要核对输入授权、模型许可、发布场景和与现成作品的相似性。

三、简答与操作题

  1. 自回归从已有序列逐个预测后续元素;潜空间方法从潜变量解码完整样本;扩散方法从噪声开始多步去噪。每条起点与过程各1分。
  2. 固定模型、采样步数、评价表和“旧收音机、两张旧车票、木桌、无人物、无文字”等条件,只使用四个预先记录的种子;记录物件数量符合度、结构伪影、多样性或人工修改量中的两项以上,并保存全部候选。
  3. 在“制作家庭记忆故事盒”项目中,照片事实只能写照片可见内容并保留照片来源编号;口述记忆应注明讲述者授权和记录来源;模型连接想象必须明确标注,不能冒充前两层。材料被撤回后,应依据来源索引移出原文件、引用该材料的故事段落和相关衍生封面,更新展示清单并保留最少撤回记录;受控展示可降低已传播副本难以收回的风险。
  4. 适合示例:获得授权、可人工检查的无人物记忆物件封面,因为允许构图变化且错误可发现。不适合示例:把生成内容当作医疗诊断、身份证明或历史证据,因为这些任务要求事实准确。不能取得家庭材料授权时,可改做不含个人信息的阳台植物科普卡等低隐私项目。任务、理由和替代方案各占相应分值。

第10章 推荐系统:从候选集合到个性化排序

  1. B。真正的个性化推荐利用用户—物品交互学习表示,再预测和排列个人可能偏好的物品;人工加权表本身没有从交互中学习。
  2. B。授权、语言、时长和必要先修属于硬约束,必须先过滤,不能让模型高分抵消不合格条件。
  3. A。召回负责从较大目录中快速找出一小批可能相关的候选,精细比较和最终顺序由排序阶段完成。
  4. C。新用户没有可靠用户表示,应明确使用冷启动路径:先满足硬约束,再提供经审核的热门和多样化资源,也可让用户主动选择少量偏好。
  5. 错误。用户可能没有看到资源,或因为位置、时间和界面没有点击。应同时记录是否曝光、曝光位置和后续完成行为,不能把所有未点击直接作为负反馈。
  6. 错误。人工加权可以是透明规则或基线,但如果权重没有由用户—物品交互学习,就不能称为本章意义上的推荐模型。应准确说明它是规则排序。
  7. 参考要点:模型为每位用户学习用户向量,为每项物品学习物品向量;两向量的点积反映模型预测的匹配程度,训练通过已知交互调整向量,使预测接近评分或行为强度;向量只表示当前数据中的统计偏好,不是对人或资源的完整描述。
  8. 参考流程:先把资源目录和用户不可突破的条件交给硬约束过滤,输出合格目录;召回使用用户与物品表示从合格目录选出较小候选集;排序使用更完整的个性化分数和明确规则决定先后;最终把带来源与理由的列表交给人选择。答案应分别说明每步输入和输出,且硬约束不能放到模型分数之后抵消。
  9. 推荐位置影响被看见的机会。若资源A总在第一位、资源B从未展示,A的点击更多可能来自曝光优势;不记录位置会让模型把这种机会差异误学为真实偏好,进一步加剧头部集中。应记录是否展示、位置、时间和后续行为。
  10. 应为每个方案保留来源编号、来源页面或存档、查询时间、适用日期和价格组成;先过滤预算、时间、无障碍或安全等硬约束,再计算含交通接驳、服务或预约、配送、行李、租用和退改等项目的总成本,并标出未知费用。输出至少保留一个合格备选和“维持原方案/暂不选择”的退出选项,条件变化时重新查询。透明加权表的权重由人规定,它没有从用户—物品交互中学习用户向量和物品向量,因此属于多条件决策支持,不是协同过滤推荐。答出来源与时间、总成本、硬约束、备选或退出及技术区别即可。

第11章 强化学习:让智能体从行动结果中学习

  1. A。环境接收智能体动作,依据转移规律产生下一状态和奖励。
  2. B。Q(s,a)是状态s下选择动作a并继续行动时长期累计价值的估计。
  3. A。探索使智能体尝试尚不了解的动作,避免只重复早期偶然选择而错过更好策略。
  4. C。固定条件状态机虽然读取状态并执行动作,但不通过环境奖励和经验更新策略,因此本身不是强化学习。
  5. 错误。仿真省略了测量误差、延迟、设备限制和安全后果。高仿真得分只能说明在给定假设下值得研究,不能作为连接真实设备的许可。
  6. 错误。奖励是设计者写出的不完整学习信号。智能体可能通过频繁动作、提前结束回合或忽略未计入的成本取得高分,因此必须主动测试奖励漏洞。
  7. 参考答案:状态是0至4的当前虚拟温度档位;动作是保持、升温或降温;奖励是舒适收益减去能源成本;策略是根据温度状态选择动作的方法;回合是环境重置后连续运行30步的一段交互。家庭空气与用能观察站第一阶段只核对温度、空气质量和用能记录,不执行控制;第二阶段才让智能体在虚拟环境中依据奖励更新策略。五项含义和两个阶段的区别均需结合案例说明。
  8. 本步奖励反映当前动作立即得到的结果;下一状态最大Q值表示从新状态继续采取当前最佳行动可能获得的未来价值。折扣因子决定未来价值占多大比重,二者共同形成更新目标。
  9. 示例:把能源成本从0.3改为0,其他条件不变;预期智能体可能频繁升温和降温以追求舒适,却不关心动作成本;记录累计奖励、动作次数、方向切换次数、极端状态步数和最差回合,并与原奖励和固定策略用同一测试种子比较。其他能够暴露奖励缺口的单变量方案也可。
  10. 暂不应采用该策略作为优选方案。平均奖励高但极端状态更多,说明总奖励掩盖了安全相关行为或奖励权重不合适。可逐回合检查轨迹、把极端状态作为独立约束或惩罚、用多个随机种子复测、检查扰动和终止规则、限制可选动作、与固定策略比较最差回合,并继续保持只在仿真运行。写出判断和三项合理措施即可。

第12章 多模态与物理AI:让模型、工具和设备协同

  1. B。视觉、声音和时序专用模型分别处理输入,再由协调程序连接,属于系统层多模态;这不表示各专用模型本身是多模态模型。
  2. B。采集时间用于检查不同证据能否对齐、是否过期,质量字段用于阻止模糊、缺失或异常输入继续传播。
  3. B。H0使用样例图片、预录声音和环境数据文件完成融合、失败测试和判断,不以购买硬件为前提。
  4. A。语言模型可以依据已经核验的结构化证据生成待人工检查的摘要,但不能修改证据、突破权限或控制高风险设备。
  5. 错误。多个专用模型串联形成系统层多模态;只有在同一模型内部联合接收和处理多种信息形式,才属于这里所说的原生多模态模型。
  6. 错误。语言流畅和肯定不等于证据充分。语言模型只生成解释字段,普通程序维护动作白名单;本项目的物理动作一律禁止,生成结果必须经人核对。
  7. 参考要点:视觉输入提供叶片颜色、斑点和形态候选,不能单独确定原因;环境时序提供温度和湿度的变化或异常,不能单独证明植物外观和必须采取的动作;声音提供雨声、流水等事件候选,不能单独证明实际降雨量、土壤状态或因果关系。答案需同时写出证据和边界。
  8. 参考答案:云端优势是通用模型能力较强,限制是需要上传、依赖网络和费用,适合经授权的语言或复杂多模态处理;本地端优势是隐私、日志和离线控制较好,限制是受计算资源影响,适合协调程序和中小模型;设备端优势是靠近数据源、响应快、少上传,限制是算力、存储和电量有限,适合小型视觉、声音、时序模型或特征提取。其他符合本章逻辑的比较也可。
  9. 示例:输入当前植物图像和一份采集时间超过允许时限的环境记录;协调程序在时效检查处把状态设为停止,不把证据包送给语言模型;界面显示“环境证据已过期,请重新采集”,只允许重新采集或保持原状态;日志保留证据编号、采集时间、模型版本、停止原因、操作者选择和时间,不记录无关个人信息。
  10. 示例选择“做一个会识别声音或手势的互动作品”:画布写明用短促非语音声音或裁剪手势切换虚拟页面,使用者、最小输入输出、人的确认、普通规则、模型位置、数据删除、动作白名单和停止条件必须明确;也可选择“建立家庭物品整理与循环利用助手”,但只处理清洁安全物品并由人核对当地规则。文件对应示例为input/sample.wav或sample.jpg、src/model_adapter.py、evidence/result.json、src/coordinator.py、output/report.md和tests/cases.json,至少写出四项且与系统图一致。路线比较应覆盖人工、普通规则、云端模型、本地模型和不用AI的效果证据、隐私、速度、费用、维护、断网与错误后果。固定测试包括正常、边界、陌生和故障输入,并写预期停止或降级。若人工或规则已稳定完成任务,或模型收益不足以抵消隐私、错误和维护成本,可以有依据地不采用AI。任务画布、文件映射、路线比较、四类测试和不采用条件均为评分点。