版本对照:左侧保留服务器原有 v1.7,右侧为当前中职修订稿。两栏可独立滚动。
旧版 v1.7原稿

第13章 AI 走进物理世界:让智能体驱动摄像头识别

本章导读

前面章节中,已经多次介绍如何与本地智能体协同完成任务:让它解释概念、生成文件、调用工具、检查结果、设计工作流。到第12章,已经知道 AI 可以进入专业任务,但这些任务大多还发生在屏幕里。

这一章开始,我们把 AI 往现实世界里推一步:让智能体帮助你做一个最小的摄像头识别小作品。

这件事听起来像机器人开发,但本章不会一开始就焊电路、接电机或编写复杂程序。我们只做一个非常小的闭环:

你在 VS Code 插件中提出任务
  ↓
本地智能体检查电脑是否接入摄像头
  ↓
智能体生成并运行摄像头识别程序
  ↓
程序识别红、黄、绿三种颜色卡
  ↓
屏幕给出通过 / 请确认 / 停止的反馈
  ↓
你复核结果并记录问题

这就是物理 AI 的入门版本。摄像头负责感知输入,程序中的规则模型负责判断,屏幕反馈负责呈现结果。本章不要求手写代码,但必须提出清楚的需求,确认智能体准备创建哪些文件,观察程序是否真的运行,并判断结果是否可信。

《大学》说:致知在格物。 让 AI 接触摄像头,并不是让它替人感知世界,而是把真实现象变成可以观察、记录和复核的过程。

学习目标

  • 知识目标:
    1. 能说出物理 AI、摄像头、视觉输入、规则模型、反馈这几个概念的基本含义。
    2. 能用感知 → 判断 → 反馈 → 人工复核描述一个最小摄像头识别系统。
  • 能力目标:
    1. 能在 VS Code 插件中用提示词指挥本地智能体检查摄像头并生成最小识别程序。
    2. 能运行一个三色卡识别小程序,观察红、黄、绿三种输入对应的反馈结果。
    3. 能填写《摄像头识别闭环记录表》,记录智能体做了什么、程序是否成功、识别是否可靠。
  • 素养目标:
    1. 建立让智能体执行动作前先说明路径和风险的协同习惯。
    2. 知道摄像头会采集现实画面,不能拍摄人脸、证件、聊天记录等隐私信息。

先修要求与环境清单

  • 已学习第3章本地智能体环境、第10章工具调用与沙盒边界、第11章智能体多步任务、第12章 AI 辅助工作流设计。
  • 软件环境:VS Code、已启用智能体模式的 AI 协同插件、课程统一配置的本地大模型服务、课程预置 Python 环境。
  • 运行依赖:课程环境包已预置摄像头读取所需库;如果本机无法调用摄像头,本章允许使用样例图片完成同样流程。
  • 设备准备:电脑摄像头或外接 USB 摄像头;红、黄、绿三张色卡,也可以使用红色、黄色、绿色物品代替。
  • 本章要求:不拍人脸、不拍证件、不拍车牌、不拍屏幕隐私;不让程序控制电机、门锁、电源等高风险设备;所有文件只放在本章工作区。
  • 配套资源:本章使用智能体提示词模板、摄像头探测记录表、三色卡测试表和失败测试记录表。

知识准备:先认识这些词

  1. 物理 AI(physical AI)
    • 一句话说明:让 AI 通过设备接触现实世界,能获得现实输入并给出反馈。
    • 本章例子:摄像头看到色卡,程序判断颜色,屏幕给出提示。
  2. 本地智能体(local agent)
    • 一句话说明:在本机环境中协助完成任务的 AI 助手,它可以解释需求、生成代码、运行命令、查看结果。
    • 关键边界:它可以提出动作和执行低风险任务,但创建文件、运行程序、访问摄像头前,都要说明准备做什么,并等待用户确认。
  3. 摄像头输入(camera input)
    • 一句话说明:程序从摄像头获取一帧一帧的图像。
    • 常见问题:摄像头没插好、被其他软件占用、权限没打开、画面太暗。
  4. 规则模型(rule-based model)
    • 一句话说明:用清楚的规则做判断的最小模型。
    • 本章例子:如果画面中红色最多,就判断为红色卡;黄色最多,就判断为黄色卡;绿色最多,就判断为绿色卡。
    • 为什么用它:本章目标是跑通物理 AI 闭环,不是一开始就训练复杂深度学习模型。
  5. 反馈(feedback)
    • 一句话说明:系统把判断结果告诉人的方式。
    • 本章例子:绿色表示通过,黄色表示请人工确认,红色表示停止。
  6. 人工复核(human review)
    • 一句话说明:程序判断以后,人还要检查结果是否合理。
    • 关键点:摄像头识别容易受光线、背景、距离和遮挡影响,不能把程序输出当成绝对事实。

13.1 问题与现象:AI 为什么要先获得现实输入

13.1.1 从聊天助手到现实设备

聊天助手只需要处理你输入的文字。现实设备不一样,它要先从世界里拿到信息。

例如:

  • 智能门铃要先看到门口有没有人;
  • 扫码设备要先看到二维码;
  • 扫地机器人要先看到前方障碍物;
  • 质检摄像头要先看到产品外观;
  • 手机相册要先看到照片内容。

这些场景的共同点是:AI 不再只是等你打字,而是通过摄像头、麦克风、传感器获得输入。

13.1.2 为什么本章用三色卡识别

你可能会问:既然有那么多高级机器人和智能终端,为什么本章只识别红、黄、绿三张色卡?

原因很简单:入门作品必须先能成功运行。

三色卡识别有三个优点:

相关内容见表13-1。

表13-1 优点与说明记录表

优点 说明
容易准备 找三张彩纸或三个彩色物品即可
容易观察 识别对不对,一眼能看出来
容易复核 出错时能判断是光线、背景、摄像头还是规则问题

这不是低级,而是工程入门最重要的原则:先让最小闭环跑起来,再谈复杂功能。

13.1.3 本章案例:桌面三色卡反馈器

本章要完成的小作品叫桌面三色卡反馈器。

它的规则如下:

相关内容见表13-2。

表13-2 摄像头看到的主要颜色与程序反馈记录表

摄像头看到的主要颜色 程序反馈 含义
绿色 通过 当前状态正常
黄色 请人工确认 当前状态不确定
红色 停止 当前状态需要停止或检查
看不清 / 没有明显颜色 未识别 请调整光线或重新放置色卡

这个小作品可以类比很多现实场景:

  • 设备巡检中,绿色代表正常,黄色代表待确认,红色代表异常;
  • 实训操作中,绿色代表步骤完成,黄色代表需检查,红色代表停止操作;
  • 校园活动中,绿色代表可通行,黄色代表需人工核验,红色代表暂缓。

【思考 1】 为什么本章不一开始就让摄像头识别人脸、车牌或学习者表情?

思考提示:这些内容涉及隐私和高风险判断,也更容易产生误判。入门阶段应选择低风险、容易复核、不会影响他人的对象。


13.2 原理与分析:智能体怎样把摄像头任务做成闭环

相关结构如图13-1所示。

图13-1 颜色证据闭环:从现实色卡到人工复核

图13-1的重点不是画一个普通流程,而是说明:摄像头获得的是一帧图像,程序先把图像转成颜色证据,再由规则模型给出反馈,最后仍要由人记录环境线索并复核结果。

13.2.1 人机协同的五步

本章不是要求从零编写程序,而是让学习者和智能体协同完成。

第1步:用户提出任务和边界
第2步:智能体检查摄像头和环境
第3步:智能体生成最小程序
第4步:用户运行并观察结果
第5步:用户复核、记录、要求智能体改进

这里最重要的是第1步。不能只对智能体说:“帮我做一个摄像头 AI。”

这样的请求太大,也不安全。应当说清楚:

  • 只在本章工作区创建文件;
  • 只检查摄像头是否可用;
  • 只识别红、黄、绿三种颜色;
  • 不主动保存摄像头画面,测试前确认画面中不含人脸或隐私内容;
  • 不联网,不控制外部设备;
  • 运行前先列出文件路径和风险。

13.2.2 摄像头看到的不是意义,而是图像

人看到红色卡片,会直接说这是红色。程序看到的其实是一张图片,图片由很多像素组成。每个像素有颜色数值。

本章的最小模型不需要理解卡片这个概念,只需要做一件事:判断画面中哪种颜色最明显。

这就是规则模型:

如果红色区域最大 → 输出红色
如果黄色区域最大 → 输出黄色
如果绿色区域最大 → 输出绿色
如果三种都不明显 → 输出未识别

它不如大视觉模型聪明,但它简单、稳定、可解释,适合作为第一个物理 AI 小作品。

这里要特别注意:程序并不是“理解了红色代表停止、绿色代表通过”的社会含义。它只是把画面中的颜色线索转成判断结果。颜色的业务含义、是否可以采纳、出错后怎样处理,都仍然由人决定。

13.2.3 为什么还要人工复核

规则模型也会出错。

相关内容见表13-3。

表13-3 出错原因与例子记录表

出错原因 例子 应对办法
光线太暗 绿色看起来像黑色 调亮光线
背景干扰 桌面本身是红色 换白色背景
色卡太小 画面里色卡占比太低 把色卡靠近摄像头
摄像头偏色 黄色被拍成偏白 重新校准或改阈值
摄像头被占用 其他软件正在使用摄像头 关闭占用软件

所以本章要求你记录一次失败案例。一个可靠的小作品,不是只展示成功,而是知道自己什么时候会失败。

13.2.4 智能体不能跳过你的确认

第10章讲过:AI 执行动作前必须有边界。本章继续遵守这条原则。

智能体可以做:

  • 检查摄像头;
  • 创建本章工作区;
  • 生成程序文件;
  • 运行测试;
  • 解释报错;
  • 帮你写记录表。

智能体不能擅自做:

  • 访问你的私人照片;
  • 保存包含他人的摄像头画面;
  • 上传图片到未知网站;
  • 自动安装不明软件;
  • 控制电机、门锁、电源等设备。

【思考 2】 如果智能体准备创建文件,但没有告诉你文件会放在哪里,你应该直接同意吗?为什么?

思考提示:不应该。第10章已经讲过,AI 执行动作前要先说明路径、动作和风险。文件必须放在本章工作区,不能散落到桌面或其他目录。


AI 协同实践:让智能体完成三色卡识别

实践目标

本实践要完成以下结果:

打开 VS Code 插件聊天窗口
  ↓
要求本地智能体检查摄像头
  ↓
要求智能体创建三色卡识别程序
  ↓
运行程序,依次展示红/黄/绿色卡
  ↓
记录识别结果和失败情况

本实践不要求手写代码。任务是写清提示词、确认智能体计划、观察程序运行、复核结果。

第 1 步:让智能体先列计划,不要直接写代码

在 VS Code 插件聊天窗口中输入:

请作为本地智能体,帮我完成第13章桌面三色卡反馈器的最小实践。

任务目标:
1. 检查我的电脑是否能打开摄像头;
2. 如果摄像头可用,创建一个程序识别红、黄、绿三种色卡;
3. 如果摄像头不可用,创建样例图片并用样例图片完成同样流程;
4. 识别结果只在屏幕显示,不上传图片,不主动保存摄像头画面,测试前确认画面中不含人脸或隐私内容;
5. 所有文件只能放在 ch13_physical_ai_color_demo 文件夹中。

请先不要写代码。
请先列出你准备创建的文件路径、每个文件的作用、需要运行的命令、可能的风险,并等待我确认。

智能体的回答应该包含类似内容:

相关内容见表13-4。

表13-4 文件与作用记录表

文件 作用
ch13_physical_ai_color_demo/camera_check.py 检查摄像头是否可用
ch13_physical_ai_color_demo/color_feedback_demo.py 运行三色卡识别
ch13_physical_ai_color_demo/samples/ 摄像头不可用时放样例图片
ch13_physical_ai_color_demo/run_log.md 记录运行结果
ch13_physical_ai_color_demo/README.md 说明运行方法和安全边界

如果智能体没有列出路径,或者准备把文件放到不清楚的位置,请让它重新说明。

第 2 步:确认后,让智能体检查摄像头

确认路径没有问题后,输入:

我确认可以在 ch13_physical_ai_color_demo 文件夹中创建这些文件。
请先只创建并运行 camera_check.py。
要求:
1. 只检查摄像头是否能打开;
2. 不保存照片;
3. 不上传任何图像;
4. 输出摄像头可用或摄像头不可用;
5. 如果失败,请解释可能原因。

常见结果有两种:

相关内容见表13-5。

表13-5 结果与下一步记录表

结果 下一步
摄像头可用 继续运行真实摄像头识别
摄像头不可用 使用样例图片完成流程

如果摄像头不可用,不要在这一章花太久排错。物理 AI 学习的重点是闭环,而不是设备维修。

第 3 步:让智能体生成三色卡识别程序

如果摄像头可用,输入:

请创建 color_feedback_demo.py。
要求:
1. 打开摄像头画面;
2. 识别画面中红、黄、绿三种主要颜色;
3. 红色输出停止,黄色输出请人工确认,绿色输出通过;
4. 如果颜色不明显,输出未识别,请调整光线或位置;
5. 程序运行时按 q 退出;
6. 不主动保存摄像头画面,测试前确认画面中不含人脸或隐私内容;
7. 运行结束后,把结果摘要写入 run_log.md。

请生成后运行一次,并告诉我如何测试红、黄、绿三张色卡。

如果摄像头不可用,输入:

摄像头不可用,请改用样例图片流程。
请创建 red_card.png、yellow_card.png、green_card.png 三张纯色样例图片,
并让 color_feedback_demo.py 读取样例图片完成同样的识别和反馈。
要求仍然生成 run_log.md。

第 4 步:依次测试三种颜色

把红、黄、绿三张色卡依次放到摄像头前。每次测试时记录:

相关内容见表13-6。

表13-6 测试颜色与程序输出记录表

测试颜色 程序输出 是否正确 备注
红色
黄色
绿色

如果程序识别错了,不要立刻认为智能体无效。应先检查:

  • 色卡是否太小;
  • 光线是否太暗;
  • 背景是否干扰;
  • 摄像头是否对准;
  • 智能体生成的规则是否需要调整。

第 5 步:让智能体解释程序

测试完成后,输入:

请用读者能理解的语言解释这个程序。
要求:
1. 说明摄像头在程序中起什么作用;
2. 说明规则模型是怎么判断红、黄、绿的;
3. 说明为什么光线和背景会影响结果;
4. 说明这个程序和真正的物理 AI 有什么关系;
5. 不要逐行解释代码,只讲关键原理。

请把智能体解释中最重要的三句话摘录到记录表里。

第 6 步:做一次失败测试

请选择一种失败情况:

  • 把色卡拿远一点;
  • 把光线调暗;
  • 用复杂背景;
  • 同时出现两种颜色;
  • 只露出色卡一角。

观察程序是否输出未识别或错误颜色。

然后让智能体帮你复盘:

刚才的失败测试结果是:____。
请帮我分析可能原因,并提出两个简单改进建议。
要求:
1. 不要增加复杂硬件;
2. 不要改成复杂大模型;
3. 优先从光线、背景、色卡大小、识别阈值这些角度分析。

【思考 3】 为什么失败测试是本章必须做的步骤?

思考提示:物理 AI 面对真实世界,不能只展示成功样例。失败测试能帮助判断系统什么时候不可靠,什么时候必须由人接管。


验证与证据:用《摄像头识别闭环记录表》

智能体协同记录

相关内容见表13-7。

表13-7 项目与记录内容记录表

项目 记录内容
第一次提示词
智能体准备创建的路径
是否等待你确认 是 / 否
摄像头检查结果 可用 / 不可用
实际创建的文件
是否生成运行日志 是 / 否

三色卡测试记录

相关内容见表13-8。

表13-8 输入与预期反馈记录表

输入 预期反馈 实际反馈 是否正确
红色卡 停止
黄色卡 请人工确认
绿色卡 通过
失败测试 未识别或错误

原理小结(100~200 字)

请用自己的话写一段小结,必须包含以下词语:

  • 摄像头;
  • 规则模型;
  • 反馈;
  • 人工复核。

示例开头:

本章实践让我看到,物理 AI 不是一开始就做复杂机器人,而是先让设备通过摄像头获得现实输入……

合格标准

相关内容见表13-9。

表13-9 标准与合格表现记录表

标准 合格表现
智能体协同清楚 智能体先列计划和路径,再创建文件
闭环完整 有摄像头或样例输入,有识别,有反馈,有记录
风险可控 不拍隐私,不上传图片,不控制危险设备
能解释失败 至少记录一次失败情况和改进建议

伦理、安全与边界

第一条底线:摄像头不是普通输入框

文字输入通常由用户主动复制粘贴,摄像头却可能拍到周围环境。它可能无意中拍到他人、屏幕、证件、住址、聊天记录。

所以本章只允许拍摄:

  • 色卡;
  • 空白桌面;
  • 不含隐私的普通物品。

如果摄像头画面中出现他人或隐私内容,应立即退出程序。

第二条底线:智能体生成程序,也要你确认

智能体写代码不等于可以不检查。至少要确认:

  • 文件是否在本章工作区;
  • 程序是否只访问摄像头;
  • 是否上传了图片;
  • 是否保存了不该保存的画面;
  • 是否控制了外部设备。

即使看不懂全部代码,也必须让智能体解释这些风险点。

第三条底线:物理反馈先低风险

本章只做屏幕文字反馈。即使后续接小灯或声音,也要保持低风险。

不允许在本章中做:

  • 自动开门;
  • 控制电机夹取物品;
  • 控制电源;
  • 操作真实账号;
  • 自动上传视频。

入门阶段的原则是:AI 可以提醒,人来决定。


总结与思考

本章核心判断

  1. 物理 AI 的最小闭环是感知 → 判断 → 反馈 → 人工复核。
  2. 本地智能体不是替代学习者完成学习,而是协助检查环境、生成程序、运行测试和解释结果。
  3. 三色卡识别虽然简单,但已经包含摄像头输入、模型判断和反馈输出。
  4. 规则模型简单、可解释,适合作为第一个物理 AI 小作品。
  5. 摄像头涉及现实画面,必须格外注意隐私和权限。

基础题(理解层面)

  1. 本章中摄像头属于感知、判断、反馈中的哪一环?
  2. 为什么本章使用规则模型,而不是一开始训练复杂模型?
  3. 智能体创建文件前,为什么必须先列出路径?

迁移题(生活场景)

请把三色卡反馈器迁移到一个生活场景中,例如实训步骤提醒、设备状态提示、校园活动通行提示。写出三种颜色分别代表什么。

风险题(伦理与边界)

如果有人想把本章程序改成识别学习者是否专注,你会提醒哪些问题?请至少写出三条。

本章交付物

完成本章后,你应提交以下材料:

  1. 《摄像头识别闭环记录表》1 份;
  2. 三色卡测试记录 1 份;
  3. 失败测试记录 1 条;
  4. 智能体生成的文件清单 1 份;
  5. 100~200 字原理小结 1 段。
当前中职版(2026-07-20)修订稿

第13章 AI 走进物理世界:智能体与摄像头

(建议2课时)

章首语

实训课上,指导老师指着门口的摄像头问大家:“如果让咱们的 AI 助手透过它看一眼实训室,提醒没戴安全帽的同学,你们说,能成吗?”

小李在心里盘算了一遍:看图,第9章学过;按循环连续做事,第11章学过;立规矩,也学过。零件似乎都齐了——可这一次不太一样。此前 AI 的一切动作都发生在屏幕之内,文件删错了尚可恢复;而摄像头对准的是真实的场地、真实的人,认错了、提醒错了,泼出去的水收不回来。

从屏幕到镜头,只隔着一步;这一步,纸上得来终觉浅。本章我们亲手迈过去,也把该带的规矩,一并带过去。

人工智能走进物理世界后,错误不再只停在屏幕上。摄像头采集、画面处理、模型判断、阈值决定、提醒动作和日志记录构成一条实时链。链路中的时延、光线、遮挡和误报漏报都会影响结果,因此必须采用低风险动作、结构化测试和数据最少化。

字里行光 纸上得来终觉浅,绝知此事要躬行。——陆游《冬夜读书示子聿》

学习目标

  1. 能说出数字世界与物理世界操作的根本差别;
  2. 能描述”摄像头—模型—提醒”组合的循环工作过程;
  3. 能运行一个视觉识别循环,统计误报与漏报;
  4. 能将三条运行规则迁移到物理场景,设计部署边界;
  5. 树立目的明确、范围必要、显著提示与数据最少化的法治和伦理意识。

13.1 从屏幕到镜头

本章不引入新的术语——需要的零件,前面各章都已备齐。要新学的,是把它们带进物理世界时必须想透的三层道理。

第一层:物理世界的动作难以撤销。沙盒里删错一份文件,资源包里还有备份;现实中一句错误的广播提醒、一次误判的记录,落地即成事实。数字世界容错,物理世界记仇——分寸从此不同。

第二层:摄像头是 AI 伸进现实的眼睛。接上摄像头,模型看到的不再是我们挑选后交给它的图片,而是镜头前正在发生的场景。看什么、何时看、看到后做什么,第一次与真实的场所和人直接相连。

第三层:视觉判断存在误差。第9章的结论要带到现场:图像理解会受到遮挡、光线和角度影响。安全帽被手臂挡住半边,系统可能判成“未佩戴”——这叫误报;光线昏暗时真的未戴,系统可能没有识别——这叫漏报。两类错误都要在设计与测试中记录。

三层道理归成一句:进入物理世界,能力照旧,谨慎加倍。

【想一想】① 各举一个你专业中”做错难以挽回”的物理动作和一个”做错可以重来”的数字动作,说说两者对 AI 参与程度的要求有何不同。

摄像头提供的是连续图像数据

摄像头按一定频率采集画面,每一帧都由像素组成。系统还可能进行缩放、裁剪和亮度调整,再把处理后的画面送给识别模型。画面范围、清晰度和采集频率都会影响结果;频率太低可能漏掉短暂事件,频率过高又会增加计算压力和日志量。

从镜头到提醒可拆成六个环节:采集画面、处理画面、识别目标、比较接受界线、触发低风险提示、记录结果。某一帧没有识别到,不等于目标不存在;某一帧识别到,也不等于持续状态已经成立。工程系统常要求连续多帧满足条件后再提示,以减少偶然波动。

【图13-1 摄像头感知链:采集—预处理—识别—阈值—提示—记录(SVG图位)】

本章不进行人脸识别,也不根据身份作决定。测试对象优先使用色卡、安全帽道具和人台;若画面中可能出现同学,应限定范围、明确说明活动目的,并允许不参与。课程实训不保存原始视频,只记录经过最少化处理的测试编号、环境条件和结果。

13.2 智能体驱动摄像头

现在装配零件。以”实训室安全帽提醒助手”为例,它的一轮工作是这样转的:

观察——摄像头拍下当前画面;判断——模型识别画面中人员是否佩戴安全帽;执行——发现未佩戴,则播放一句提醒并记入日志;随后回到观察,开始下一轮。

眼熟吗?这正是第11章的”判断—执行—观察”循环,只是三个环节接上了现实:观察来自镜头,执行落在音箱与日志。摄像头加模型加提醒,一个最小的物理智能体就立起来了。

【此处配图13-1:物理智能体循环示意——摄像头画面进入模型,识别结果驱动提醒与日志,循环往复】

图13-1 从屏幕到现场:循环接上了真实世界

装配时,有两条设计讲究,皆因13.1的道理而来。

其一,动作降级。眼睛会看错,动作就不能过硬:识别到未佩戴,系统只做”提醒”与”记录”,不做处罚,更不做锁门断电一类的强动作。判断交给机器,处置留给人——把第11章”要紧的事先问人”,落成物理世界的铁则。

其二,为出错留后路。误报要能一键澄清,日志要能事后复核,提醒的措辞要留有余地——“请检查安全帽佩戴”,而不是”某某同学违规”。机器的每一次开口,都以”可能看错了”为前提来措辞。

【做一做】 为这位安全帽助手拟一句提醒播报词,要求:不指名道姓,不带定性语,听者知道该做什么。

【想一想】② 如果把执行动作从”播放提醒”升级为”自动上报扣分”,会带来哪些新问题?用误报与漏报的概念分析。

智能体要管理实时状态

实时智能体除了“判断—执行—观察”,还要维护当前帧编号、连续识别次数、上次提醒时间和人工确认状态。若每一帧都播报,系统可能连续打扰;若提醒后永不恢复,又可能漏掉新事件。因此需要设置连续确认、提醒间隔和恢复条件。

识别模型通常会给出候选类别及相对把握。系统把把握与接受界线比较,高于界线才进入下一步,低于界线则标为未确定。界线过低容易错报,过高容易漏报。调整时要同时看两类错误,不能为了减少其中一类而忽略另一类。

【图13-2 实时智能体状态:连续确认—提醒间隔—人工复核—恢复待机(SVG图位)】

时延也是工程指标。从画面出现到系统提示,要经历采集、计算和输出。平均时延之外,还要记录最慢一次,因为偶尔很慢可能影响现场使用。课堂测试只做辅助提醒,不把结果连接门锁、电机、电源或自动处罚;任何真实处置都由现场人员依据实况决定。

工程案例:安全帽提示器的阈值与时延

课程原型只识别道具或人台上的“佩戴、未佩戴”,输出为屏幕提示,不连接真实考勤或处罚。小组在正常光、弱光和侧角度三种条件下各做固定重复,并为每轮记录预期、实际、模型把握、系统决定和提示时延。所有画面仅在本机即时处理,不保存原始视频。

第一种设置接受界线较低,系统很少显示“未确定”,但侧角度下把未佩戴错报为佩戴。提高界线后,危险错分减少,未确定数量增加,需要人工查看。两种设置没有简单的“越高越好”,应根据漏报与错报后果选择,并保留低把握时不自动下结论的出口。

条件 主要风险 观察指标 处理
正常光 基本功能不通 正确、时延 修复后再测
弱光 漏报增加 漏报、未确定 改善照明
侧角度 目标遮挡 错报、连续帧 调整机位
摄像头断开 输入中断 故障提示时间 转样例模式

实时状态还要避免连续播报。系统要求同一结果连续出现若干帧才提示,并在提示后进入短暂等待;状态恢复后才允许下一次提示。学生查看日志,确认提示次数少于帧数,理解“每帧判断”与“事件触发”不是一回事。

测试结束后,小组检查日志只含测试编号、环境条件、结果和时延,不含人脸、姓名或原始画面。若课程改用自愿参与者,也应在活动前说明范围并允许退出。本案例采用的教学规则不等同于真实场所部署许可,任何真实项目都需另行完成必要性、合法性和安全评估。

13.3 物理世界里的边界

镜头一旦转向场所与人,边界问题便再也绕不开。第11章的三条规矩,在物理世界各有对应的形态。

范围有上限。步数上限管的是循环的长度,镜头要管的是视野的宽度:只拍指定的作业区域,不拍休息角落,不拍走廊与窗外;只在实训时段开启,下课即停。拍摄的范围与时间,像步数一样,预先写定。

过程有日志。识别了什么、提醒了几次、误报了几回,逐条留痕。日志既是改进的依据,也是对被拍摄者的交代:出了争议,翻记录说话。

处置有暂停点。一切落到具体人的处置——通报、记名、任何后果——必须经人确认。机器可以说”请检查佩戴”,只有人可以说”这算违规”。

摄像头处理个人图像时,应当明确目的、范围、是否存储、保留期限和访问人员,并依照具体场景履行告知、提示或同意等要求。公共场所图像采集、人脸识别和普通课堂演示适用的条件并不完全相同。本课程采用显著说明、自愿参与、最小范围和不保存原始画面的严格边界。

【旁注】(楷体) 电梯间的摄像头旁,总贴着一枚”内有监控”的标识。小小一枚贴纸,是技术对人的一声招呼:我在这里,为的是安全,不是窥视。做物理智能体,先学会打这声招呼。

【想一想】③ 有同学建议把安全帽助手的镜头顺便对准休息区,“看看谁在玩手机”。请依据本节内容,说明这个建议错在哪里。


物理边界同时包含技术、场地与数据

技术边界包括识别对象、接受界线、提醒方式和最大运行时间;场地边界包括镜头朝向、拍摄区域和退出通道;数据边界包括是否保存、保存什么、保留多久、谁能查看。三类边界要在运行前写入任务卡,并由教师检查。

个人图像属于个人信息,处理时要遵守目的明确、范围必要和安全保护等要求。在公共场所安装图像采集或个人身份识别设备,还涉及维护公共安全的必要性、显著提示标识和用途限制等具体法律规则;若用于其他目的,可能需要取得单独同意。不能把所有摄像头场景简化成同一句“只要同意就可以”。

【图13-3 物理智能体的三重边界:技术—场地—数据(SVG图位)】

本课程采用比一般演示更严格的实践规则:不采集人脸身份,不保存原始画面,不上传网络,以道具和人台为主;涉及自愿参与者时事先说明并取得同意。这样的规则服务于安全教学,并不代替真实项目的合规评估。进入岗位后,还要依据具体场所、目的和现行制度审查。

实践活动 我的第一台物理智能体

打开本章实训页(labs/ch13),完成三步验证;经教师检查摄像头连接与场地标识后开始。本活动全程只识别物品与佩戴状态的测试道具,识别涉及同学时须事先征得本人同意。

第1步 静物识别。 将三样实训物品(如安全帽、扳手、抹布)依次置于镜头前,查看识别结果,记录认对与认错的情况。

第2步 结构化运行。 启动“安全帽检测”循环,使用道具或人台完成佩戴与未佩戴两种状态,并在正常光、弱光和侧角度下各重复四次。逐轮比对日志与现场实况。

第3步 误漏与时延统计。 统计24轮中的误报、漏报和未确定数量,比较三种环境条件,并记录每组的提示时延。

第4步 边界设计。 假设这套助手要在实训室正式部署,写出你的部署边界:拍摄范围与时段、日志保存期限、明示标识的文字、处置的暂停点设在何处。

第5步 填写观察单。 将四步结果填入《物理智能体观察单》。

【编者注:此处配实训页实际截图与现场照片(真实拍摄),待定稿后补充】


用结构化样例测试环境变化

测试设计为两个目标状态、三种环境条件和四次重复,共24轮:佩戴与未佩戴,分别在正常光、弱光和侧角度下测试。每轮使用编号记录预期、实际、是否错报或漏报以及从举起道具到提示的大致时延。样例由道具或人台完成,不要求同学进入画面。

实训页自动生成两类错误统计和时延分布。改变接受界线后只重测同一组固定样例,比较错报、漏报和未确定数量怎样变化。24轮只是课堂探索样本,用来发现边界,不足以证明系统可用于真实安全管理。完成后删除临时缓存,并确认交付物不含原始个人图像。

比较两种运行设置

使用完全相同的24轮样例,分别测试设置A与设置B。只改变接受界线或连续确认次数中的一项,其他条件保持不变。比较两类错误、未确定数量、提醒次数和最慢时延,说明变化带来的收益与代价。若同时改变光线和设置,结果不能用于判断设置影响。

在日志中选择一轮错报和一轮漏报,回看当时的环境条件,不保存原始人像。提出的改进应优先是降低风险的办法,如改善照明、调整机位、增加未确定出口,而不是直接扩大采集范围或自动执行处置。

活动结束前完成数据清理清单:停止摄像头、关闭页面、删除临时缓存、确认交付物无原始画面、保留去标识化统计。另一组交叉检查后签名。技术测试与数据保护同时结束,才算完成物理智能体实践。

物理测试记录的完整字段

每轮编号对应一个预先安排的状态与环境,运行前写预期,运行后再填实际。不得看到结果后改写预期。时延使用实训页提供的时间记录,课堂手工观察只作对照;若页面没有成功记录时间,标为缺失,不自行估出精确数字。

轮次 状态/环境 预期 实际 错误类型 时延

汇总时分别报告三种环境,不把弱光问题藏在总数中。设置比较还要写明唯一变化是什么。若更换了摄像头、机位或道具,应建立新测试批次,不能与原数据直接合并。

数据清理后,在记录页写明删除时间、执行者和保留内容。课程只保留去标识化统计和结论,用最少数据支持复盘。

岗位迁移:设计一个低风险物理提醒原型

电商方向可选择商品拍摄区色卡提醒,数媒方向可选择演播区道具到位提示,汽修、护理或物流方向可选择教学设备状态卡、护理训练物品检查或货位颜色提示。只识别道具与色卡,输出屏幕或声音提示,不连接真实设备控制、考核与处罚。

画出采集、画面处理、识别、接受界线、提示和记录六个环节。准备正常光、弱光、侧角度、无目标和输入中断样例。每轮先写预期,运行后记录实际、错误类型和时延。设置调整一次只改变接受界线或连续确认之一。

场地卡写镜头方向、拍摄范围、退出方式和现场标识;数据卡写是否保存、保留什么、谁能查看和何时清理。课程默认不保存原始视频,优先使用人台与道具。若画面可能出现同学,先说明活动并允许不参与。

另一组检查原型能否在未确定、摄像头断开和服务失败时安全降级。若系统把故障当正常、把低把握判断直接变成处置,必须退回修改。物理智能体的合格首先是不会把不确定放大为真实伤害。

贯穿项目:班级 AI 助手 v0.13

本章项目阶段是“物理感知”。接入摄像头或样例模式,记录光线、角度、时延和连续状态,明确课堂原型与真实部署的边界。这一版不是另起一个无关作业,而是在上一版项目档案上增加一项可验证能力;新增、保留和取消的内容都要写入版本记录。

同时把本章最值得保留的一次失败写入《失败样例册》。记录项目版本、输入条件、预期与实际、错误起点、修改动作和回归结果;暂时无法定位时写“证据不足”,不得为了完整而虚构原因。

安全与责任

本章红线 采集图像前必须明确目的与必要范围,依具体场景履行提示、告知或同意要求;课程实训不保存、不外传原始个人画面。

镜头背后是技术,镜头前面是人的尊严。一段随手外传的监控影像,可能成为伤害他人的利器。让技术看得见的同时,让规矩也看得见——明示的标识、写定的用途、可查的日志,是物理智能体获得他人信任的全部凭据。

本章小结

这一章,AI 走出了屏幕。物理世界动作难撤销,谨慎须加倍;摄像头接上”判断—执行—观察”的循环,最小的物理智能体便在现场转动起来。眼睛会看错,所以动作要降级——判断交给机器,处置留给人;措辞要留余地,出错要有后路。三条规矩换上现实的形态:范围如上限,日志作留痕,处置设暂停;而在一切规矩之前,站着知情与同意。纸上得来终觉浅——亲手让它在现场转过十轮,统计过它的误与漏,你才真正懂得:让机器看世界不难,难的是让它看得有分寸。

习题

基础题

  1. 什么是误报,什么是漏报?各举本章场景中的一例。
  2. “判断交给机器,处置留给人”体现的是第11章哪条规矩的思想?在物理场景中为什么尤其重要?
  3. 三条规矩在物理世界的对应形态分别是什么?

应用题

  1. 仓储专业拟用摄像头识别货架上的缺货情况并提醒补货。请分析:这个场景与”识别人”的场景相比,边界设计可以放宽哪些、仍须坚守哪些?
  2. 为你专业实训室的一个安全提醒场景(用电、消毒、堆放……)设计一版部署方案:识别对象、提醒方式、部署边界各一条。

拓展题(选做)

  1. 观察你生活中的一处摄像头(校园、商场、小区),检查它的明示标识与本章要求的差距,写出两条改进建议。

本章交付物

交付物 要求
《物理智能体观察单》 一张,四步记录完整
自评勾选单 逐条自查勾选

《物理智能体观察单》

项目 记录
静物识别:认对与认错
循环运行:十轮日志与实况比对
误报数/漏报数及影响因素
我的部署边界(范围、时段、日志、暂停点、标识)
我的一点心得

自评勾选单