第9章 视觉理解与多模态模型:图像识别的能力边界
本章导读
到目前为止,AI 处理的主要是文字——你输入文字,它读取文字并生成文字。但生活和工作里有大量信息是图片:一张设备照片、一张报表截图、一张菜单的照片、一张随手拍的笔记。今天主流的 AI 助手大多已经具备一定的图像理解能力,你上传一张照片,它可以描述画面内容、识别文字或提取关键信息。
本章要解决一个关键问题:AI 对图片的识别,和人的视觉理解到底有什么差别?
这个问题很重要,因为很多 AI 出错的方式都与视觉识别机制有关。它有时会把扫地机器人识别成洗碗机,把标价单位识别错误,把一张普通照片中的人数判断错误。理解它如何处理图像,就能预测它在什么场景下最容易出错,从而知道哪些地方必须人工对照原图复核。
古人说:读万卷书,行万里路。 读文字和看世界是两种能力。AI 能描述图像,但关键判断仍要回到画面细节和真实场景中复核。
学习目标
- 知识目标:
- 能用自己的话解释 AI 看图和人眼看图的本质区别。
- 能说出 AI 在哪几种典型场景下最容易看错——遮挡、模糊、光线、相似物。
- 能力目标:
- 能设计一组小实验,给 AI 同一张图片、不同的修改版本,观察它的描述如何变化。
- 能写一份看图记录表,记下 AI 看对了什么、看错了什么、为什么。
- 素养目标:
- 不把 AI 看图的结果直接当成事实——视觉判断必须人工复核。
- 不上传人脸、证件、未授权他人的照片——理解图像隐私的基本边界。
先修要求与环境清单
- 已学完第 7、8 章,理解“流畅 ≠ 正确”“答案要能回到证据来源”和“长材料中的关键信息可能被漏掉”等底线。
- 软件准备:课程统一配置的支持图片输入的本地大模型服务(课程环境已预置;如果本地不支持,使用课程提供的多模态在线工具);一个简单的图片编辑工具(Windows 自带画图、macOS 预览、或手机自带编辑均可)。
- 配套资源:本章 Notebook 已预置 6 张统一来源、统一授权的实验图片(食堂托盘、自习室、宿舍桌面、文具袋、运动场角落、操作台),以及看图记录表模板。本章不需要你写代码,也不需要上传任何个人或他人的照片。
知识准备:先认识这些词
在动手之前,先把本章会反复出现的几个概念建立起来。
- 多模态(multimodal)
- 一句话说明:AI 不只能处理文字,还能处理图片、声音、视频等多种形式的信息。
- 直观解释:以前的 AI 是只会读的助理,现在的多模态 AI 像是能听能看能读的助理。
- 应用场景:手机拍照搜题、扫描翻译、医学影像辅助、设备故障识图。
- 像素(pixel)
- 一句话说明:图片在计算机里的最小单位——一个个有颜色的小方格。
- 直观解释:你手机拍的一张照片大概是几百万个像素拼起来的;放大到极限你会看到一格一格的色块。
- 关键点:AI 看到的是这些数字化的色块,不是你看到的完整画面。很多视觉模型还会把图片先切成一个个局部小块,再从小块中提取线索。
- 特征(feature)
- 一句话说明:AI 从像素中提取出来的线索——比如边缘、形状、颜色块、纹理。
- 直观解释:你看一张椅子的照片,会立刻认出椅子;AI 通常是先提取边缘、形状、颜色、位置等线索,再判断这组线索更像哪一类物体。
- 应用场景:人脸识别就是先提取眼睛位置、鼻子轮廓等特征再做匹配。
- 图像识别(image recognition)
- 一句话说明:让 AI 判断图里是什么——是猫还是狗、是苹果还是橘子。
- 关键性质:识别结果带有不确定性。模型可能判断“这张图更像猫”,但最后用文字说成“这是一只猫”。
- 视觉理解(visual understanding)
- 一句话说明:不只识别是什么,还要描述发生了什么,例如“有人在用餐”。
- 直观解释:识别是指认物体;理解是看懂场景。理解比识别难得多。
- 误认 / 视觉幻觉(visual hallucination)
- 一句话说明:AI 把图里没有的东西说成有,或把 A 看成 B。
- 直观解释:和第7章的语言幻觉是亲戚——一旦看不清楚,AI 同样会用看起来合理的内容把空白填上。
- 应用场景:把模糊的菜单里的米饭看成米粉;把同一桌的两个杯子数成三个。
- 图像隐私(image privacy)
- 一句话说明:图片往往带有比文字多得多的私密信息——脸、证件、地理位置、家里布局。
- 关键边界:未脱敏的人脸、身份证、银行卡、未授权他人的照片,绝对不上传。
9.1 问题与现象:AI 看到的,不是你看到的
9.1.1 一个简单的测试
小李拍了一张食堂托盘的照片:一份米饭、一份青菜、一份番茄炒蛋、一杯豆浆。他把图片传给 AI,问:这一餐大概多少钱?热量大概多少?
AI 给了一段很专业的回答:
这是一份典型的校园食堂套餐,包含:白米饭(约 1.5 元)、清炒青菜(约 3 元)、番茄炒蛋(约 6 元)、豆浆(约 2 元),总计约 12.5 元。热量约 650 大卡,碳水化合物约 90 g,蛋白质约 25 g,脂肪约 18 g……
看上去专业又详细。但小李仔细一看,发现至少两件事不对:
- AI 说的是清炒青菜——其实那是一份蒜蓉空心菜。
- AI 给的番茄炒蛋价格 6 元——其实小李这份菜的窗口标的是 8 元。
为什么会这样?因为 AI 看到的不是你看到的:青菜是它从绿色叶片这个特征推出来的最大概率结论;价格则是它根据一般校园食堂大概是这个价位估出来的——它根本没有真的去识别窗口标价牌上的字。
9.1.2 同样的图,问法不同,回答可能完全不同
小李换了一种问法:请只描述你在图片中直接看到的内容,不要做任何推测。如果某个细节看不清,请直接说看不清。
AI 这次的回答变了:
图片中可以看到一个食堂托盘,上面有四个餐具:一碗白色颗粒物(很可能是米饭)、一份绿色蔬菜(看起来像绿叶菜,但具体品种看不清)、一份红色和黄色混合的菜品(可能含有番茄和鸡蛋)、一个透明杯装的浅色饮品。背景中能模糊看到食堂窗口,但价格牌上的具体数字看不清。
差别在哪里?AI 还是同一个 AI,图片没有变化。变化在于提问方式。第一种问法(多少钱、多少热量)容易诱导 AI 用经验补全;第二种问法(只描述图中可直接确认的信息、看不清的请说明看不清)让 AI 更接近基于证据作答。
本章要训练的就是这种判断力:区分哪些描述有图像依据,哪些描述可能是推测。
【思考 1】 有人说:那我下次问之前先说一句“不要猜”就行了,对吧?请结合 9.1.1 节的例子,说明这种做法为什么有效但不充分,还必须增加哪些人工核验动作。
思考提示:仅靠提示词不够。AI 即便被要求不要猜,仍可能把模糊不清的内容按最相近类别识别出来。最关键的是:① 涉及具体数字(价格、数量、热量),人工对照原图核查;② 不确定的细节,人工再次确认;③ 涉及决策的判断(吃不吃、买不买、报不报修),不能只依赖 AI 描述。
9.2 原理与分析:AI 是怎么看图的?
相关结构如图9-1 所示。
这张图不是要求你记住模型结构,而是帮助你建立一个直觉:AI 看图会经过“图片线索 → 模型匹配 → 文字描述”几个转换环节。任何一个环节不稳定,最后的文字都可能说得很像真的,但并不一定可靠。
9.2.1 你和 AI 看一张图的差别
设想你看一张椅子的照片,通常会立刻联想到:椅子,木头的,看上去有点旧,应该挺重的,坐上去可能会嘎吱响。 你不只在看,还在联想触感、重量、声音——你过去接触椅子的经验也会被同时调用。
AI 看同一张照片,过程完全不同:
- 第一步:图片被拆成成千上万个像素——每个像素就是一组数字(颜色和亮度)。
- 第二步:AI 从这堆数字里找几何特征——四条直线、一块平面、一个靠背形状。
- 第三步:AI 把这些特征和训练中见过的大量图文样本进行匹配——这组特征更接近“椅子”这一类描述。
- 第四步:AI 输出一个文字回答——这是一把椅子。
人看到的是一把具有使用背景的椅子;AI 处理到的是由几何特征组成、最接近“椅子”类别的图案。两种“看”的本质不同。
9.2.2 AI 最容易看错的四种情况
正因为 AI 的看靠的是几何特征匹配,任何让特征变模糊、变缺失、变相似的因素,都会让它出错。常见的有四种:
相关内容见表9-1。
表9-1 情况与为什么会出错记录表
| 情况 | 为什么会出错 | 例子 |
|---|---|---|
| 遮挡 | 关键特征被挡住,AI 只能依据残缺特征推测 | 一只猫坐在键盘后面,只露半个脸——AI 可能把它认成毛绒玩具 |
| 模糊 | 特征边缘不清晰,AI 容易混淆相似类别 | 拍菜单的远景照——米饭和米粉可能分不清 |
| 光线极端 | 太暗、太亮、强烈逆光,AI 看到的颜色都失真 | 夜间拍摄的设备故障图——AI 可能根本看不到关键的指示灯 |
| 相似物干扰 | 多个相似物体堆在一起,AI 容易数错 | 桌上摆了 3 个杯子,AI 可能数成 2 个或 4 个 |
这四种情况合起来构成了 AI 视觉的薄弱点。一旦图片落入其中任何一种,AI 回答的可信度都要降低。
9.2.3 视觉幻觉:与第7章的语言幻觉相似
第7章我们说过:AI 在信息不足时,会用流畅但虚假的内容把空白填上——这叫幻觉。
视觉理解也一样。当一张图的某个区域模糊、被遮、或者根本不在图里,AI 不会说我看不清这部分——它会按这种场景里通常应该有什么去补。
举几个真实的例子:
- 给 AI 看一张空教室的照片,它可能描述有人在听课,但图中其实没有人。
- 给 AI 看一张菜里全是绿叶菜的照片,它可能描述还有几片红色辣椒——其实根本没有。
- 给 AI 看一张只有键盘的桌面,它可能描述键盘旁边放着一杯咖啡——其实没有。
为什么会这样?因为 AI 在训练中接触过大量“教室、绿叶菜、键盘旁咖啡”等常见图文组合。一旦真实图片信息不足,它可能按训练分布中的常见模式补全。这就是视觉幻觉。
【思考 2】 一位实习生用手机拍了一份设备故障现场的照片,传给 AI 让它描述现场情况、列出可能的故障点。这张照片是傍晚拍的,光线很暗,关键的报警指示灯位置被一根管子挡住了。请结合 9.2.2 和 9.2.3 节,预测 AI 这次的回答最可能出现什么类型的错误。这位实习生应该多做哪两件事?
思考提示:最可能的错误包括:① 把指示灯颜色看错,或者漏掉报警信息;② 补出一些常见故障现场可能出现、但图中并不存在的内容。需要增加两件事:① 重新拍一张光线充足且无遮挡的照片;② 不管 AI 如何描述,关键判断(要不要停机、要不要叫维修)必须由现场有资质人员根据实物作出。
9.2.4 关键判断:AI 看图是基于特征的估计
把以上几条合起来,这一章最重要的一句话就是:
AI 看图,不是人的“看见”,而是基于图像特征和训练分布进行估计。
模型不具备人的视觉经验。它会把新图像的特征与训练中学到的大量图像模式进行匹配,找出最相近的类别,再用语言模型组织文字描述。在常规场景中,这种方法可能表现良好;但在遮挡、低光、细节相似或高风险判断中,错误可能以同样流畅的语言呈现出来。
这就是为什么本章核心结论是——视觉判断必须人工复核。
同一句视觉描述的可信程度也不一样。有些内容是图中直接可见的,有些只是疑似判断,有些则可能是模型按经验补出来的。判断这种差别,可以参考图9-2。
图9-2提醒我们:看图记录不能只写“AI 答对 / 答错”,还要标出每一句描述的证据等级。A类是图中直接可见,B类是疑似判断,C类是经验补全,D类属于不能由图片直接下结论的判断。
AI 协同实践:观察视觉模型的判断过程与误判边界
实践目标:通过两组对比实验,观察 AI 看图的边界在哪里:它什么时候较可靠,什么时候容易推测错误。
预计时间:25 分钟左右。
本节注意:实验全程只使用 Notebook 里预置的 6 张图片,这些图片已经做了脱敏和授权处理。不要上传自己的照片、带人脸的照片或任何身份证件图片。这条规则从本节实操开始执行。
第 1 步:让 AI 老实描述一张图
打开 Notebook,加载第一张图片(食堂托盘)。先用一个开放式提问让 AI 自由描述:
请描述这张图片里你看到的内容。
把回答完整复制到看图记录表。这是基线版本——你要观察 AI 在没有任何约束时会多大胆地补充。
第 2 步:要求 AI 看不清就说看不清
对同一张图,换一种问法:
请只描述你在图片中直接看到的内容,不要做任何推测或补充。
如果某个细节看不清,请明确说"这部分看不清"。
如果你不能明确确认某个物品是什么,请说“疑似某物”。
把回答记到表的第二栏。对比两次回答,重点观察: * 第二次的回答是不是变得更短、更克制? * 出现了多少处看不清或疑似? * 第一次回答里有没有 AI 凭空补出来的细节,在第二次回答里被去掉了?
关键观察点 这一步训练你识别哪些描述有图像依据,哪些描述可能是无依据补全。这是本章最重要的训练,后续复核都建立在此基础上。
第 3 步:遮挡测试——把关键信息盖住
打开图片编辑工具(Windows 画图、macOS 预览均可),把图片里的关键区域用一个黑色方块盖住。例如:
- 食堂托盘图:把饮料杯子盖住。
- 自习室图:把书本盖住。
- 文具袋图:把笔盖住。
把原图和遮挡后的图分别问同样一个问题:
请描述这张图片里你看到的内容。这一餐里有没有饮料?
(或:桌上有没有书?/ 文具袋里有没有笔?)
记录两次回答的差异。特别注意 AI 会不会描述被遮挡的信息,这是视觉幻觉最典型的表现。
第 4 步:替换测试——换掉一个细节
这次更进一步。用图片编辑工具,把图里的一个细节换成另一个东西。例如:
- 用画图工具把托盘里的豆浆杯涂成橙色饮料。
- 把桌上的练习本涂成红色。
再问 AI 同样的问题,记录差异。重点观察: * AI 有没有看到这个修改? * 如果它没看到,它是描述成了原物,还是描述成了你修改后的样子? * 这种修改如果发生在真实场景里(比如恶意 PS 过的图片),后果会怎样?
第 5 步:让 AI 自己说不确定度
最后这一步特别有用。对前面任何一张图,发送:
请把你刚才那段描述里的每一句话,按下面三类标号:
[A] 图中直接可见,能指出形状、颜色或位置;
[B] 疑似判断,需要人工对照原图确认;
[C] 图中证据不足,可能是按经验补出来的。
请逐句重写并标号。
观察 AI 对自身描述的分级情况。通常会发现:在明确要求分级时,AI 可能把部分描述标为“疑似”或“证据不足”。但这只是辅助线索,最终仍要由人对照原图复核。
验证与证据:用看图记录表
看图记录表
相关内容见表9-2。
表9-2 编号与图片记录表
| 编号 | 图片 | 自由描述(v1) | 要求看不清就说看不清(v2) | v1 vs v2 多/少了什么 |
|---|---|---|---|---|
| 1 | 食堂托盘 | |||
| 2 | 自习室 | |||
| 3 | 文具袋 |
遮挡 / 替换测试表
相关内容见表9-3。
表9-3 编号与修改方式记录表
| 编号 | 修改方式 | AI 是否看到了修改 | 错误类型(漏看 / 无依据补全 / 描述错位) | 一句话观察 |
|---|---|---|---|---|
| 1 | 遮住饮料杯 | |||
| 2 | 把豆浆涂成橙色 | |||
| 3 | (自选一种) |
原理小结(100~200 字)
围绕两个问题写一段:
- 在你的实验里,AI 最容易看错的是哪一类情况?为什么这一类对它特别难?
- 如果未来你要在岗位上用 AI 帮忙看一张设备 / 食材 / 报表的照片,你会增加哪两个核验动作?
伦理、安全与边界
第一条底线:不上传人脸、证件、未授权的照片
这一条是图像场景里最重要的底线之一:
图片携带的隐私远比文字多。
一段文字最多记录姓名、身份证号几个字段;而一张照片可能同时包含人脸、衣着、家庭布局、桌上证件、窗外街景、手机屏幕里的对话、墙上的家人合影等信息,任何一个细节都可能成为隐私泄露的入口。
不要上传的清单:
相关内容见表9-4。
表9-4 类型与为什么不能上传记录表
| 类型 | 为什么不能上传 |
|---|---|
| 任何人脸照片(包括自拍) | 人脸是高度敏感的生物特征,可能被用于身份盗用 |
| 身份证、学生证、银行卡 | 含有可被用于诈骗的核心信息 |
| 未经本人同意的他人照片 | 侵犯他人肖像权和隐私 |
| 家里 / 宿舍 / 办公场所的全景 | 暴露住址、作息、贵重物品位置 |
| 手机屏幕截图(含对话) | 暴露社交关系和私人对话 |
| 病历、化验单、医学影像 | 健康信息属于法律严格保护的范畴 |
实操守则:本章所有实验只用 Notebook 里预置的图片。这些图已做过脱敏处理,并明确授权用于本章练习。
第二条底线:视觉判断必须人工复核
第 5、6 章我们说流畅 ≠ 正确有出处 ≠ 正确。视觉场景下要再加一句:
AI 看到 ≠ 真的有——AI 的描述只是参考,不是事实。
下面这几类场景下,AI 的视觉描述只能作为线索,不能作为结论:
相关内容见表9-5。
表9-5 场景与为什么必须复核记录表
| 场景 | 为什么必须复核 |
|---|---|
| 设备故障识图 | 一个误判可能导致带电操作或漏修真故障 |
| 医学影像(如果你以后接触) | 任何诊断必须由医生最终签字 |
| 食品安全 / 食材识别 | 误认(看上去新鲜)可能造成中毒 |
| 报表 / 票据识读 | 一个数字看错可能导致几千几万的差错 |
| 责任追溯依据照片 | 必须由专业人员核验过原图 |
| 学习者作业批阅 | 一张错判可能影响学习者的成绩或评价 |
第三条底线:误认会发生,要为它留出刹车空间
AI 的视觉判断可能误认。这不只是偶然表现不佳,也与它的工作机制有关。所以设计任何用 AI 看图的流程时,都要为可能误判留出纠错空间:
- 不要让 AI 看图的结果直接触发不可逆动作(如下单、删档、发邮件)。
- 不要让 AI 看图的结果直接公开(发布到群、上传到官网、发给客户)。
- 重要判断必须人工复核,即使只需要 30 秒。
【思考 3】 一位实习生在水果店帮忙,店主让他用 AI 帮忙识别一筐水果有没有坏的、需要挑出来。这位实习生想直接把 AI 标出来的那几个看起来变色的水果挑出来扔掉。请回答:他应该多做哪两件事,再决定要不要扔?
思考提示:① 人工再次确认外观和手感,AI 可能把自然斑点看成腐烂,也可能漏掉内部变质但外表完好的水果;② 在丢弃之前请店主或有经验的人再看一眼,特别是边缘案例。丢弃是不可逆动作,应该由有责任的人做最后判断。
总结与思考
本章核心判断
- AI 看图不是人的“看见”,而是基于图像特征和训练分布进行估计。
- AI 视觉的四个薄弱点:遮挡、模糊、光线极端、相似物干扰。落入任何一种,可信度都要降低。
- 视觉幻觉确实会发生,AI 可能把图里没有的内容补出来。
- 视觉判断必须人工复核——AI 的描述只是线索,不是结论。
- 同一句视觉描述也要分等级:直接可见、疑似判断、经验补全和不能下结论。
- 图像隐私比文字隐私大得多——不上传人脸、证件、未授权他人照片。
基础题(理解层面)
- 用自己的话说说 AI 看图和人眼看图的本质区别。
- AI 看图最容易出错的四种情况是哪四种?请各举一个生活中可能遇到的例子。
- 什么是视觉幻觉?它和第7章学过的语言幻觉在原理上有什么共同点?
迁移题(专业场景)
- 假设你所在专业的实训课要用 AI
帮忙做一项看图判断的任务(比如识别零件型号、识别食材新鲜度、识别布料颜色)。请回答:
- 你会让 AI 看哪一类图?哪一类图绝对不让 AI 单独判断?
- 如果要给其他学习者写一条使用 AI 看图工具的三条注意事项,你会写什么?
风险题(伦理与边界)
- 一位学习者想做一个活动照片美化器,让 AI
自动给活动现场拍的照片做美化和描述。活动照片大多带有参与者和授课人员的脸。请回答:
- 这件事涉及哪几条本章学过的边界?
- 在动手做之前,他至少要先做哪两步?
本章交付物
请按下面清单提交本章过程证据包:
本章讨论的是图像识别和多模态理解的能力边界。后续学习将进一步进入工具调用和动作执行场景,重点讨论如何在 AI 执行任务时避免越权、误操作和信息外泄。