版本对照:左侧保留服务器原有 v1.7,右侧为当前中职修订稿。两栏可独立滚动。
旧版 v1.7原稿

第9章 视觉理解与多模态模型:图像识别的能力边界

本章导读

到目前为止,AI 处理的主要是文字——你输入文字,它读取文字并生成文字。但生活和工作里有大量信息是图片:一张设备照片、一张报表截图、一张菜单的照片、一张随手拍的笔记。今天主流的 AI 助手大多已经具备一定的图像理解能力,你上传一张照片,它可以描述画面内容、识别文字或提取关键信息。

本章要解决一个关键问题:AI 对图片的识别,和人的视觉理解到底有什么差别?

这个问题很重要,因为很多 AI 出错的方式都与视觉识别机制有关。它有时会把扫地机器人识别成洗碗机,把标价单位识别错误,把一张普通照片中的人数判断错误。理解它如何处理图像,就能预测它在什么场景下最容易出错,从而知道哪些地方必须人工对照原图复核。

古人说:读万卷书,行万里路。 读文字和看世界是两种能力。AI 能描述图像,但关键判断仍要回到画面细节和真实场景中复核。

学习目标

  • 知识目标:
    1. 能用自己的话解释 AI 看图和人眼看图的本质区别。
    2. 能说出 AI 在哪几种典型场景下最容易看错——遮挡、模糊、光线、相似物。
  • 能力目标:
    1. 能设计一组小实验,给 AI 同一张图片、不同的修改版本,观察它的描述如何变化。
    2. 能写一份看图记录表,记下 AI 看对了什么、看错了什么、为什么。
  • 素养目标:
    1. 不把 AI 看图的结果直接当成事实——视觉判断必须人工复核。
    2. 不上传人脸、证件、未授权他人的照片——理解图像隐私的基本边界。

先修要求与环境清单

  • 已学完第 7、8 章,理解“流畅 ≠ 正确”“答案要能回到证据来源”和“长材料中的关键信息可能被漏掉”等底线。
  • 软件准备:课程统一配置的支持图片输入的本地大模型服务(课程环境已预置;如果本地不支持,使用课程提供的多模态在线工具);一个简单的图片编辑工具(Windows 自带画图、macOS 预览、或手机自带编辑均可)。
  • 配套资源:本章 Notebook 已预置 6 张统一来源、统一授权的实验图片(食堂托盘、自习室、宿舍桌面、文具袋、运动场角落、操作台),以及看图记录表模板。本章不需要你写代码,也不需要上传任何个人或他人的照片。

知识准备:先认识这些词

在动手之前,先把本章会反复出现的几个概念建立起来。

  1. 多模态(multimodal)
    • 一句话说明:AI 不只能处理文字,还能处理图片、声音、视频等多种形式的信息。
    • 直观解释:以前的 AI 是只会读的助理,现在的多模态 AI 像是能听能看能读的助理。
    • 应用场景:手机拍照搜题、扫描翻译、医学影像辅助、设备故障识图。
  2. 像素(pixel)
    • 一句话说明:图片在计算机里的最小单位——一个个有颜色的小方格。
    • 直观解释:你手机拍的一张照片大概是几百万个像素拼起来的;放大到极限你会看到一格一格的色块。
    • 关键点:AI 看到的是这些数字化的色块,不是你看到的完整画面。很多视觉模型还会把图片先切成一个个局部小块,再从小块中提取线索。
  3. 特征(feature)
    • 一句话说明:AI 从像素中提取出来的线索——比如边缘、形状、颜色块、纹理。
    • 直观解释:你看一张椅子的照片,会立刻认出椅子;AI 通常是先提取边缘、形状、颜色、位置等线索,再判断这组线索更像哪一类物体。
    • 应用场景:人脸识别就是先提取眼睛位置、鼻子轮廓等特征再做匹配。
  4. 图像识别(image recognition)
    • 一句话说明:让 AI 判断图里是什么——是猫还是狗、是苹果还是橘子。
    • 关键性质:识别结果带有不确定性。模型可能判断“这张图更像猫”,但最后用文字说成“这是一只猫”。
  5. 视觉理解(visual understanding)
    • 一句话说明:不只识别是什么,还要描述发生了什么,例如“有人在用餐”。
    • 直观解释:识别是指认物体;理解是看懂场景。理解比识别难得多。
  6. 误认 / 视觉幻觉(visual hallucination)
    • 一句话说明:AI 把图里没有的东西说成有,或把 A 看成 B。
    • 直观解释:和第7章的语言幻觉是亲戚——一旦看不清楚,AI 同样会用看起来合理的内容把空白填上。
    • 应用场景:把模糊的菜单里的米饭看成米粉;把同一桌的两个杯子数成三个。
  7. 图像隐私(image privacy)
    • 一句话说明:图片往往带有比文字多得多的私密信息——脸、证件、地理位置、家里布局。
    • 关键边界:未脱敏的人脸、身份证、银行卡、未授权他人的照片,绝对不上传。

9.1 问题与现象:AI 看到的,不是你看到的

9.1.1 一个简单的测试

小李拍了一张食堂托盘的照片:一份米饭、一份青菜、一份番茄炒蛋、一杯豆浆。他把图片传给 AI,问:这一餐大概多少钱?热量大概多少?

AI 给了一段很专业的回答:

这是一份典型的校园食堂套餐,包含:白米饭(约 1.5 元)、清炒青菜(约 3 元)、番茄炒蛋(约 6 元)、豆浆(约 2 元),总计约 12.5 元。热量约 650 大卡,碳水化合物约 90 g,蛋白质约 25 g,脂肪约 18 g……

看上去专业又详细。但小李仔细一看,发现至少两件事不对:

  • AI 说的是清炒青菜——其实那是一份蒜蓉空心菜。
  • AI 给的番茄炒蛋价格 6 元——其实小李这份菜的窗口标的是 8 元。

为什么会这样?因为 AI 看到的不是你看到的:青菜是它从绿色叶片这个特征推出来的最大概率结论;价格则是它根据一般校园食堂大概是这个价位估出来的——它根本没有真的去识别窗口标价牌上的字。

9.1.2 同样的图,问法不同,回答可能完全不同

小李换了一种问法:请只描述你在图片中直接看到的内容,不要做任何推测。如果某个细节看不清,请直接说看不清。

AI 这次的回答变了:

图片中可以看到一个食堂托盘,上面有四个餐具:一碗白色颗粒物(很可能是米饭)、一份绿色蔬菜(看起来像绿叶菜,但具体品种看不清)、一份红色和黄色混合的菜品(可能含有番茄和鸡蛋)、一个透明杯装的浅色饮品。背景中能模糊看到食堂窗口,但价格牌上的具体数字看不清。

差别在哪里?AI 还是同一个 AI,图片没有变化。变化在于提问方式。第一种问法(多少钱、多少热量)容易诱导 AI 用经验补全;第二种问法(只描述图中可直接确认的信息、看不清的请说明看不清)让 AI 更接近基于证据作答。

本章要训练的就是这种判断力:区分哪些描述有图像依据,哪些描述可能是推测。

【思考 1】 有人说:那我下次问之前先说一句“不要猜”就行了,对吧?请结合 9.1.1 节的例子,说明这种做法为什么有效但不充分,还必须增加哪些人工核验动作。

思考提示:仅靠提示词不够。AI 即便被要求不要猜,仍可能把模糊不清的内容按最相近类别识别出来。最关键的是:① 涉及具体数字(价格、数量、热量),人工对照原图核查;② 不确定的细节,人工再次确认;③ 涉及决策的判断(吃不吃、买不买、报不报修),不能只依赖 AI 描述。


9.2 原理与分析:AI 是怎么看图的?

相关结构如图9-1 所示。

图9-1 视觉证据链剖面:从画面线索到文字描述

这张图不是要求你记住模型结构,而是帮助你建立一个直觉:AI 看图会经过“图片线索 → 模型匹配 → 文字描述”几个转换环节。任何一个环节不稳定,最后的文字都可能说得很像真的,但并不一定可靠。

9.2.1 你和 AI 看一张图的差别

设想你看一张椅子的照片,通常会立刻联想到:椅子,木头的,看上去有点旧,应该挺重的,坐上去可能会嘎吱响。 你不只在看,还在联想触感、重量、声音——你过去接触椅子的经验也会被同时调用。

AI 看同一张照片,过程完全不同:

  1. 第一步:图片被拆成成千上万个像素——每个像素就是一组数字(颜色和亮度)。
  2. 第二步:AI 从这堆数字里找几何特征——四条直线、一块平面、一个靠背形状。
  3. 第三步:AI 把这些特征和训练中见过的大量图文样本进行匹配——这组特征更接近“椅子”这一类描述。
  4. 第四步:AI 输出一个文字回答——这是一把椅子。

人看到的是一把具有使用背景的椅子;AI 处理到的是由几何特征组成、最接近“椅子”类别的图案。两种“看”的本质不同。

9.2.2 AI 最容易看错的四种情况

正因为 AI 的看靠的是几何特征匹配,任何让特征变模糊、变缺失、变相似的因素,都会让它出错。常见的有四种:

相关内容见表9-1。

表9-1 情况与为什么会出错记录表

情况 为什么会出错 例子
遮挡 关键特征被挡住,AI 只能依据残缺特征推测 一只猫坐在键盘后面,只露半个脸——AI 可能把它认成毛绒玩具
模糊 特征边缘不清晰,AI 容易混淆相似类别 拍菜单的远景照——米饭和米粉可能分不清
光线极端 太暗、太亮、强烈逆光,AI 看到的颜色都失真 夜间拍摄的设备故障图——AI 可能根本看不到关键的指示灯
相似物干扰 多个相似物体堆在一起,AI 容易数错 桌上摆了 3 个杯子,AI 可能数成 2 个或 4 个

这四种情况合起来构成了 AI 视觉的薄弱点。一旦图片落入其中任何一种,AI 回答的可信度都要降低。

9.2.3 视觉幻觉:与第7章的语言幻觉相似

第7章我们说过:AI 在信息不足时,会用流畅但虚假的内容把空白填上——这叫幻觉。

视觉理解也一样。当一张图的某个区域模糊、被遮、或者根本不在图里,AI 不会说我看不清这部分——它会按这种场景里通常应该有什么去补。

举几个真实的例子:

  • 给 AI 看一张空教室的照片,它可能描述有人在听课,但图中其实没有人。
  • 给 AI 看一张菜里全是绿叶菜的照片,它可能描述还有几片红色辣椒——其实根本没有。
  • 给 AI 看一张只有键盘的桌面,它可能描述键盘旁边放着一杯咖啡——其实没有。

为什么会这样?因为 AI 在训练中接触过大量“教室、绿叶菜、键盘旁咖啡”等常见图文组合。一旦真实图片信息不足,它可能按训练分布中的常见模式补全。这就是视觉幻觉。

【思考 2】 一位实习生用手机拍了一份设备故障现场的照片,传给 AI 让它描述现场情况、列出可能的故障点。这张照片是傍晚拍的,光线很暗,关键的报警指示灯位置被一根管子挡住了。请结合 9.2.2 和 9.2.3 节,预测 AI 这次的回答最可能出现什么类型的错误。这位实习生应该多做哪两件事?

思考提示:最可能的错误包括:① 把指示灯颜色看错,或者漏掉报警信息;② 补出一些常见故障现场可能出现、但图中并不存在的内容。需要增加两件事:① 重新拍一张光线充足且无遮挡的照片;② 不管 AI 如何描述,关键判断(要不要停机、要不要叫维修)必须由现场有资质人员根据实物作出。

9.2.4 关键判断:AI 看图是基于特征的估计

把以上几条合起来,这一章最重要的一句话就是:

AI 看图,不是人的“看见”,而是基于图像特征和训练分布进行估计。

模型不具备人的视觉经验。它会把新图像的特征与训练中学到的大量图像模式进行匹配,找出最相近的类别,再用语言模型组织文字描述。在常规场景中,这种方法可能表现良好;但在遮挡、低光、细节相似或高风险判断中,错误可能以同样流畅的语言呈现出来。

这就是为什么本章核心结论是——视觉判断必须人工复核。

同一句视觉描述的可信程度也不一样。有些内容是图中直接可见的,有些只是疑似判断,有些则可能是模型按经验补出来的。判断这种差别,可以参考图9-2。

图9-2 遮挡与替换测试:证据强弱如何改变回答

图9-2提醒我们:看图记录不能只写“AI 答对 / 答错”,还要标出每一句描述的证据等级。A类是图中直接可见,B类是疑似判断,C类是经验补全,D类属于不能由图片直接下结论的判断。


AI 协同实践:观察视觉模型的判断过程与误判边界

实践目标:通过两组对比实验,观察 AI 看图的边界在哪里:它什么时候较可靠,什么时候容易推测错误。

预计时间:25 分钟左右。

本节注意:实验全程只使用 Notebook 里预置的 6 张图片,这些图片已经做了脱敏和授权处理。不要上传自己的照片、带人脸的照片或任何身份证件图片。这条规则从本节实操开始执行。

第 1 步:让 AI 老实描述一张图

打开 Notebook,加载第一张图片(食堂托盘)。先用一个开放式提问让 AI 自由描述:

请描述这张图片里你看到的内容。

把回答完整复制到看图记录表。这是基线版本——你要观察 AI 在没有任何约束时会多大胆地补充。

第 2 步:要求 AI 看不清就说看不清

对同一张图,换一种问法:

请只描述你在图片中直接看到的内容,不要做任何推测或补充。
如果某个细节看不清,请明确说"这部分看不清"。
如果你不能明确确认某个物品是什么,请说“疑似某物”。

把回答记到表的第二栏。对比两次回答,重点观察: * 第二次的回答是不是变得更短、更克制? * 出现了多少处看不清或疑似? * 第一次回答里有没有 AI 凭空补出来的细节,在第二次回答里被去掉了?

关键观察点 这一步训练你识别哪些描述有图像依据,哪些描述可能是无依据补全。这是本章最重要的训练,后续复核都建立在此基础上。

第 3 步:遮挡测试——把关键信息盖住

打开图片编辑工具(Windows 画图、macOS 预览均可),把图片里的关键区域用一个黑色方块盖住。例如:

  • 食堂托盘图:把饮料杯子盖住。
  • 自习室图:把书本盖住。
  • 文具袋图:把笔盖住。

把原图和遮挡后的图分别问同样一个问题:

请描述这张图片里你看到的内容。这一餐里有没有饮料?
(或:桌上有没有书?/ 文具袋里有没有笔?)

记录两次回答的差异。特别注意 AI 会不会描述被遮挡的信息,这是视觉幻觉最典型的表现。

第 4 步:替换测试——换掉一个细节

这次更进一步。用图片编辑工具,把图里的一个细节换成另一个东西。例如:

  • 用画图工具把托盘里的豆浆杯涂成橙色饮料。
  • 把桌上的练习本涂成红色。

再问 AI 同样的问题,记录差异。重点观察: * AI 有没有看到这个修改? * 如果它没看到,它是描述成了原物,还是描述成了你修改后的样子? * 这种修改如果发生在真实场景里(比如恶意 PS 过的图片),后果会怎样?

第 5 步:让 AI 自己说不确定度

最后这一步特别有用。对前面任何一张图,发送:

请把你刚才那段描述里的每一句话,按下面三类标号:
[A] 图中直接可见,能指出形状、颜色或位置;
[B] 疑似判断,需要人工对照原图确认;
[C] 图中证据不足,可能是按经验补出来的。
请逐句重写并标号。

观察 AI 对自身描述的分级情况。通常会发现:在明确要求分级时,AI 可能把部分描述标为“疑似”或“证据不足”。但这只是辅助线索,最终仍要由人对照原图复核。


验证与证据:用看图记录表

看图记录表

相关内容见表9-2。

表9-2 编号与图片记录表

编号 图片 自由描述(v1) 要求看不清就说看不清(v2) v1 vs v2 多/少了什么
1 食堂托盘
2 自习室
3 文具袋

遮挡 / 替换测试表

相关内容见表9-3。

表9-3 编号与修改方式记录表

编号 修改方式 AI 是否看到了修改 错误类型(漏看 / 无依据补全 / 描述错位) 一句话观察
1 遮住饮料杯
2 把豆浆涂成橙色
3 (自选一种)

原理小结(100~200 字)

围绕两个问题写一段:

  1. 在你的实验里,AI 最容易看错的是哪一类情况?为什么这一类对它特别难?
  2. 如果未来你要在岗位上用 AI 帮忙看一张设备 / 食材 / 报表的照片,你会增加哪两个核验动作?

伦理、安全与边界

第一条底线:不上传人脸、证件、未授权的照片

这一条是图像场景里最重要的底线之一:

图片携带的隐私远比文字多。

一段文字最多记录姓名、身份证号几个字段;而一张照片可能同时包含人脸、衣着、家庭布局、桌上证件、窗外街景、手机屏幕里的对话、墙上的家人合影等信息,任何一个细节都可能成为隐私泄露的入口。

不要上传的清单:

相关内容见表9-4。

表9-4 类型与为什么不能上传记录表

类型 为什么不能上传
任何人脸照片(包括自拍) 人脸是高度敏感的生物特征,可能被用于身份盗用
身份证、学生证、银行卡 含有可被用于诈骗的核心信息
未经本人同意的他人照片 侵犯他人肖像权和隐私
家里 / 宿舍 / 办公场所的全景 暴露住址、作息、贵重物品位置
手机屏幕截图(含对话) 暴露社交关系和私人对话
病历、化验单、医学影像 健康信息属于法律严格保护的范畴

实操守则:本章所有实验只用 Notebook 里预置的图片。这些图已做过脱敏处理,并明确授权用于本章练习。

第二条底线:视觉判断必须人工复核

第 5、6 章我们说流畅 ≠ 正确有出处 ≠ 正确。视觉场景下要再加一句:

AI 看到 ≠ 真的有——AI 的描述只是参考,不是事实。

下面这几类场景下,AI 的视觉描述只能作为线索,不能作为结论:

相关内容见表9-5。

表9-5 场景与为什么必须复核记录表

场景 为什么必须复核
设备故障识图 一个误判可能导致带电操作或漏修真故障
医学影像(如果你以后接触) 任何诊断必须由医生最终签字
食品安全 / 食材识别 误认(看上去新鲜)可能造成中毒
报表 / 票据识读 一个数字看错可能导致几千几万的差错
责任追溯依据照片 必须由专业人员核验过原图
学习者作业批阅 一张错判可能影响学习者的成绩或评价

第三条底线:误认会发生,要为它留出刹车空间

AI 的视觉判断可能误认。这不只是偶然表现不佳,也与它的工作机制有关。所以设计任何用 AI 看图的流程时,都要为可能误判留出纠错空间:

  • 不要让 AI 看图的结果直接触发不可逆动作(如下单、删档、发邮件)。
  • 不要让 AI 看图的结果直接公开(发布到群、上传到官网、发给客户)。
  • 重要判断必须人工复核,即使只需要 30 秒。

【思考 3】 一位实习生在水果店帮忙,店主让他用 AI 帮忙识别一筐水果有没有坏的、需要挑出来。这位实习生想直接把 AI 标出来的那几个看起来变色的水果挑出来扔掉。请回答:他应该多做哪两件事,再决定要不要扔?

思考提示:① 人工再次确认外观和手感,AI 可能把自然斑点看成腐烂,也可能漏掉内部变质但外表完好的水果;② 在丢弃之前请店主或有经验的人再看一眼,特别是边缘案例。丢弃是不可逆动作,应该由有责任的人做最后判断。


总结与思考

本章核心判断

  • AI 看图不是人的“看见”,而是基于图像特征和训练分布进行估计。
  • AI 视觉的四个薄弱点:遮挡、模糊、光线极端、相似物干扰。落入任何一种,可信度都要降低。
  • 视觉幻觉确实会发生,AI 可能把图里没有的内容补出来。
  • 视觉判断必须人工复核——AI 的描述只是线索,不是结论。
  • 同一句视觉描述也要分等级:直接可见、疑似判断、经验补全和不能下结论。
  • 图像隐私比文字隐私大得多——不上传人脸、证件、未授权他人照片。

基础题(理解层面)

  1. 用自己的话说说 AI 看图和人眼看图的本质区别。
  2. AI 看图最容易出错的四种情况是哪四种?请各举一个生活中可能遇到的例子。
  3. 什么是视觉幻觉?它和第7章学过的语言幻觉在原理上有什么共同点?

迁移题(专业场景)

  • 假设你所在专业的实训课要用 AI 帮忙做一项看图判断的任务(比如识别零件型号、识别食材新鲜度、识别布料颜色)。请回答:
    1. 你会让 AI 看哪一类图?哪一类图绝对不让 AI 单独判断?
    2. 如果要给其他学习者写一条使用 AI 看图工具的三条注意事项,你会写什么?

风险题(伦理与边界)

  • 一位学习者想做一个活动照片美化器,让 AI 自动给活动现场拍的照片做美化和描述。活动照片大多带有参与者和授课人员的脸。请回答:
    1. 这件事涉及哪几条本章学过的边界?
    2. 在动手做之前,他至少要先做哪两步?

本章交付物

请按下面清单提交本章过程证据包:

本章讨论的是图像识别和多模态理解的能力边界。后续学习将进一步进入工具调用和动作执行场景,重点讨论如何在 AI 执行任务时避免越权、误操作和信息外泄。

当前中职版(2026-07-20)修订稿

第9章 看图与作图:多模态的理解与生成

(建议3课时)

章首语

数媒专业的小张给小李看了两样新鲜事。第一样:她把实训作业的照片发给 AI,它不但认出画面里的相机与反光板,还指出布光的角度偏了。第二样:她敲下一行字——“清晨的校园,逆光,樱花,水彩风格”——几十秒后,一幅画出现在屏幕上。

看得懂图,画得出画。语言与图像,在模型这里打通了。

打通带来便利,也带来一个前所未有的问题:当机器画的画、换的脸足以乱真,“眼见为实”这句老话,还站得住吗?这一章,我们学它的看与画,更要学会在真假之间站稳自己。

机器处理图像,要把像素转成可计算的特征,再把视觉信息与语言联系起来;生成图像则从随机状态出发,在文字条件引导下逐步形成画面。两条技术链都可能产生错误。判断内容真伪时,也不能把“找手指和光影问题”当作可靠鉴定方法。

字里行光 味摩诘之诗,诗中有画;观摩诘之画,画中有诗。——苏轼《书摩诘蓝田烟雨图》

学习目标

  1. 知道什么是多模态大模型,能说出图像理解的常见能力与易错之处;
  2. 能将指令四要素迁移到文生图,生成符合要求的图片初稿;
  3. 能结合来源、标识、文件信息和交叉渠道核验疑似合成内容;
  4. 知道深度伪造的危害,理解”看见不等于真实”;
  5. 树立遵守标识规定、尊重版权与肖像权的法治意识。

9.1 机器怎样看图

此前我们的 AI 只有”耳目于文字”;能够同时处理文字、图像、语音等多种信息的模型,称为多模态大模型(Multimodal Model)。“模态”即信息的形态——文字是一态,图像是一态,声音又是一态。

给它一张图,它能做的事不少:认出画面里的物件,读出招牌与单据上的文字,描述整幅场景,甚至指出照片里的问题。维修专业拍一张发动机舱请它初判,电商专业拍一张商品图请它写文案,都已是常见用法。

但它的”看”,与人的看并不相同。它在海量”图与文”的对照中学会了图像与语言的关联,看图之后做的事,仍是我们熟悉的那件——依据看到的内容,生成最可能的描述。承重之梁延伸到了图像上,它的影子也跟了过来:

数数容易错。画面里七个人,它可能说六个也可能说八个;细碎密集之物,尤其如此。

细节可能编。描述通顺流畅之处,未必处处有据;招牌上模糊的字,它会”补”出一个最像的读法。

它看的是规律,不是现场。照片之外的事——拍摄的前因后果、画面外的情形——它一概不知,问急了照样预测。

所以,看图的结果同样适用第7章的规矩:要紧之处,人眼复核。

【做一做】 找一张本专业的工作照片(实训台、货架、病房布置图皆可),先自己列出画面要点,再交给模型描述,比一比:它多说了什么,漏说了什么?

【想一想】① 为什么说”图像描述也是一种生成,也会有幻觉”?请用承重之梁的道理解释。

图像理解是一条多次转换的链

数字图像由像素组成,每个像素记录颜色与亮度。视觉模型会把画面划分并提取形状、纹理、位置等关系,再与语言模型能够处理的表示连接,最终生成描述或判断。文字识别、物体分类、数量估计和场景描述虽然都以图像为输入,所需能力和误差特点并不相同。

图片先缩放或压缩时,小字和细线可能消失;画面被遮挡、光线偏暗、拍摄角度异常时,视觉特征也会改变。模型随后生成语言,又可能把不确定线索补成肯定描述。因此,评价不能只看“整段像不像”,还要把每句话标为直接可见、合理推测、缺少依据或需要现场信息。

【图9-1 图像理解链:像素—视觉特征—跨模态表示—文字回答(SVG图位)】

不同任务需要不同验证方法。读仪表数值要回看原图局部,统计物品要人工逐项点数,判断空间位置要用清晰参照,涉及设备安全则由现场专业人员确认。让模型报告不确定程度可以作为提醒,却不能把模型自己给出的分数当作事实保证。

先选技术路线,再选择模型

视觉任务并不都需要大型多模态模型。特征固定、规则清楚、数量很大且要求快速响应的任务,可以先用规则或轻量视觉方法处理;需要读懂复杂场景、结合文字提问时,再考虑多模态模型。两者也可组合:轻量方法负责连续筛查,多模态模型分析少量疑难样例,最后由人处理高风险结论。

路线选择至少比较准确性、响应时间、运行成本、结果稳定性和数据去向。答题卡涂点定位与设备现场解释属于不同任务,不能因为工具更新就使用同一方案。模型越大不等于方案越合适,能够说明“为什么用、何时不用”才是工程判断。

9.2 让机器作图

看是理解,画是生成。给模型一段文字,请它生成一幅图,通称文生图。写给它的那段文字,仍是提示词;第6章的四要素,在此换一身衣裳照样合用:

主体(画什么):一杯冒着热气的奶茶,特写; 场景与背景(在哪里、什么氛围):木质桌面,暖色灯光,冬日窗边; 风格与格式(什么画风、什么用途尺寸):清新插画风,适合社交媒体的方形构图; 边界(不要什么):画面中不出现文字,不要过于鲜艳的配色。

要素说得越齐,图离心中所想越近;不满意就修改描述再生成——说清楚、看结果、再修改,画画也是这个循环。

生成图可能出现手部、文字、光影或结构问题,真实照片也可能因压缩与修图出现类似现象。这些线索提醒我们把生成图作为初稿核验和修整,却不能单独证明图像由人工智能生成。判断来源还要结合标识、文件信息和发布渠道。

在岗位上,文生图的定位应当记牢:它出草案,人做定夺。数媒的配图初稿、电商的主图构思、活动的海报草样,交给它快;审美的取舍、品牌的分寸、内容的把关,留给人。

【想一想】② 把你在第6章为文字任务写的一条四要素指令,改写成一条文生图指令。哪个要素改动最大?为什么?

图像生成是逐步形成画面的过程

许多图像生成模型从随机噪声开始,在文字条件引导下反复减少噪声,逐步形成主体、构图、颜色和细节。文字描述会被转换成模型内部的条件表示,用来影响每一步变化。相同描述在不同随机起点、模型版本和生成设置下,可能得到明显不同的图。

生成指令除了主体、场景、风格和边界,还要写明用途、画幅、必须准确的元素和不得出现的元素。若图片用于商品展示,应核对数量、结构、品牌标识和文字;若用于安全说明,不应让生成图替代真实设备图或规范图。一次生成通常只是候选方案,需要筛选、修整和版权检查。

【图9-2 文生图过程:文字条件—随机状态—逐步形成—候选图—人工核验(SVG图位)】

视觉瑕疵会随模型进步和后期编辑而变化。真实照片也可能因压缩、修图或拍摄条件出现异常,因此手部、文字、光影等线索只能提示“需要进一步核验”,不能单独证明图片由人工智能生成。专业判断应转向内容来源、生成标识、文件元数据、发布账号和其他渠道证据。

9.3 真假之间:版权、肖像与深度伪造

技术走到这里,必须停下来,谈一谈真假与是非。

利用 AI 合成、替换人的面容与声音,制作出足以乱真的音视频,称为深度伪造(Deepfake)。几张照片可以”换”出一张脸,几段录音可以”仿”出一个人的声音——屏幕里的那个人说着那样的话,而那个人从未说过。

于是,本书素养链上最后一环在此扣上:流畅不等于正确,引用不等于准确,如今还要加上——看见不等于真实。一段视频、一通”亲人”的语音来电,都不再天然可信。遇到涉及钱财、隐私、名誉的音视频信息,请像核验文字一样核验它:来源何处?原始出处可查吗?换个渠道向本人求证了吗?

与真假相邻的,是权利与法度,记住三条。

肖像与声音权益。使用他人的面容或声音生成内容,应当具备合法依据并尊重本人权益;课程活动不得把他人素材用于换脸、仿声或公开传播。是否构成侵权要结合用途、授权和具体法律规定判断,不能把“只是玩笑”当作免责理由。

版权。AI 生成图像的版权归属,法律上尚在探索;可以确定的是:训练与生成不应冒用他人受保护的作品谋利,商用素材要有授权,模仿在世创作者的独特风格牟利,有失公道也有法律风险。

标识义务。国家已明确规定,人工智能生成合成的内容应当依法添加标识。发布 AI 生成的图片、音视频时按规定标明,是守法,也是对观者的诚实。

【旁注】(楷体) 从前说”有图有真相”,后来说”有视频有真相”。技术改写了这两句话,却改不了那条老理:真相不在图里,在查证里。

【想一想】③ 接到”家人”来电借钱,声音一模一样。结合本节内容,写出你会采取的两个核验动作。


合成内容核验要看来源链

面对可疑图片或音视频,可以按四层证据核验。第一层看发布来源,确认是否来自本人、机构官网或可追溯账号;第二层看内容标识与文件信息,检查是否声明经过人工智能生成或编辑;第三层寻找同一事件的其他独立记录;第四层通过另一个可靠渠道联系相关人员确认。视觉异常只能作为补充线索。

我国《人工智能生成合成内容标识办法》及配套强制性国家标准已于2025年9月1日起施行,对文本、图片、音频、视频和虚拟场景等生成合成内容规定了显式与隐式标识要求。学习者发布课程生成图时,应使用实训页提供的标识功能,并保留生成记录;转发他人内容时,不得恶意删除、篡改或隐匿标识。

【图9-3 合成内容四层核验:来源—标识与文件信息—独立记录—本人确认(SVG图位)】

肖像、声音和作品都连接着权利。处理他人面容、声音或受保护作品,应当先确认目的、授权与适用规则;涉及未成年人和商业发布时更要谨慎。对法律边界不确定的项目,应停止公开使用并向教师或责任部门咨询,不能用“技术上能做”替代合法性判断。

工程案例:一张“设备事故图”的核验过程

班级群出现一张图片,配文称“学校实训室设备发生严重事故”。画面中设备外壳似有烟雾,角落文字模糊。有人从光影判断它是生成图,也有人因为画面逼真而相信。小组不做“看图猜真伪”比赛,而是建立证据清单。

第一步查看发布来源,发现最初转发者并非学校官方账号;第二步检查文件信息,图片经过多次压缩,无法据此确定生成方式;第三步查看是否有人工智能生成标识,没有标识也不能反推一定是真实拍摄;第四步查找学校通知和其他独立记录;第五步通过规定渠道向实训室管理人员确认。最终结论写成“现有证据不足,官方渠道未证实”,而不是草率宣布真或假。

证据层 得到的信息 能支持什么 不能支持什么
画面线索 烟雾边缘异常 值得进一步核验 不能证明生成
发布来源 非官方转发 来源可信度较低 不能证明内容虚假
文件与标识 压缩、无明显标识 信息不完整 不能证明实拍
交叉渠道 官方无相关通知 尚未得到证实 不能替代最终确认

小组随后用授权的设备道具生成一张课程海报初稿,保留生成描述、时间和服务版本,按规定添加显式标识。展示前检查画面是否出现真实校徽、品牌和人物,必要时替换为虚构元素。生成记录与标识共同构成内容来源链。

案例的关键结论是:检测工具、视觉瑕疵和元数据都可能失效,任何单一线索都不应被包装成“百分之百鉴定”。涉及钱财、名誉与安全时,最有效的动作往往是停止转发、回到权威来源、换一个渠道向本人或机构确认。

实践活动 看图·作图·辨图

打开本章实训页(labs/ch09),完成三步验证。文生图环节按学校条件进行:本地生图服务就绪的机房直接操作,未就绪的由教师演示。

第1步 看图测试。 加载实训页提供的实训室照片,请模型描述画面并数出指定物品的数量。人工复核:描述有几处准确,几处有误,数数对不对。

第2步 作图初稿。 用四要素写一条文生图指令,为你的专业生成一幅图(商品示意、海报草样、宣传插画均可)。生成后至少修改描述一次,保存前后两稿。

第3步 核验证据。 实训页给出六幅来源不同的图片。先写下画面线索,再查看生成标识、文件信息和发布背景,给出结论及证据等级;证据不足时明确写“无法仅凭画面判断”。

第4步 标识检查。 检查第2步保存的生成图:按规定应当如何标识?在记录单上写出你的标识方案。

第5步 填写记录单。 将四步结果填入《真假辨识记录单》。

【编者注:此处配实训页实际截图,待实训页定稿后补充】


把“辨图”改成证据核验

第3步不再公布“仅凭画面猜生成方式”的标准答案。实训页为六幅样例提供来源说明、标识信息、文件信息和发布背景,其中部分信息故意缺失。先记录画面线索,再依次查看其他证据,最后给出“来源可信、疑似合成、证据不足、需要本人确认”之一,并写明主要依据。

第2步生成的前后两稿要同时保存生成描述、模型或服务版本、生成时间和人工修改说明。第4步使用实训页添加符合规定的显式标识,并检查导出文件的标识信息。教师评价重点是证据链和权利检查是否完整,不以“猜中几张”作为主要成绩。

完成一张内容来源卡

为第2步生成的图片建立来源卡,记录用途、生成描述、服务或模型版本、生成时间、人工修改、使用素材授权情况和标识方式。若图片含难以核实的品牌、人物或专业设备细节,改为虚构元素或停止公开使用。来源卡与最终图片保持同一文件编号。

再对一张证据不足的样例写核验短报。短报区分“已经确认、尚未确认、不能仅凭现有证据判断”,并列出下一步渠道。另一组检查结论是否超过证据。把“看起来像生成图”改写成“画面出现异常线索,需要结合来源与标识继续核验”,训练准确而克制的表达。

核验短报的固定结构

核验短报由内容摘要、证据清单、当前结论、未决问题和建议动作五部分组成。结论等级只使用“已证实、已证伪、证据不足、等待权威确认”,不用“我觉得像真的”。发现视觉异常时,把它放进证据清单,并注明只能作为辅助线索。

证据 来源 支持程度 仍有局限
画面线索 图片本身 可被压缩或编辑造成
标识与文件信息 文件/平台 可能缺失或被破坏
独立渠道 官方或本人 需确认时效与身份

生成图来源卡与核验短报分别对应“我发布什么”和“我接收什么”。前者重在如实标识与授权,后者重在停止传播和交叉确认。两份材料都不要求学生作法律定性;遇到不确定的公开使用问题,保留证据并向责任人咨询。

岗位迁移:一份专业图像的理解、生成与核验

电商方向选择虚构商品包装,数媒方向选择课程海报,汽修、护理或物流方向选择授权的设备道具、教学场景或货架图片。图像理解任务只描述画面可见内容,不据图作诊断、安全放行或真实库存决定。先由人列出可见事实,再与模型描述逐句比较。

生成任务使用虚构品牌与人物,写清用途、画幅、主体、不得出现的元素和需要人工核对的细节。保存两稿及生成记录,检查文字、结构、品牌和专业常识。若生成图会被误认为真实现场,页面显著标注为人工智能生成的课程示意,并保留来源卡。

核验任务不公布“凭画面猜中”的成绩。学生查看发布来源、标识、文件信息和其他渠道,结论允许为证据不足。涉及设备异常、患者情况或货物事故的图片,不在班级群继续转发,而应回到规定渠道确认。

最终把三项结果放在同一页:模型看图哪里准确、生成图哪里需修正、真假核验依靠哪些证据。三项共同说明,多模态技术不仅要会看与会画,还要管理来源、授权与不确定性。

贯穿项目:班级 AI 助手 v0.9

本章项目阶段是“多模态内容”。加入一项看图或作图能力,同时保存来源卡、生成记录和人工核验结论,不让图片脱离证据链。这一版不是另起一个无关作业,而是在上一版项目档案上增加一项可验证能力;新增、保留和取消的内容都要写入版本记录。

同时把本章最值得保留的一次失败写入《失败样例册》。记录项目版本、输入条件、预期与实际、错误起点、修改动作和回归结果;暂时无法定位时写“证据不足”,不得为了完整而虚构原因。

安全与责任

本章红线 不制作、不传播伪造他人面容与声音的内容;发布 AI 生成的图像与音视频,依法添加标识。

深度伪造伤害的,是具体的人:被换脸者的名誉,被仿声者的亲友,被欺骗者的钱财与信任。技术无善恶,用者有责任。管住自己的手,是底线;练亮自己的眼,帮家人识破伪造的骗局,则是这一课更进一层的价值。

本章小结

这一章,语言与图像在我们的工房里打通了。多模态模型看得懂图,却仍以生成的方式描述所见,数数与细节须人复核;它画得出画,四要素与三步循环原样适用,而初稿定稿之间,站着人的审美与把关。技术照见了便利,也照出了阴影:深度伪造让眼见不再为实,素养链就此扣满三环——流畅不等于正确,引用不等于准确,看见不等于真实。诗中有画,画中有诗,是艺术的境界;真中辨假,假中守真,是这个时代给我们新添的功课。

习题

基础题

  1. 什么是多模态大模型?“模态”指什么?
  2. 图像理解的三个易错之处是什么?各用一句话说明应对办法。
  3. 写出素养链的三句话,并说明第三句是针对什么现象提出的。

应用题

  1. 为班级读书节设计一幅海报,写出四要素完整的文生图指令,并注明预计的两处需要人工修整的地方。
  2. 电商同学用 AI 生成了一张商品场景图打算上架。请依据本章内容,为这张图的使用列一份三项检查清单。

拓展题(选做)

  1. 收集一则被证实为深度伪造的公开案例(新闻有报道的),分析:它骗过了人们的什么习惯?最终是怎样被识破的?

本章交付物

交付物 要求
《真假辨识记录单》 一张,四步记录完整
自评勾选单 逐条自查勾选

《真假辨识记录单》

项目 记录
看图测试:准确与出错之处
作图初稿:两稿指令与改进
找破绽:判对率与我依据的线索
标识方案
我的一点心得

自评勾选单