十二章候选稿 · 汇总于2026-10-08
第4章 让AI看见和听见
样章 v0.1 | 2026年9月20日
一张照片,一声轻响
还是上一章的那只杯子。把它放在桌上,拍一张照片。照片中可以看见杯口、杯身和桌上的影子。刚才杯底碰到桌面时发出的轻响,却没有留在这张照片里。
再录下一段轻敲桌面的声音。只听录音,你能知道桌子是什么颜色,杯子放在左边还是右边吗?
我们在现场时,会很自然地把看到的、听到的和已有经验联系起来。离开现场,只拿到一张照片或一段录音,能够知道的事情就发生了变化。有些细节变得清楚,有些信息仍然缺少。
AI处理的也是这些被记录下来的材料。上一章,我们用照片训练模型,观察它怎样区分杯子和橡皮。本章再往前追问一步:照片怎样成为数字?声音怎样进入计算机?把不同材料放在一起以后,又能多知道些什么?
本章继续使用上一章的图片完成一次比较。声音部分通过短录音和示例理解基本方法,不需要再训练一套新的模型。
学完本章,你将能够:用简单数字解释图像与声音的记录方式;区分图像分类与目标检测、声音分类与语音识别;比较一次输入变化带来的结果;说明多种信息怎样互相补充,以及哪些问题仍需进一步了解。
4.1 图像怎样成为可以处理的信息
4.1.1 像素、颜色与图像中的特征
打开一张杯子的照片,放大杯口附近的一小块区域。图像由按行、列排列的许多小点组成,每个位置都有相应的颜色数值。这样一个图像单元,称为像素(pixel)。它在屏幕上占多大,与显示时的缩放有关。[1]
一张宽640像素、高480像素的图片,共有640×480=307 200个像素。这里说的是横向和纵向记录了多少个位置。把同一张图片在屏幕上放大,显示面积会增加,原先没有记录下来的细节却不会因此自动出现。
计算机怎样记录颜色?一种常见方法是分别记录红、绿、蓝三个颜色分量,英文名称为red、green、blue,合称RGB。把三个分量按顺序写在一起,就能表示一个像素的颜色。[1]
以每个分量取0到255的整数这一常见表示方式为例,(255,0,0)表示红色,(0,0,255)表示蓝色,(0,0,0)表示黑色,(255,255,255)表示白色。其他组合可以表示更多颜色。这里的数值范围对应这种具体的记录方式,图像还可以采用其他表示方法。
只表示明暗的图像称为灰度图。在常见的0到255的灰度表示中,0表示黑,255表示白,中间的数值表示不同深浅的灰。于是,杯子的照片就可以变成一张按位置排列的数值表。每个位置的数值不同,整张图就呈现出明暗变化。[1]
从几个数看见一条边
下面是一行用于演算的灰度数值。把它们想成照片中从左向右相邻的六个像素。
| 像素位置 | 1 | 2 | 3 | 4 | 5 | 6 |
|---|---|---|---|---|---|---|
| 灰度值 | 30 | 32 | 31 | 220 | 222 | 219 |
前三个数比较接近,后三个数也比较接近。第3个像素与第4个像素之间,却从31变成220,差了189。其余相邻位置的差别都很小。
如果用后一个数减去前一个数,再只看差值的大小,就得到2、1、189、2、3。计算机通过这种比较,可以找出局部明暗变化明显的位置。这个例子中,最值得关注的就是第3与第4个像素之间。[2]
在照片里,这样的变化可能出现在杯子与桌面的交界处,也可能来自阴影或杯身上的图案。所以,找到明暗变化只是获得一条线索,尚不能直接判断“这是杯子的边”。
图像中的颜色分布、边缘变化、纹理和位置关系,都可以成为识别所利用的信息。对任务有用的这些信息,通常称为特征。第三章用高宽比作简单分类,高宽比就是我们选出的一个特征。真实图像模型可以利用更丰富的数值组合。[2]
有一类图像神经网络会用同一组参数,反复处理图片不同位置的小片区域,再将得到的结果交给后面的计算。这使网络能够在不同位置寻找某些局部变化,并进一步组合这些信息。训练会调整其中的参数,使它们更适合所学的任务。[2]
刚才计算相邻像素的差值,是一个容易看清的例子。真实模型的计算更加丰富,不能把它理解为“先找到杯子的完整轮廓,再按人的思路认出杯子”。我们能够观察输入和输出,也可以进一步研究模型利用的信息。
回到杯子照片。把杯子移到较暗的地方,像素中的数值会跟着变化;让杯把被挡住,一部分形状信息就不再出现在画面里。上一章看见的识别变化,正是从这些输入差别开始的。
动手算一算:另一行灰度值为40、42、41、43、44、42。按刚才的方法计算相邻差值。与前一组相比,这一行有没有同样明显的明暗交界?只根据这六个数,你能确定它们来自什么物品吗?
4.1.2 识别物体与确定物体的位置
上一章的模型回答的是:“这张图片更接近杯子,还是橡皮?”它给整张输入图片选择类别。这是图像分类的一种用法。
现在把杯子和橡皮同时放在桌面上。我们可能要问:“图片里有哪些物品?每件物品在哪里?”这时,只给整张图选择一个类别就不够了。
目标检测(object detection)同时处理物体类别与图像中的位置。常见的输出方式是在物体周围画一个矩形,标出类别和预测分数。这个矩形称为检测框。[3]
例如,一张图里有两只杯子,检测工具可能分别给出两个框,并各自标注“杯子”。这些框表示模型给出的候选位置;是否框到了物体、有没有遗漏,仍然可以与图片对照检查。
位置也需要用数字表示。可以把图像左上角作为起点,向右记录横向位置,向下记录纵向位置。在一张640×480像素的图像中,假设某个框的左上角为(80,60),右下角为(240,300),就能算出:
框的宽度=240-80=160像素
框的高度=300-60=240像素
这些数说明框在图片中的位置和大小。它们还不能直接告诉我们杯子的实际高度,也不能直接换算成杯子离摄像头多少厘米。那需要额外的测量条件或信息。
训练检测模型时,通常需要在学习材料中标明物体的类别和位置;不同方法对标注的要求有所不同。上一章只提供“杯子”“橡皮”类别的两类分类器,不会因为我们输入“请把杯子框出来”,就自动获得目标检测功能。选择工具时,需要看它实际支持的输入和输出。[3]
具有看图能力的对话工具,可能同时提供描述、问答或定位等功能,但也应通过实际结果了解它能做到哪一步。“能说出图中有杯子”与“能稳定地给出每只杯子的准确位置”,仍然是不同的要求。[9]
做一次比较:照片变成灰度图以后
现在继续使用第3章的分类器。这次不增加识别功能,只研究同一张照片换一种表示以后,分类结果是否变化。
先从上一章的测试照片中选一张杯子照片和一张橡皮照片。保留原图,用图像编辑工具分别制作灰度副本。保持画面范围和像素尺寸不变,不另外裁剪、锐化或使用轮廓滤镜。
灰度副本将彩色信息转换为明暗信息,保留了许多形状与明暗关系。有些颜色原来不同,转换后的灰度却可能很接近,因此这一步也会改变模型能够利用的线索。
把两张原图和各自的灰度图依次交给同一个分类器。只使用预览或预测功能,比较期间不重新训练。记录它实际选出的类别;若页面提供预测分数,也可以一起记下。
| 照片中的物品 | 原图的分类结果 | 灰度图的分类结果 | 你注意到的一项变化 |
|---|---|---|---|
| 杯子 | __________ | __________ | __________ |
| 橡皮 | __________ | __________ | __________ |
如果结果改变,先比较图片中哪些线索发生了变化。可以提出“彩色转为灰度影响了这次判断”的解释,但不能据此断定模型只看颜色。转换还会改变局部对比关系,样本也只有两对。
如果结果没有改变,说明模型在这两对图片中保持了相同的分类。它可能利用了转换后仍然存在的信息,也可能受到其他线索影响。这个结果同样值得记录,不需要再故意把图片处理得无法辨认。
选出其中一对图片,用自己的话说明:输入改动了什么,模型实际回答了什么,你还不能确定什么。需要继续研究时,再增加几对不同角度的照片,按同样方法比较。
这一小实验不重新评价模型的整体准确率。它帮助我们理解:拍到的是同一件物品,计算机接收的信息仍然可以不同。
4.2 声音怎样被记录和识别
4.2.1 从声音变化到数字记录
轻敲一下桌面,你会听到一个短促的声音。发声物体的振动引起周围空气压力的变化,这种变化传播到麦克风。麦克风把接收到的变化转换成电信号,录音设备再把电信号记录为数字。[4]
这些数字按时间先后排列。可以把它想成连续拍摄一连串“快照”:每隔很短的时间,记录一次信号当时的数值。这种按一定时间间隔取值的过程,称为采样。[4]
每秒记录多少次,就是采样率。例如,一段单声道录音采用16 000次/秒的采样率,常记作16 kHz,那么3秒钟会记录16 000×3=48 000个采样值。单声道表示这里只有一路声音数据。[4]
这里的48 000个数描述声音信号随时间的变化,不表示录到了48 000次敲击。采样率也不是声音的高低:前者表示设备记录得有多密,后者与声音本身的振动频率等性质有关。
为保存这些采样值,设备还需要用有限的数值精度表示信号大小。这个过程称为量化。采样决定在什么时候取值,量化决定这些数值能够分得多细。[4]
把采样值按时间画出来,就得到波形图。横向表示时间,纵向表示信号相对于参考零点的变化。出现负数不代表录音错误,它只是信号变化的一种表示。
下面的数值用于理解一小段波形。相邻位置之间的时间间隔相同,具体单位在这里不作要求。
| 采样位置 | 1 | 2 | 3 | 4 | 5 | 6 | 7 |
|---|---|---|---|---|---|---|---|
| 信号数值 | 0 | 2 | 6 | 1 | -4 | -1 | 0 |
在纸上依次标出这七个点,就能看见它先偏向零点上方,再偏向下方。真实录音在很短的时间里就包含大量采样值,显示整段录音时,屏幕往往把这些细小变化概括成便于观察的轮廓。
还可以做一个短观察。打开录音工具,录下约5秒声音:先停一会儿,再用手指轻敲桌面两次,最后再停一会儿。回放录音,留意两次敲击出现的先后。若工具显示波形,可以对应查看敲击附近的变化。
不要急着给波形命名。波形中两处较明显的变化,可以帮助寻找两段声音出现的时间;只看这两个起伏,还不能确定发声动作一定是敲桌面。键盘按键、碰到物品等声音也可能产生短时变化。
在相同设备和录音设置下,波形的起伏有时能帮助比较信号强弱。但录音工具可能自动放大或减弱录入的信号,也可能改变显示比例,因此,两张截图中哪个波形更高,并不能直接证明现场哪个声音更响。
声音数据保存得更密,也不等于能够弥补所有问题。一段录音如果已经漏掉开头的字,或把人声与背景声混在一起,仅把文件转换成更高采样率,并不会重新记录当时缺少的信息。
从波形到声谱图
波形呈现的是信号随时间的变化。一段声音往往包含多种频率成分,频率描述振动重复的快慢。要区分一声轻敲、一阵摩擦或一句话,程序还可以分析这些成分的强弱及其变化。[5]
一种常见方法是把录音分成许多较短的片段,逐段计算频率成分,再按时间排在一起,形成声谱图(spectrogram)。横向表示时间,纵向表示频率,颜色或明暗表示相应成分的强弱。它是由声音数据计算出来的图,不是摄像头拍摄的图像。[5]
在常见的声谱图中,短促敲击可能呈现为某些时刻跨越多个频率的变化,持续的音调可能形成较长的带状区域。具体形状还取决于声音、录音条件和计算方式,不能只凭一条线就认定声音来源。
模型可以处理这样的数值分布,也可以采用直接处理波形等其他方法。我们先理解它们的共同点:声音被记录为数字,模型再从这些数字中寻找与任务有关的信息。[5]
4.2.2 识别声音与识别说话内容
把刚才的敲击录音交给AI,可以提出不同的问题。
“这是什么声音?”要求判断声音类别。例如,模型在预先设定的类别中给出敲击、说话、音乐等结果,这属于声音分类。它接收音频数据,输出一个或多个类别及相应分数。[6]
“这一段说了什么?”则要求把语音转换成文字,这称为自动语音识别(automatic speech recognition,ASR),也常称为语音转文字。[7]
两项任务处理的都可以是录音,预期结果却不同。看到“说话”这个类别,只知道模型认为存在语音,还不知道具体说了哪句话。得到一段转写文字,也不意味着录音中的敲击、音乐等声音都被记录下来。
可以用下面的例子比较:
| 提供的录音 | 希望判断的问题 | 相应的结果形式 |
|---|---|---|
| 两次轻敲桌面的声音 | 更接近哪一类声音? | 敲击等类别及其分数 |
| 一句“杯子放在左边” | 具体说了什么? | 对应的文字 |
| 说话时伴有敲击声 | 说了什么,同时有什么声音? | 转写内容和声音事件,可能需要分别处理 |
这些是任务与结果形式的示例,实际输出以所用工具为准。一个只支持语音转写的工具,未必会告诉你刚才敲了几次桌面。一个声音分类器,也只能在它支持的任务范围内给出结果。
声音分类同样依靠训练中形成的计算关系。训练材料中有哪些声音、类别怎样定义,会影响它能够区分什么。如果工具没有学过某类声音,输出列表里又没有“其他”,它仍可能从已有类别中给出分数较高的一项。[6]
先观察声音分类的输入与输出,就能理解它与图像分类的相通之处。后面制作感知作品时,我们可以根据真正需要识别的声音,选择已有模型或准备新的训练材料。
试着听清一句话
可以用语音转文字工具说一句:“杯子放在左边,橡皮放在右边。”读一读得到的文字,再对照自己的原话。重点看物品名称、左右关系和有没有漏词,不必先纠结标点。
有些工具在转写时会自动加标点,还会进一步把口语改得通顺、整理出要点。后两种处理已经改变了内容的呈现方式。核对具体说了什么时,先查看尽量接近原话的转写,再与录音比较。
继续尝试时,只改变一个条件。例如,保持同一句话、同一工具和近似说话方式,稍微远离麦克风再说一次。实际结果可能不变,也可能出现漏字或替换。先听录音中是否仍然清楚,再研究转写结果。
语音识别需要处理发音、说话速度和环境等变化,也可能利用词语之间的关联选择文字。遇到较少见的名称,即使输出读起来很顺,也值得回放核对。录音质量与语言设置等因素,也会影响结果。[7]
还有一个更容易忽略的区别:如果原话只是一个练习句子,那么准确转写出“杯子放在左边”,只能说明文字与声音相符,并不能证明桌面上的杯子真的在左边。
理解这一点,才能继续讨论图像与声音怎样一起使用。设备可以忠实记录一句话,现场事实却仍需要相应的观察。
4.3 多种信息怎样共同发挥作用
4.3.1 图像、声音和文字的相互补充
回到本章开头。照片里有杯子,录音里有一声轻响。把它们放在一起,是否就能确定“杯子刚才碰到了桌面”?
还不能只凭这两份材料确定。照片可能拍在声音出现以前,声音也可能来自画面外的一次敲击。我们需要知道它们是否记录了同一时段,并寻找声音与动作之间更直接的联系。
若再提供一段视频,画面中可以看到杯底与桌面接触,而接触附近的时刻出现轻响,这些信息就能彼此支持。新的材料帮助缩小了可能的解释范围,同时仍要留意声音是否也可能来自别处。
图像、声音、文字等不同形式的信息,称为不同的模态。结合两种或更多形式的信息来处理任务,称为多模态(multimodal)处理。它既关心各份材料包含什么,也关心材料之间怎样对应。[8]
可以用一个更简单的指物问题理解这种配合。桌面照片中有杯子和橡皮,你问:“右边那件东西是什么?”文字说明要关注哪个位置,图像提供物品的外观和摆放。少了文字,系统不知道你要问哪一件;少了图像,系统也不知道现场摆着什么。遇到不容易叫出名称的物品,拍张照片,再用文字指出关注的部位,就可能比只凭名称提问更清楚。
如果你用声音说出同一个问题,可以先把语音转成文字,再将文字与图片一起交给支持看图的模型。也有模型可以直接接收图片和音频,分别处理后利用它们之间的关联。具体能接收哪些材料,取决于所用模型和工具。[8][9]
因此,一个能录音的聊天界面,未必把完整声音交给了后面的模型。它也可能先转换成文字。这样能够传递说话内容,但敲击声、音量变化或停顿等信息,可能没有完整地进入后续处理。
从计算的角度看,多种材料都要先变成模型能够处理的数字。图像提供按空间排列的信息,声音提供按时间排列的变化,文字提供符号之间的关系。模型利用训练中学到的联系,结合当前问题处理这些材料。[8]
一个杯子的图像分数与一个敲击的声音分数,分别对应不同任务。把两个数直接相加,不能自动说明发生了“杯子碰到桌面”。要回答这个问题,还需要处理时间、动作和声音之间的关系。
用一张图和一句话试一试
把杯子和橡皮放在一起,拍一张两件物品都完整可见的照片。向具有图片理解能力的AI对话工具提供这张图,再提问:“按这张照片中的左右位置,杯子在哪边?橡皮在哪边?”[9]
先自己看清照片中的位置,再核对回答。这里以最终提交的图片为准,摄像头预览有时会镜像显示,不能把预览中的左右与上传图片中的左右混用。
接着保持图片不变,改问:“这张照片能告诉我,刚才有没有人敲桌面吗?”比较两次回答分别需要哪些信息。无需期待工具一定出错,重要的是你能够指出答案的依据或缺少的材料。
再换一个问题:“能从这张照片确定杯子里有没有水吗?”如果杯口和内部看得清,图片可能提供直接线索;如果内部被遮挡,就需要调整角度或补充材料。关键要看这张具体照片,而不是只记住“AI能不能看见水”这样的笼统结论。
通过这个小比较,可以看到文字怎样确定任务,图像怎样提供线索。也能看到,同一份输入并不能回答所有问题。
4.3.2 环境变化与信息缺失
我们在现场往往知道很多没有拍进照片、也没有录进声音的事情。你记得杯子属于谁,知道刚才是谁挪动了它,也许还知道这只杯子最近用来装画笔。模型拿到的材料里,未必有这些信息。
现场环境发生变化时,记录下来的内容也会变化。镜头移远以后,物品占用的像素可能变少;杯把被挡住以后,形状线索就减少了;一声短促敲击被更响的背景声盖住,也可能难以从录音中分辨。
这时,可以依次看三件事:材料有没有采到,采到以后是否清楚,模型给出的解释是否有依据。这三个问题对应不同的处理办法。
例如,相机根本没有拍到杯子,应该调整拍摄范围;杯子拍到了却很模糊,可以重新对焦或保持设备稳定;照片已经清楚,模型仍经常判断错误,再进一步检查模型适用的类别、训练材料和实际使用条件。
声音也一样。录音按钮没有启动,与已经录下安静的一段时间,是两种情况。已经录到声音但工具未识别出来,又是第三种情况。把它们分清,才知道下一步该检查录音、重新采集,还是研究识别方法。
没有识别出来,不能直接写成现场没有发生。工具没有给出“杯子”,可能与遮挡、类别范围或判断有关;工具没有转写出文字,也可能是没有录好或没有识别成功。说“在这份材料中尚未确认”,会比直接下结论更准确。[3][7]
多增加一种材料,有时能够补充缺少的信息。例如,单张照片没有记录动作过程,视频可以增加时间上的变化;单看画面难以察觉一次短促声响,录音可以提供补充。不过,新增材料也要相关、清楚,并与原来的材料对应。
如果照片显示杯子在右边,文字说明却写着“杯子在左边”,先比较材料的时间和观察角度。两份材料可能来自不同摆放时刻,也可能采用了不同的左右方向。必要时重新拍照或询问,不能仅因为某种信息是文字、图像或AI输出,就自动把它当作最后答案。
改进输入也有取舍。提高图像分辨率可能保留更多细节,同时增加数据量和处理负担;增加录音时长可能记录到前后过程,也可能加入许多与问题无关的声音。我们要补充的是回答当前问题所需要的信息。
为自己的材料补上一项有用信息
从本章的照片比较或短录音中,选一项自己还不能确定的事情。先说明缺少什么,再决定补一张照片、换一个角度、重新录一小段,还是增加一句经过核对的背景说明。一次先补一项,再观察它是否真的帮助回答了原来的问题。
如果材料已经足够,且结果与实际情况相符,也可以到这里结束。解释为什么这些材料能够支持结论,同样是一种学习。
这样的选择会影响我们怎样创造工具。有人在嘈杂环境中不容易听到提示,屏幕上的文字可以提供另一种方式;有人不方便一直看屏幕,简短声音又能带来帮助。第10章将继续研究,怎样把感知结果变成合适的回应。
现在可以先留下一个自己的问题:你希望帮助谁注意到什么?现有的照片、声音或文字能提供多少信息,还需要怎样改变?
本章回望
本章从一张杯子的照片和一声轻响出发,研究图像与声音怎样进入计算机。像素记录图像中各个位置的颜色或明暗,采样值记录声音信号随时间的变化。模型接收这些数字,利用训练中形成的计算关系完成任务。
同一种材料可以对应不同问题。图像分类判断类别,目标检测还需要给出物体位置;声音分类判断声音类型,语音识别把说话内容转换为文字。看清预期输出,才知道应该怎样选择和检查工具。
图像、声音和文字能够相互补充,也都只记录了现场的一部分。多种材料能否带来帮助,要看它们是否与问题有关、是否清楚、是否彼此对应。
本章的比较实验把上一章的认识推进了一步:同一件物品可以形成不同输入,同一份输入也只能支持一定范围的判断。我们在现场知道的事情,需要通过合适的材料表达出来,才可能成为AI处理的依据。
下一章将转向另一个方向:当AI生成一段文字、一幅图像或一段声音时,这些新内容又是怎样形成的?
练习与继续探索
1. 用数字解释照片。一张图片宽320像素、高240像素,共有多少个像素?把它在屏幕上放大两倍,会自动得到原先没有记录到的杯身小字吗?说明你的理由。
2. 为问题选择输出。“这张图片更接近杯子还是橡皮”“杯子在图片的什么位置”“这段录音是哪一类声音”“说话的人具体说了什么”,分别需要什么形式的输出?为什么上一章的两类图片分类器不能直接回答这四个问题?
3. 区分声音与采样。一段2秒的单声道录音采用16 000次/秒的采样率,一共有多少个采样值?它与两次敲击有什么区别?能否仅凭采样值数量判断声音来源?
4. 研究两个材料的关系。一张照片显示杯子放在桌上,另一段录音中有一声轻响。有人据此写道:“杯子刚刚被放到桌上。”这个解释还需要哪些信息支持?你准备怎样补充一项有用的材料?
5. 为一个人改变信息的呈现。从自己熟悉的学习或生活场景中,找一件容易被错过的信息。谁可能需要它?你准备增加文字、声音还是画面?先说明选择的理由,不必立即开发程序。
本章资料来源
[1] OpenCV. Basic Operations on Images;MDN Web Docs. Digital video concepts. 用于核对像素、行列、颜色分量与常见RGB表示。访问日期:2026-09-20。https://docs.opencv.org/4.x/d3/df2/tutorial_py_basic_ops.html ;https://developer.mozilla.org/en-US/docs/Web/Media/Guides/Formats/Video_concepts
[2] OpenCV. Image Gradients;TensorFlow. Convolutional Neural Network (CNN). 用于核对局部明暗差异、边缘线索及图像网络的局部计算。访问日期:2026-09-20。https://docs.opencv.org/4.x/d5/d0f/tutorial_py_gradients.html ;https://www.tensorflow.org/tutorials/images/cnn
[3] Google AI Edge. Object detection task guide. 用于核对检测类别、预测分数、边界框坐标、输入处理与模型类别范围。访问日期:2026-09-20。https://developers.google.com/edge/mediapipe/solutions/vision/object_detector
[4] MDN Web Docs. Digital audio concepts;Adobe. Digitizing audio. 用于核对声音数字化、采样、采样率、数值精度、声道与波形表示。访问日期:2026-09-20。https://developer.mozilla.org/en-US/docs/Web/Media/Guides/Formats/Audio_concepts ;https://helpx.adobe.com/audition/desktop/digital-audio-fundamentals/digitizing-audio.html
[5] TensorFlow. Simple audio recognition: Recognizing keywords. 用于核对波形、声谱图与音频模型输入的基本关系。访问日期:2026-09-20。https://www.tensorflow.org/tutorials/audio/simple_audio
[6] Google AI Edge. Audio classification guide. 用于核对声音类别、训练确定的分类范围、音频输入与分类输出。访问日期:2026-09-20。https://developers.google.com/edge/mediapipe/solutions/audio/audio_classifier
[7] Google Cloud. Cloud Speech-to-Text overview;Improve transcription results with model adaptation. 用于核对语音转写、结果形式、词语线索,以及录音质量和语言等设置对识别的影响。访问日期:2026-09-20。https://docs.cloud.google.com/speech-to-text/docs/overview ;https://docs.cloud.google.com/speech-to-text/docs/v1/adaptation
[8] BALTRUŠAITIS T, AHUJA C, MORENCY L P. Multimodal Machine Learning: A Survey and Taxonomy. arXiv:1705.09406. 用于核对模态、表示、信息融合与材料对应关系。访问日期:2026-09-20。https://arxiv.org/abs/1705.09406
[9] Google AI for Developers. Image understanding. 用于核对图像与文字联合输入、看图问答和定位等能力的区分,以及图像清晰度的影响。访问日期:2026-09-20。https://ai.google.dev/gemini-api/docs/image-understanding