附录B 术语表
- 人工智能(AI):使机器完成通常需要感知、学习、推断、生成或决策支持等能力的一类方法与系统。
- 人工智能系统:由数据、模型、普通程序、规则、软件或设备以及人共同组成的完整运行系统。
- 模型:由结构和参数构成、把输入映射为输出的可运行对象。
- 参数:模型在训练中调整并保存、影响输入如何变成输出的数值。
- 训练:利用样本和目标调整模型参数的过程。
- 监督学习:利用带有标签或目标值的样本学习输入到输出关系的方法。
- 验证集:训练过程中用于比较设置和观察过拟合、但不直接更新参数的数据。
- 测试集:模型和设置确定后,用于评价未见数据表现的封存数据。
- 推理:使用训练完成的模型处理新输入并产生输出的过程。
- 泛化:模型对未见但与任务相关的输入仍能有效工作的能力。
- 数据集:为训练、验证或测试按一定规则组织的样本集合。
- 标签:监督学习中与样本对应的目标类别或数值。
- 特征/表征:用于描述输入、便于模型处理的属性或数值形式。
- 嵌入向量:把文字、图像或声音表示为可比较的数值向量。
- 分类:从预先定义的类别中为输入给出一个或多个候选类别。
- 回归:根据输入预测连续数值的任务。
- 损失函数:把模型输出与目标之间的差异表示为训练所需数值的函数。
- 置信度:模型对某个输出给出的相对分数;它不自动等于真实正确概率。
- 阈值:把连续分数转换为接受、拒绝、提醒或未知等行为的分界值。
- 误报:实际不是目标事件却被系统报出。
- 漏报:实际是目标事件却没有被系统报出。
- 精确率:被系统报为目标的样例中,真正为目标的比例。
- 召回率:所有真实目标样例中,被系统找到的比例。
- 混淆矩阵:按真实类别和预测类别统计分类结果的表。
- 过拟合:模型在训练样本上表现很好,却不能适应新样本的现象。
- 迁移学习:复用预训练模型已经学到的表示,再适应新任务的方法。
- 卷积:用可学习的小窗口在图像或其他网格数据上提取局部模式的运算。
- 特征图:卷积层对输入中某类局部模式响应形成的二维或三维数值结果。
- 光学字符识别(OCR):把图像中的文字转换为可处理文本的一类视觉任务;本书不将其设为独立技术主线。
- 语音识别(ASR):把声音中的口语内容转换为文字的技术。
- 波形:声音振幅随时间变化的表示。
- 频谱图:显示声音不同频率能量随时间变化的表示。
- 时间序列:按时间顺序记录的一组观测数据。
- 采样频率:单位时间内采集观测值的次数。
- 移动平均:在滑动时间窗口内求平均、用于观察局部趋势的方法。
- 异常检测:找出与正常模式明显不同的样本或时间片段。
- 数据漂移:实际输入的数据分布随时间、环境或设备变化的现象。
- 生成式模型:根据所学数据模式产生文字、图像、声音等新内容的模型。
- 自回归生成:按照已有部分逐步预测并生成下一个元素的方法。
- 潜空间:模型用较少维度表示数据主要变化因素的内部空间。
- 扩散模型:学习逐步去除噪声、从随机噪声形成数据样本的一类生成模型。
- 条件生成:在类别、文字、图像或其他条件约束下产生内容。
- 大语言模型(LLM):在大量语言或多模态数据上训练、能够理解和生成语言内容的大规模模型。
- 词元:语言模型处理文字时使用的基本编号单位,可能是字、词的一部分或符号。
- 上下文:模型在当前交互中能够看到并用于生成的信息。
- 结构化输出:按约定字段和数据类型组织、便于程序读取和校验的输出。
- JSON:用键、值、数组和对象表达结构化数据的文本格式。
- Schema:对数据字段、类型、必填项和允许范围作出的结构约定。
- 检索:从限定资料或索引中找出与问题相关的内容。
- 余弦相似度:依据两个向量夹角比较方向是否相近的指标。
- 最近邻:在表示空间中寻找与查询向量距离最近的一个或多个样本。
- 检索增强生成(RAG):先检索外部资料,再让生成模型依据命中资料回答的方法。
- 来源锚点:能够回到原始材料的页码、片段编号、文件或链接。
- 无依据生成:模型输出了提供材料中找不到支持的事实或结论。
- 应用程序接口(API):软件之间交换数据或请求功能的明确接口;API本身不是AI。
- 工具调用:模型或程序按结构化参数请求外部软件执行查询、计算或写入等动作。
- 推荐系统:依据用户、物品和交互证据,从候选集合中召回并排序内容的系统。
- 候选召回:从大量物品中快速找出可能相关的一小批候选。
- 排序:根据相关性、偏好和约束为候选计算次序。
- 冷启动:新用户或新物品缺少交互记录、难以形成可靠推荐的情况。
- 反馈偏差:系统的曝光影响用户行为,新的行为数据又反过来强化原有推荐的现象。
- 强化学习:智能体通过与环境交互,根据奖励信号改进策略的学习方法。
- 状态:智能体作出动作时能够观察到的环境信息。
- 动作:智能体在环境中可选择执行的操作。
- 奖励:环境对动作结果给出的数值反馈,不自动等同于完整目标。
- 策略:智能体根据状态选择动作的方法。
- 探索与利用:尝试未知动作以获取信息,与使用当前已知较好动作之间的取舍。
- 回合:从一个初始状态开始到终止条件结束的一段完整交互。
- 多模态模型:能够联合处理文字、图像、声音等两种或更多数据形态的模型。
- 物理AI:通过传感器感知环境、在计算设备上推理并可能影响物理世界的人工智能系统形态。
- 云端运行:把数据发送到远程计算服务处理。
- 本地运行:在个人电脑或校内受控设备上处理数据。
- 设备端/边缘推理:在手机、单板计算机或传感节点等靠近数据源的设备上运行模型。
- 基线:用于判断新方法是否真正改善任务的简单现有方案。
- 控制变量实验:只改变一个因素、保持其他条件不变并比较结果的实验。
- 回归测试:修改后重新运行原测试集,检查已有能力是否被破坏。
- 数据卡:记录数据来源、构成、收集、授权、用途和限制的说明。
- 模型卡:记录模型用途、训练信息、评价、限制和风险的说明。
- 系统卡:记录完整系统中的模块、数据流、权限、评价、停止和维护的说明。
- 人工接管:达到特定条件时由明确的人停止自动流程并负责后续处理。
- 停止条件:出现风险、缺失、冲突、无权限或低可信结果时不再继续的规则。