AI语言处理模块关键词与语义检索对照|全程离线
班级AI应用系统 v0.4

第4章 · 自然语言处理

换一种说法,两条检索路线会怎样?

左侧根据共同词语检索,右侧把查询和资料转换为教学用概念向量。用同义改写、否定、多义和资料外问题比较结果,并保留两种方法共同失败的证据。

12资料条目
16开发测试
—关键词首条命中
—语义首条命中
未运行最终测试

输入同一个问题

页面只返回资料候选,不生成新的事实。试一试“开放时间”“放学以后还能来吗”“我不是来借设备的,只问地点”和“今天食堂有什么菜”。

右侧是简化语义表示演示,不是在线大模型,也不把相似度当作正确概率。

关键词路线

根据分词后的共同词语计分。

字面匹配

输入问题后运行。

语义路线

根据七维教学概念向量的余弦相似度排序。

简化语义表示

输入问题后运行。

12条可核对资料

资料均为课堂虚构数据。检索结果必须返回编号和原文。

当前查询怎样表示

关键词路线显示分词结果;语义路线显示六个概念维度:时间、位置、借用、打印、报修、账号与其他服务。

先运行一次检索。

语义向量

计算边界

  • 向量词表由教材编写者设置,不是从海量语料训练得到。
  • 相似度只用于排序,不是理解程度和正确概率。
  • 资料中没有答案时,系统不能靠相似度创造事实。

16题开发测试

同义、否定、多义和资料外问题各4题。它可以指导第二版修订,因此不作为最终独立测试。

尚未运行。

8题最终测试

在修订设置确定后运行。结果不理想也要保留,不能反复调整到满分后再称为未知测试。

尚未运行。

自然语言处理技术路线

规则与词典人编写词典、语法和处理规则;过程可检查,开放表达难以穷举。
统计方法从平行语料等语言材料估计词语和短语对应关系;依赖数据范围与质量。
分布式表示把词语表示成向量,使相似上下文中的词能够参与距离和关系计算。
神经序列模型从输入序列学习内部表示,再逐步产生输出序列。
Transformer以注意力机制为核心处理上下文,成为许多语言模型的重要基础。

模块说明卡

保存实验记录

导出内容包含查询、两条路线结果、测试统计和说明卡,不包含账号或个人信息。

资源版本:secondary-v3.0 / ch04-lab-0.1 不联网、不上传文本、不生成资料外事实。