文本生成模块逐token概率实验|全程离线班级AI应用系统 v0.6
第6章 · 大语言模型

下一个token怎样变成一整段文字?

用24条可见语料建立1-gram、2-gram和3-gram模型。改变上下文、温度与随机种子,逐步查看候选概率;再把生成句子放回材料中核查。

24语料句
—当前token
—回退次数
12开发挑战
未运行最终核查

设置同一次可复现生成

自然输入会按当前24条语料的词表做最长匹配;页面显示的token切分不代表其他模型。

完整输出

尚未生成。

token序列

固定参数和种子后,另一组应能复现同一结果。

低温/高温对照

点击“低温/高温对照”。

每一步候选与选择

步有效上下文候选及概率选中是否回退
生成后显示。

24条课堂语料

所有句子都有编号和章次,可检查、可替换。模型只从这些token序列统计。

当前模型结构

编号语料
token切分
n-gram计数
温度调整
按种子抽样
加入上下文

本页是可解释的频率模型,不含神经网络、注意力和预训练参数。它只能帮助观察生成机制的一部分。

12项开发挑战

覆盖同义前文、阶数、温度、种子、长生成和材料外问题。允许根据结果改任务说明,不改语料事实。

尚未运行。

观察重点

  • 3-gram断链后回退到几阶?
  • 高温是否让低频候选更常出现?
  • 相同参数和种子能否复现?
  • 语料外问题会不会仍然继续生成?

本区不以“越流畅越高分”评价。能暴露断链、主题漂移和材料外生成,才有修订价值。

开发挑战明细

编号变量前文输出摘要回退观察
运行后生成。

选择允许依据的材料

核查一个生成句子

自动初筛只比较词语、数字和否定关系,最终状态必须查看原文后确认。

8项最终核查任务

设置锁定后一次运行,包含直接支持、同义改写、错误数字、否定冲突和材料外事实。

尚未运行。

编号句子期望状态初筛状态依据
运行后生成。

技术路线

n-gram
按短序列频率估计后续,透明但易遇到未见组合。
神经语言模型
学习词的分布式表示和序列概率,改善相似组合泛化。
Transformer与预训练
用注意力处理上下文,在大规模数据上学习参数,再适配任务。
指令对齐
用示范、偏好等训练模型更好地遵循任务,仍需事实核查。

模块说明卡

保存实验记录

导出内容包含语料版本、生成参数、逐步概率、挑战结果和核查记录,不包含账号或外部对话。

资源版本:secondary-v3.0 / ch06-lab-0.1 不联网、不调用外部模型、不把生成文本标为事实。

SELFTEST 等待运行