附录A 项目证据包与评价量规
一、章级学习记录与综合项目证据包
第1—11章以理解技术为主,不要求每章建立复杂工程目录。学生可以用一份章级学习记录保存最少而充分的证据:
chXX-learning-record/
├─ task.md # 技术问题、输入、输出和边界
├─ input/ # 样例、数据或材料说明
├─ experiment.ipynb # 需要代码时提供完整Notebook
├─ result.md # 首轮结果与控制变量比较
├─ test.md # 正常、边界、陌生和故障样例
└─ decision.md # 采用、限用、改进、不用或转交
第1章可以用一张学习记录表代替文件目录。第2—11章根据技术需要提交Notebook;不要求为了形式额外制作网页、数据库、版本差异文件或长篇对话记录。
学习记录还应注明本章在家庭项目线中的角色:主项目、跨章阶段、受控案例或迁移任务。阳台植物园、家庭空气与用能观察站等跨章项目沿用同一个项目编号;本章只新增当前技术所需的材料,并在result.md中列出交给下一阶段的数据、模型、固定测试、来源记录和未解决问题,避免每章重新做一个互不相干的演示。
第12章综合项目连接多个模型、工具或设备,再使用完整证据包。提交前删除个人信息、访问密钥和未经授权的图片、声音或文档。
chXX-project/
├─ README.md # 项目目标、使用者、边界、运行和停止方式
├─ task-context.md # 交给开发与学习AI的任务、材料和验收条件
├─ input/ # 模拟、脱敏或经授权的原始材料
├─ src/ 或 notebook.ipynb # 完整代码、配置和运行入口
├─ tests/cases.json # 正常、边界、陌生、故障样例及预期行为
├─ output/first/ # 首轮中间结果和最终结果
├─ output/final/ # 修改后结果
├─ evidence/dialogue.md # 关键AI对话与学生核对
├─ evidence/error.log # 一次真实错误或失败输出
├─ evidence/change.diff # 如修改程序,保留一次限定修改差异
├─ evidence/regression.md # 修改前后固定样例回归
├─ system-card.md # 数据、模型、规则、工具、设备和人的说明
└─ decision-card.md # 采用、限制、改进、不用或转交
README.md至少写清:项目解决什么问题;如何从头运行;需要哪些输入和环境;哪里使用了应用中的AI;开发与学习AI帮助了什么;谁负责确认;哪些情况必须停止。
tests/cases.json中的每条样例至少包含编号、类型、输入或文件路径、测试目的、预期行为、实际行为和是否通过。失败样例不能只测程序报错,还要测试资料缺失、陌生输入、低置信度、权限拒绝和模型不可用。
decision-card.md用一页回答:证据支持在哪些条件下使用;最不能接受的错误;人工确认点;云端、本地端、设备端或不用AI的选择;隐私、费用和维护负担;停止与转交条件;下一次改进还缺什么证据。
其中数据来源、构成、授权和限制可参考“数据说明表”的思想,模型用途、评价条件和不适用场景可参考“模型卡”的思想[9-10]。本书把两者缩减成适合课堂项目的证据字段,不要求机械照抄研究模板。
二、学习与项目评价量规
每项0—2分,总分20分。0分表示缺失或存在关键错误,1分表示部分完成且仍需指导,2分表示证据完整、解释准确。普通章节可以用学习记录和现场说明提供证据;第12章使用完整证据包。建议16分以上达到要求;“技术准确性、实现或实验完整性、测试证据、安全与维护”任一项为0,应修改后再评。
| 评价项 | 2分证据 |
|---|---|
| 1. 问题与AI必要性 | 使用者、真实问题、验收和不用AI基线明确,能说明为何选择或不选择AI |
| 2. 材料与授权 | 来源、时间、字段、脱敏和授权记录完整 |
| 3. 技术准确性 | 数据、表征、模型、规则、软件、设备和人的分工准确 |
| 4. 实验或实现完整性 | 有可重复的操作或完整Notebook、运行条件和中间结果;第1章可无代码 |
| 5. AI协同过程 | 能说明开发与学习AI给了什么候选,学生核对、运行和决定了什么 |
| 6. 控制变量 | 一次只改变一个有意义变量,先预测、再运行、后解释 |
| 7. 失败与测试 | 正常、边界、陌生、故障样例及预期行为齐全 |
| 8. 比较与复验 | 使用同一批样例比较修改或变量变化前后,并说明副作用 |
| 9. 安全与维护 | 隐私、权限、错误后果、停止、回退、版本和维护明确 |
| 10. 判断与迁移 | 采用结论有证据,能说明限制、替代方案和迁移条件 |
项目展示不单独以界面美观计分。现场答辩至少运行一个失败样例,指出系统图中的模型、规则和人工确认点,并说明一项没有采纳的AI建议及理由。