如果一个学生第一次独立答对一道题,系统能不能显示“已掌握”?TeachFlow 的早期计算器曾经回答“可以”:单次独立正确会得到 mastery=1 / secure,只是置信度较低。这个结果在数学上没有写错,却在产品语义上过于激进。
问题不在于那道题是否正确,而在于“正确”与“掌握”不是同一个时间尺度。
最小反例:幸运答对
假设一道四选一题,学生没有提示、第一次选对。如果系统只看本次结果,它会给出最高掌握度;但下一次同结构题答错,就暴露出第一次可能来自猜测、熟悉表面形式或偶然计算正确。
类似地,还有三种容易被混淆的证据:
- 在强提示后完成;
- 原题订正后再次答对;
- 同知识点同模板题答对;
- 延迟一周后在迁移题中独立答对。
它们都可能是“正确”,对稳定掌握的支持力度却不同。
TeachFlow 的修正
项目把显示状态与原始数值拆开:单次独立正确仍然保留为真实证据,但 secure 需要至少两条独立、无提示的正确证据达到最低权重;提示依赖、迁移和发生时间继续保留在可解释计算中。这样做没有把一次正确“降为错误”,而是拒绝过早升级状态。
随后建立了 6 条合成纵向序列、24 个时间点,覆盖幸运答对、持续错误、提示依赖、独立迁移、间隔保持等边界,并输出分层正确率、校准差、Brier 分数和 secure precision。这里必须强调:这些是合成回归样本,作用是反驳错误合同和保护算法边界,不是学生群体效果研究。
外部研究告诉了我们什么
知识追踪研究长期把掌握视为随学习机会更新的潜在状态,而不是一道题的标签。2025 年《Journal of Educational Data Mining》发表的随机实验直接比较不同 mastery threshold,发现更高阈值与较低遗忘相关,但这种差异会随时间减弱,而且还受到学习挣扎程度与学科内容影响。
这个研究不能给 TeachFlow 一个可直接复制的阈值。它真正支持的是三点:
- 掌握阈值会改变学习路径,不能当作 UI 配色;
- 结论要观察遗忘和时间,而不仅是当场正确;
- 阈值效果可能因内容和人群不同,需要实证校准。
因此,TeachFlow 的“两条独立正确”只是防止明显误判的本地安全下限,不是经过真实学生验证的最优教学阈值。
评测应同时看区分力与代价
提高阈值会减少假 secure,却可能让已经会的学生重复练习。一个可信评测至少要同时观察:
- 假 secure:被标为 secure 后很快失败;
- 假 unknown / developing:学生已经稳定掌握却被迫继续练习;
- 提示依赖变化;
- 同构题与迁移题差异;
- 延迟后测的遗忘;
- 不同知识类型和题目难度;
- 被纠正或撤销的证据对结果的影响。
只优化准确率也不够,因为状态还会驱动推荐、教师关注和学习时间。
当前可以公开说什么
可以说:TeachFlow 已经用最小反例纠正了“单次答对即 secure”的显示合同,计算器保留输入证据、算法版本和状态依据;仓库内存在纵向合成样本与专项检查。
不能说:该算法已经准确测量真实学生掌握度,阈值优于 BKT、DKT 或其他知识追踪方法,或者已经证明改善学习结果。本文固定快照未附带新的专项执行回执,因此历史运行结果只作为项目记录,当前证据状态仍是 partial。
常见问题与设计边界
为什么不是三次或五次正确?
目前没有真实数据支持最优次数。两次是防止单次偶然性的最低产品防线;真正阈值应通过分层、延迟和迁移数据校准。
为什么不用 BKT 直接替代规则?
模型更复杂不等于证据更强。没有可靠 slip、guess、学习机会和真实评测时,复杂模型可能只会隐藏假设。当前先保留可解释规则和可替换算法版本。
教师看到的是概率还是状态?
教师需要看到可理解状态,同时能下钻到数值、提示依赖、迁移和输入证据;不能让一个颜色标签覆盖不确定性。
参考资料
- Using a Randomized Experiment to Compare Mastery Learning Thresholds, JEDM 2025
- Mastery Learning in Practice: Cognitive Tutor Algebra I
- TeachFlow
data/evaluation/longitudinal-calibration-cases.json、lib/learning-state/state-calculator.mjs、项目亮点与演进.md
结论
一次答对是一条事实,掌握是跨证据、跨时间的判断。可信系统应该完整保留前者,同时对后者保持克制。TeachFlow 这次修正的价值,不是找到了终极掌握算法,而是用一个可以复现的反例阻止系统把偶然成功写成长期能力。