AI 把一道题解释得很清楚,学生回复“懂了”。这段对话看起来已经顺利结束。
但如果把题目稍微换一下,学生仍然不会做,刚才究竟完成了什么?
对 AI 学习产品来说,回答是否正确、解释是否清楚当然重要。不过,它们首先描述的是系统的表现。要判断学生有没有学会,还需要观察学生怎样使用这些解释,以及帮助减少后能不能继续完成任务。
这里有一个值得认真区分的问题:我们希望产品交付一个答案,还是帮助一个人逐渐具备得到答案的能力?
对话很活跃,思考未必向前
Chi 与 Wylie 在 2014 年提出的 ICAP 框架,将认知参与区分为被动接收、主动操作、建构和交互四种模式。其中,“建构”要求学习者产生超出已有材料的内容;“交互”也涉及双方相互推进理解,不能仅凭轮流说话判断。框架同时提醒,外显行为只是认知活动的代理指标。ICAP 原文
用这个框架审视 AI 辅导,可以提出一个设计问题:学生在对话中究竟做了什么?
点击“继续”、复制一个步骤、用自己的话解释为什么这样算,在界面上都可能表现为一次输入,但它们提供的观察信息不同。因此,我们不宜仅按消息数量、停留时间或一句“明白了”判断理解程度。这是从研究出发提出的产品判断,而不是对某个聊天产品学习效果的直接证明。
一个更可操作的做法,是给学生留下能表达自己理解的位置:先写出下一步,说明选择理由,或者指出哪一处仍然不明白。系统随后才有机会围绕这次尝试提供帮助。
帮助的分寸,比讲解的长度更重要
这不意味着 AI 应该拒绝直接解释,也不意味着所有学习任务都必须拆成细小追问。
Shute 在《Focus on Formative Feedback》中讨论了正误确认、提示、答案解释和完整示例等多种反馈形式,并指出反馈效果与学习者特点、任务及提供时机有关。本文采用的是 ETS 2007 年研究报告版本。ETS 报告摘要与出版信息
这一视角提醒我们:选择帮助方式,需要先理解当前障碍。学生完全缺少前置知识时,反复追问可能只是让他重复失败;学生已经接近完成时,直接给出全部过程又可能跳过本来可以由他完成的尝试。
对产品设计,我更倾向于把“下一次可以尝试什么”作为选择反馈的依据。能够继续,就让学生试;仍然卡住,就调整解释、换一个表示方式,必要时给出示例。具体采用哪一种,仍需要结合任务和实际使用验证。
这样的目标比“回答越短越好”或“永远不要给答案”更难实现,却也更接近需要解决的问题。
一次小尝试,暴露了怎样的设计问题
在 TeachFlow 的一个文本分数练习中,学生要计算 1/2 + 1/3。选定共同分母后,系统请他改写第一个分数。此时学生问“为什么”,回答应该围绕当前这一步,而不是重新播放整道题的解法。

本地隔离验收中的实际界面,模型响应受控。它展示了围绕当前步骤继续的交互,不能证明学习效果。
这次实现让学生实际写出的数值决定是否继续,而“懂了”不会自动完成步骤。它解决的是一个有限的问题:系统至少知道自己正在等待哪次尝试,并能围绕这次尝试反馈。
但正确填出一个分数也可能来自模仿。这套机制还不能据此判断学生是否理解了通分,更不能因为发生了多轮问答,就宣布达到了 ICAP 中的某种高层次参与。
从这个例子可以提炼的设计原则是:先让学习过程产生可观察的尝试,再讨论这些尝试能支持什么判断。
同样答对,支持的结论可能不同
帮助之后答对,是值得记录的进展。不过,它和没有帮助时答对并不提供完全相同的信息。
为了讨论这种差别,可以把产品里常见的三个信号并列来看。这是本文的分析方式,不是标准化测评量表。
| 观察到的信号 | 可以据此继续做什么 | 仍然不能直接判断什么 |
|---|---|---|
| 学生说“懂了” | 邀请解释或进行下一次尝试 | 已经能够应用 |
| 提示后完成当前题 | 回看提示作用,安排后续练习 | 已经可以独立完成 |
| 在不同条件下独立完成 | 增加对应用能力的观察 | 已经形成长期、稳定的掌握 |
TeachFlow 因此保留了作答时是否获得辅助的条件。学生亲自按下提交按钮,与学生独立得出答案,是两件需要分别记录的事。

同次本地验收中的结果界面:答案正确,同时保留辅助记录。此处展示记录方式,不把后续入口等同于已经完成独立验证。
这个区别也会影响产品指标。如果系统只优化当前题的答对率,给出更多答案可能让数字更好看;但产品若以学习为目标,就需要继续观察帮助减少之后的表现。这是一个需要设计评测来检验的风险,不能只从一次演示推断它已经发生。
把“会不会”留给更合适的证据
学习产品需要同时关心体验与结果。学生是否愿意继续、反馈是否容易理解,是使用过程中的重要问题;学生能否解释、应用和在稍后独立完成,则涉及不同的观察条件。
因此,在评价一个 AI 辅导功能时,我会分别问:回答有没有帮助用户继续尝试?尝试中留下了什么信息?这些信息足以支持多大的学习结论?
TeachFlow 的例子目前限于有界文本分数练习和本地流程验证,尚无真实学生的对照研究或延迟后测。ICAP 与反馈研究帮助我们提出更好的问题,并不替项目回答“到底有没有提升学习效果”。
AI 可以把解释组织得越来越流畅。学习产品仍要给学生留下亲自思考、表达与尝试的空间,并耐心等待足够的证据。