[论文解读] Confidence-Aware Learning Assistant
本文提出了一种基于眼动追踪的自信度感知学习助手(CoALA),用于在多选题作答过程中估计自我自信度,并通过反馈优先处理低自信正确答案或高自信错误答案。在三项研究中评估,CoALA使未自信的正确答案正确率提高了14%,高自信的错误答案正确率提高了17%,自我自信度估计在检测自信和不自信方面分别达到81%和79%的平均精确率。
Not only correctness but also self-confidence play an important role in improving the quality of knowledge. Undesirable situations such as confident incorrect and unconfident correct knowledge prevent learners from revising their knowledge because it is not always easy for them to perceive the situations. To solve this problem, we propose a system that estimates self-confidence while solving multiple-choice questions by eye tracking and gives feedback about which question should be reviewed carefully. We report the results of three studies measuring its effectiveness. (1) On a well-controlled dataset with 10 participants, our approach detected confidence and unconfidence with 81% and 79% average precision. (2) With the help of 20 participants, we observed that correct answer rates of questions were increased by 14% and 17% by giving feedback about correct answers without confidence and incorrect answers with confidence, respectively. (3) We conducted a large-scale data recording in a private school (72 high school students solved 14,302 questions) to investigate effective features and the number of required training samples.
研究动机与目标
- 解决多选题学习中未被检测到的低自信正确答案和高自信错误答案的挑战。
- 开发一种适用于真实教育场景的、与用户无关的眼动追踪自信度估计系统。
- 通过端到端用户研究,评估自信度感知反馈在提升知识质量方面的有效性。
- 研究训练数据规模和特征选择对真实环境下自信度估计性能的影响。
提出的方法
- 收集参与者在解答多选题时的眼动追踪数据,提取注视持续时间、扫视次数以及基于相对位置的AOI(兴趣区)特征等眼动特征。
- 使用机器学习分类器基于眼动特征和阅读时间特征训练自信度估计模型,重点关注不同学习者之间的用户独立性。
- 根据自信度估计结果生成反馈,标记那些正确但缺乏自信或错误但过于自信的问题以供复习。
- 系统在三个阶段进行评估:受控实验室研究(n=10)、带反馈的用户研究(n=20),以及在一所高中进行的大规模真实环境部署(n=72名学生,14,302道题目)。
- 采用基于置换的分析方法研究特征重要性,结果表明,尽管某些特征(如注视次数)的关联性不直观,但其组合后对模型有显著贡献。
- 系统性地改变训练样本数量,以评估其对模型性能的影响,发现超过200个样本后收益递减。
实验结果
研究问题
- RQ1基于眼动特征和阅读时间能否在与用户无关的前提下可靠估计多选题作答过程中的自我自信度?
- RQ2基于估计的自信度提供反馈是否能提升学习成果的正确性与自信质量?
- RQ3自信度估计性能在受控环境与真实环境(真实世界)中表现如何?
- RQ4在真实教育环境中,实现有效自信度估计所需的最优训练样本数量是多少?
- RQ5哪些眼动特征对自信度最具预测力,它们在多变量模型中如何相互作用?
主要发现
- 在受控实验室研究中,自信度估计在检测自信和不自信方面分别达到81%和79%的平均精确率。
- 在用户研究中,基于自信度估计的反馈使未自信正确答案的正确率提高了14%,高自信错误答案的正确率提高了17%,相较于对照组。
- 系统在真实课堂环境中表现出稳健性能(真实世界研究),共处理了学生标注的14,302道题目,证明其在非受控环境中的可行性。
- 性能增益在约200个训练样本后趋于平稳,进一步增加样本可减少方差,但对平均精确率的提升不显著。
- 尽管单独来看,注视次数和扫视频率等特征预测能力较弱,但其在模型中组合后贡献显著,凸显特征交互的重要性。
- 系统的反馈机制有效缓解了知识衰退,尤其对低自信作答,相比无反馈条件,遗忘率降低了16%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。