Skip to main content
QUICK REVIEW

[论文解读] Probabilistic Models for Computerized Adaptive Testing: Experiments

Martin Plajner, Jiří Vomlel|arXiv (Cornell University)|Jan 28, 2016
Intelligent Tutoring Systems and Adaptive Learning参考文献 3被引用 3
一句话总结

本文使用来自281名小学生的实证数据,评估了概率模型——项目反应理论(IRT)、贝叶斯网络(BNs)和神经网络(NNs)——在计算机化适应性测试(CAT)中的表现。通过10折交叉验证模拟比较模型性能,结果表明新型贝叶斯网络模型在预测响应方面比IRT和神经网络方法具有更高的成功率,能更准确地估计学生能力。

ABSTRACT

This paper follows previous research we have already performed in the area of Bayesian networks models for CAT. We present models using Item Response Theory (IRT - standard CAT method), Bayesian networks, and neural networks. We conducted simulated CAT tests on empirical data. Results of these tests are presented for each model separately and compared.

研究动机与目标

  • 评估并比较三种概率模型——IRT、贝叶斯网络和神经网络——在计算机化适应性测试(CAT)中的表现。
  • 通过引入具有增强表示能力的新专家结构贝叶斯网络,改进以往的贝叶斯网络模型。
  • 通过在真实学生测试数据上模拟CAT程序,并使用标准化评估指标,评估模型的有效性。
  • 探究非IRT模型是否能够达到甚至超越既定的IRT标准在自适应测试中的表现。

提出的方法

  • 执行10折交叉验证:每折使用90%的数据训练模型,10%的数据用于测试。
  • 模拟CAT程序,根据信息增益贪婪选择题目,每次回答后更新模型。
  • 使用技能变量的边缘概率分布,通过MAP估计预测每个问题的最可能答案:$ x_i^* = \arg\max_{x_i} P(X_i = x_i | \boldsymbol{S}) $。
  • 使用成功率指标评估模型:$ \mathrm{SR}_s^t = \frac{1}{|\mathcal{X}|} \sum_{X_i \in \mathcal{X}} I(x_i^* = x_i') $,衡量所有问题上的预测准确性。
  • 对于神经网络,训练一个具有单隐藏层的前馈网络,直接预测学生分数,使用反向传播算法,并调整隐藏层神经元数量(3、5、7个)。
  • 基于最大化预测分数的方差选择题目:$ X^* = \arg\max_i \mathrm{Var}(SC | X_{i,x}) $,以最大化信息增益。

实验结果

研究问题

  • RQ1贝叶斯网络模型在CAT中的响应预测准确性方面与标准IRT模型相比如何?
  • RQ2当在真实学生响应数据上进行训练时,神经网络模型能否有效支持自适应测试?
  • RQ3所提出的具有7+1个隐藏变量的新型贝叶斯网络模型是否优于以往的BN模型和IRT基线?
  • RQ4题目选择策略对自适应测试中模型预测收敛性和准确性的有何影响?
  • RQ5非IRT概率模型是否能够实现与IRT相当或更优的性能,以最少的响应估计学生能力?

主要发现

  • 具有7+1个隐藏变量的新型贝叶斯网络模型在所有测试模型中实现了最高的响应预测成功率。
  • IRT模型表现良好,但被新型BN模型超越,尤其是在测试初期阶段。
  • 神经网络模型在响应预测准确性方面的提升最慢,成功率随时间逐步提高。
  • 在无任何题目作答前的基线预测成功率 $ \mathrm{SR}_0 $,神经网络模型最低,表明其初始估计能力较弱。
  • 新型BN模型展现出显著的性能优势,表明在BN中融入结构化的专家知识可提升自适应测试中估计的准确性。
  • 研究表明,通过局部结构建模(如确定性条件概率表)可进一步提升BN模型性能,减少参数数量的同时增强表达能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。