[论文解读] Modeling of Item-Difficulty for Ontology-based MCQs
本文提出了一种基于本体的模型,用于自动预测从领域本体自动生成的多项选择题(MCQ)的难度。通过整合实体流行度、答案空间大小和谓词深度等因素,该模型估算题干和选项集的难度得分,并将两者合并为综合难度得分;使用项目反应理论进行实证验证,结果显示预测难度与实际难度水平在不同学习者熟练度群体中具有高度相关性(r ≈ 0.92)。
Multiple choice questions (MCQs) that can be generated from a domain ontology can significantly reduce human effort & time required for authoring & administering assessments in an e-Learning environment. Even though here are various methods for generating MCQs from ontologies, methods for determining the difficulty-levels of such MCQs are less explored. In this paper, we study various aspects and factors that are involved in determining the difficulty-score of an MCQ, and propose an ontology-based model for the prediction. This model characterizes the difficulty values associated with the stem and choice set of the MCQs, and describes a measure which combines both the scores. Further more, the notion of assigning difficultly-scores based on the skill level of the test taker is utilized for predicating difficulty-score of a stem. We studied the effectiveness of the predicted difficulty-scores with the help of a psychometric model from the Item Response Theory, by involving real-students and domain experts. Our results show that, the predicated difficulty-levels of the MCQs are having high correlation with their actual difficulty-levels.
研究动机与目标
- 为解决当前缺乏自动估算本体生成MCQ难度的方法这一问题,以提升其在电子学习系统中的教学实用性。
- 开发一种基于本体结构与语义特征的预测模型,以量化题目难度。
- 将学习者熟练度水平纳入难度估算,实现自适应评估。
- 利用心理测量模型将预测难度得分与实际表现进行对比验证。
- 提供一种可靠、自动化的从正式本体生成教学有效MCQ的方法。
提出的方法
- 该模型基于本体中实体的流行度以及问题题干中使用的谓词的层次深度,计算题干难度得分。
- 基于答案空间的大小(某一类别中的实例数量)计算选项集难度得分。
- 通过加权聚合函数将题干得分与选项集得分合并,得到综合难度得分。
- 通过根据初学者、中级者和专家的预期表现调整难度估计,将学习者熟练度水平纳入模型。
- 利用项目反应理论(IRT)评估预测得分的有效性,具体通过分析三个学习者熟练度群体中正确作答的概率。
- 实证验证包括向真实学生和专家发放生成的MCQ,并将预测难度与观察到的作答概率进行相关性分析。
实验结果
研究问题
- RQ1如何利用本体的结构与语义特征来预测本体生成MCQ的难度?
- RQ2所提出的模型与通过真实学习者表现测量的实际难度之间的相关性在多大程度上成立?
- RQ3学习者熟练度如何影响对题目难度的感知,且这种影响能否被有效建模?
- RQ4该模型能否以足够高的准确度区分高、中、低难度题目?
- RQ5哪些因素——如答案空间大小或实体流行度——对基于本体的MCQ题目难度影响最大?
主要发现
- 预测难度得分与基于项目反应理论分析得出的实际难度水平之间表现出高度相关性(r ≈ 0.92),涵盖24道MCQ。
- 当低熟练度学习者正确作答率较低时(例如,P < 0.1),模型能准确预测高难度题目。
- 答案空间极大的题目被预测为简单,这与实证结果一致,即专家群体的正确作答率较高。
- 当高熟练度学习者正确作答率超过90%时,模型能正确识别中等和低难度题目。
- 该模型在不同学习者群体中表现稳健,αi值保持一致,表明难度估计稳定。
- 研究揭示了当前评分函数的局限性,特别是在答案空间极小或极大时,提示需进一步优化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。