[论文解读] An Iterative Transfer Learning Based Ensemble Technique for Automatic Short Answer Grading
本文提出了一种基于迭代迁移学习的集成模型,用于自动短答案评分(ASAG),该模型结合了基于TF-IDF的文本分类器和基于相似性度量(如F1、余弦相似度、Lesk)的数值相似性分类器,以建模答案。通过利用典型相关分析(CCA)进行迁移学习,该方法在SemEval-2013 SciEdu数据集上实现了最先进性能,且无需目标问题的标注数据,优于所有获奖的监督学习方法。
Automatic short answer grading (ASAG) techniques are designed to automatically assess short answers to questions in natural language, having a length of a few words to a few sentences. Supervised ASAG techniques have been demonstrated to be effective but suffer from a couple of key practical limitations. They are greatly reliant on instructor provided model answers and need labeled training data in the form of graded student answers for every assessment task. To overcome these, in this paper, we introduce an ASAG technique with two novel features. We propose an iterative technique on an ensemble of (a) a text classifier of student answers and (b) a classifier using numeric features derived from various similarity measures with respect to model answers. Second, we employ canonical correlation analysis based transfer learning on a common feature representation to build the classifier ensemble for questions having no labelled data. The proposed technique handsomely beats all winning supervised entries on the SCIENTSBANK dataset from the Student Response Analysis task of SemEval 2013. Additionally, we demonstrate generalizability and benefits of the proposed technique through evaluation on multiple ASAG datasets from different subject topics and standards.
研究动机与目标
- 解决监督式ASAG方法在实际应用中的局限性,即需要为每个评估任务提供标注的训练数据和模型答案。
- 开发一种鲁棒且数据高效的ASAG技术,使其能够泛化于不同主题领域和评分标准。
- 即使在缺乏目标问题标注的学生回答时,也能实现有效的自动短答案评分。
- 探索迁移学习在监督式ASAG中的可行性与有效性,以减少对大量标注数据的依赖。
提出的方法
- 结合两种互补的分类器:基于TF-IDF的文本分类器(在学生答案上进行训练)和基于相似性度量(如F1、余弦相似度、Lesk)的数值分类器,用于比较学生答案与模型答案之间的相似性。
- 采用典型相关分析(CCA)学习源问题与目标问题之间的共享低维特征空间,从而实现迁移学习。
- 通过迭代优化过程,基于两类分类器之间的一致性重新加权预测结果,以更新集成分类器。
- 通过利用数据集中其他20个问题的知识初始化目标问题的分类器,实现迁移学习,即使目标问题无标注数据也可行。
- 采用加权集成策略,通过学习到的权重将两类分类器的预测结果进行融合,以提升模型鲁棒性。
- 采用留一法交叉验证验证性能,并在多个数据集和不同评分粒度下评估泛化能力。
实验结果
研究问题
- RQ1基于文本与数值相似性分类器的集成能否在自动短答案评分中超越单模型方法?
- RQ2基于典型相关分析的迁移学习在无标注数据条件下,对新问题实现零样本或少样本ASAG的有效性如何?
- RQ3迭代优化过程是否能提升模型在不同类型问题和不同学科领域中的收敛性与预测准确性?
- RQ4评分粒度(如2分类与11分类)如何影响所提出的基于迁移学习的ASAG框架性能?
主要发现
- 所提出方法在SemEval-2013 SciEdu数据集上优于所有获奖的监督学习方法,实现了自动短答案评分的最佳性能。
- 在CSD数据集上,该方法使用逻辑回归作为基础分类器时,平均绝对误差(MAE)达到1.07,显著优于LDA(MAE=1.63)和AdaBoost(MAE=1.58)。
- 大多数问题的迭代算法在5至6次迭代内收敛,表明学习动态稳定且高效。
- 性能随评分粒度变粗而提升:从11类(0.5步)到2类(正确/错误)标注,MAE下降,表明在数据稀疏条件下具有更好的泛化能力。
- 该框架在不同主题领域和评分标准间具有良好的泛化能力,通过在基准之外的多个ASAG数据集上的评估得到验证。
- 即使在极少量标注数据下,该方法仍保持高效,通过CCA驱动的特征对齐展现出强大的迁移学习能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。