[论文解读] Short Answer Grading Using One-shot Prompting and Text Similarity Scoring Model
该论文提出了一种低资源自动短答案评分(ASAG)模型,采用GPT-3.5的一次提示(one-shot prompting)与微调后的Sentence-BERT(SBERT)模型,预测子问题的分析性评分和理由关键词。该方法仅使用每道题16个手动评分的答案,在公开的ASAG数据集上实现了67%的准确率和0.71的二次加权kappa值,显著优于多数类基准模型,并展现出高达90.3%的理由关键词检测准确率。
In this study, we developed an automated short answer grading (ASAG) model that provided both analytic scores and final holistic scores. Short answer items typically consist of multiple sub-questions, and providing an analytic score and the text span relevant to each sub-question can increase the interpretability of the automated scores. Furthermore, they can be used to generate actionable feedback for students. Despite these advantages, most studies have focused on predicting only holistic scores due to the difficulty in constructing dataset with manual annotations. To address this difficulty, we used large language model (LLM)-based one-shot prompting and a text similarity scoring model with domain adaptation using small manually annotated dataset. The accuracy and quadratic weighted kappa of our model were 0.67 and 0.71 on a subset of the publicly available ASAG dataset. The model achieved a substantial improvement over the majority baseline.
研究动机与目标
- 解决在缺乏大规模标注数据集情况下的低资源自动短答案评分(ASAG)挑战。
- 通过预测子问题的分析性评分和理由关键词,提升自动评分的可解释性。
- 通过识别与每个评分标准相对应的相关文本片段,实现可操作的反馈生成。
- 通过利用大型语言模型(LLMs)的少样本学习和领域自适应的文本相似度评分,降低标注成本。
- 评估基于LLM的一次提示在低数据环境下ASAG的可行性,特别是针对子问题级别的评分。
提出的方法
- 通过GPT-3.5的一次提示生成参考答案,基于评分标准实现无需完整微调的少样本推理。
- 应用在小规模人工标注数据集上微调过的Sentence-BERT(SBERT)模型,对学生的答案与参考答案进行语义相似度评分。
- 使用小规模标注数据集对SBERT模型进行领域自适应,以提升其在目标ASAG任务上的性能。
- 采用基于规则的方法,通过SBERT嵌入识别学生答案中与参考答案最相似的文本片段,提取理由关键词。
- 基于SBERT的相似度评分,采用阈值法或回归法分配分析性评分。
- 通过LLM对参考答案进行增强,扩充参考答案集,提升在低资源环境下的鲁棒性。
实验结果
研究问题
- RQ1LLM的一次提示能否在极少人工输入下有效生成短答案评分的参考答案?
- RQ2SBERT的领域自适应在低资源ASAG场景中如何提升性能?
- RQ3参考答案增强对理由关键词检测和最终评分准确率有何影响?
- RQ4与人工标注相比,系统在检测理由关键词方面的准确率如何?
- RQ5在低数据设置下,联合预测分析性评分和理由关键词是否能提升整体ASAG性能?
主要发现
- 一次提示+SBERT模型在ASAG数据集上实现了67%的准确率和0.71的二次加权kappa值,相比多数类基准模型相对误差降低了27%。
- 理由关键词检测准确率达到90.3%,在216次案例中有195次系统生成的关键词与人工标注重叠至少90%。
- 消融研究显示,领域自适应对性能提升贡献最大,而当已应用领域自适应时,参考答案增强的影响微乎其微。
- 该模型优于基线SBERT模型(准确率:0.44)和参考答案增强模型(准确率:0.52),凸显了领域自适应的重要性。
- 该模型仅需每道题16个手动评分答案即可实现显著性能提升——不足基准模型训练数据量的5%。
- 尽管性能表现强劲,该模型与人类水平性能相比仍存在显著差距,表明在实际部署中仍有较大改进空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。