[论文解读] Automated Scoring for Reading Comprehension via In-context BERT Tuning
本文提出了一种基于上下文的 BERT 微调方法,用于自动评分阅读理解回答,采用共享模型并通过结构化输入提示整合与题目相关的上下文。该方法通过利用跨题目的共享段落和问题上下文,在 NAEP 挑战中实现了最先进性能,优于基于语言模型和非语言模型的基线模型,同时表现出适度的群体人口统计偏差。
Automated scoring of open-ended student responses has the potential to significantly reduce human grader effort. Recent advances in automated scoring often leverage textual representations based on pre-trained language models such as BERT and GPT as input to scoring models. Most existing approaches train a separate model for each item/question, which is suitable for scenarios such as essay scoring where items can be quite different from one another. However, these approaches have two limitations: 1) they fail to leverage item linkage for scenarios such as reading comprehension where multiple items may share a reading passage; 2) they are not scalable since storing one model per item becomes difficult when models have a large number of parameters. In this paper, we report our (grand prize-winning) solution to the National Assessment of Education Progress (NAEP) automated scoring challenge for reading comprehension. Our approach, in-context BERT fine-tuning, produces a single shared scoring model for all items with a carefully-designed input structure to provide contextual information on each item. We demonstrate the effectiveness of our approach via local evaluations using the training dataset provided by the challenge. We also discuss the biases, common error types, and limitations of our approach.
研究动机与目标
- 解决现有自动评分模型在为每个题目单独训练模型时存在的可扩展性和上下文利用不足的问题。
- 开发一种统一的、可扩展的阅读理解评分模型,通过在多个题目间共享段落和问题上下文来提升性能。
- 通过设计富含上下文的输入格式,实现 BERT 的上下文微调,从而在无需为每个题目单独训练模型的前提下提升评分准确性。
- 在真实教育评估环境中,评估模型的性能、错误模式以及在不同人口统计群体中的公平性。
提出的方法
- 通过构建包含段落、问题以及示例回答及其得分的提示,对预训练 BERT 模型进行上下文微调。
- 使用结构化输入格式,将每个目标回答的上下文信息嵌入其中,对一个共享 BERT 模型在所有题目上同时进行微调。
- 输入格式包括问题、若干上下文示例(附带真实得分)以及学生的回答,所有内容拼接成一个单一序列输入 BERT。
- 模型基于此富含上下文的输入,预测学生回答的人工评分,从而实现对新题目的零样本泛化能力。
- 可选地,将人口统计信息(如性别、种族)作为前缀提示输入,以研究公平性,例如“评分由一名亚裔女性学生撰写的答案”。
- 应用事后拼写检查步骤以提升准确性,并利用注意力图分析模型的可解释性。
实验结果
研究问题
- RQ1一个共享的 BERT 模型是否能在无需为每个题目单独微调的前提下,在多个阅读理解题目上实现高评分准确性?
- RQ2使用结构化提示的上下文微调在共享参数的同时,是否能有效捕捉题目特异性上下文?
- RQ3该模型常见的错误类型有哪些,它们与语法、主观性或回指等语言特征有何关联?
- RQ4该模型在不同学生人口统计群体中表现出多大程度的偏差?在输入中包含人口统计信息是否会影响公平性?
- RQ5该模型是否能在未访问完整段落的情况下泛化到新题目,这对其实体理解能力有何影响?
主要发现
- 所提出的基于上下文的 BERT 微调方法在 NAEP 训练数据集上优于现有的基于语言模型和非语言模型的自动评分基线模型。
- 该模型在无需为每个题目单独训练模型的前提下实现了高准确率,显著提升了可扩展性并降低了存储需求。
- 常见错误类型包括拼写/语法错误、主观性解读、罕见正确答案以及模仿错误回答,尤其在学生回答模仿低分示例时更为明显。
- 该模型表现出适度的偏差,对大多数群体高估了评分,但四年级的夏威夷原住民/美洲原住民群体例外,这可能是由于训练数据量过少所致。
- 在输入提示中加入人口统计信息会轻微改变偏差模式,但模型在各群体中仍不可避免地表现出微小偏差。
- 通过拼写检查进行预处理可提升评分准确性,且对 BERT 进行微调显著优于仅将其作为固定文本编码器使用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。