[论文解读] Question Generation for Reading Comprehension Assessment by Modeling How and What to Ask
本文提出 HTA-WTA,一种两阶段问题生成模型,首先在通用问题生成(如何提问)上进行预训练,然后在目标阅读理解技能(该问什么)上进行微调。该研究引入了一个包含九种基于故事的阅读理解技能(SBRCS)的新数据集,涵盖推断性问题与字面性问题,并证明 HTA-WTA 在仅使用 10% 训练数据的少样本设置下,优于多个强基线模型,能够生成高质量、技能特定的问题,且无需答案监督。
Reading is integral to everyday life, and yet learning to read is a struggle for many young learners. During lessons, teachers can use comprehension questions to increase engagement, test reading skills, and improve retention. Historically such questions were written by skilled teachers, but recently language models have been used to generate comprehension questions. However, many existing Question Generation (QG) systems focus on generating literal questions from the text, and have no way to control the type of the generated question. In this paper, we study QG for reading comprehension where inferential questions are critical and extractive techniques cannot be used. We propose a two-step model (HTA-WTA) that takes advantage of previous datasets, and can generate questions for a specific targeted comprehension skill. We propose a new reading comprehension dataset that contains questions annotated with story-based reading comprehension skills (SBRCS), allowing for a more complete reader assessment. Across several experiments, our results show that HTA-WTA outperforms multiple strong baselines on this new dataset. We show that the HTA-WTA model tests for strong SCRS by asking deep inferential questions.
研究动机与目标
- 为解决阅读理解中缺乏可控的、技能目标明确的问题生成,特别是针对推断性问题的问题。
- 构建一个包含字面性与推断性问题的新型、全面的基于故事的阅读理解技能数据集(SBRCS)。
- 开发一种两阶段问题生成模型(HTA-WTA),以提升泛化能力并提高特定技能问题的质量。
- 在低资源(少样本)设置下评估模型性能,以模拟现实世界中的数据稀缺情况。
- 实现在教育平台中无需答案监督的自动化、高质量问题生成。
提出的方法
- HTA-WTA 模型采用两阶段训练流程:首先在通用问题生成数据集(如何提问)上进行预训练,然后在特定技能数据集(该问什么)上进行微调。
- 模型利用现有问题生成数据集的迁移学习能力,以提升泛化性能并减少数据需求。
- 在输入提示中注入技能名称标记,以控制生成问题所针对的阅读理解技能类型。
- 该方法端到端训练,无需答案监督,仅依赖文本片段和技能标签输入。
- 该方法采用序列到序列的 Transformer 架构,并在新整理的基于故事的文本片段与技能标注问题数据集上进行微调。
- 采用分层抽样策略,通过仅使用每项技能 10% 的数据实例来模拟少样本学习。
实验结果
研究问题
- RQ1两阶段问题生成模型是否能在无答案监督的情况下,有效生成针对特定阅读理解技能的问题?
- RQ2与强基线模型相比,HTA-WTA 在多样化、多技能阅读理解数据集上的表现如何?
- RQ3当仅使用少量数据(如 10%)进行微调时,HTA-WTA 模型的泛化能力在多大程度上得以保持?
- RQ4引入技能名称标记是否提升了模型生成与特定理解技能相匹配问题的能力?
- RQ5所提出的模型是否能够生成高质量的推断性问题,这类问题比字面性问题更具挑战性?
主要发现
- HTA-WTA 在新构建的 SBRCS 数据集上优于多个强基线模型,证明其在生成技能目标明确问题方面具有卓越性能。
- 在仅使用 10% 训练数据的少样本设置下,模型 BLEURT 得分为 33.21,超过大多数基线模型,甚至优于在完整数据集上训练的模型。
- 在低资源技能(如预测与隐喻语言)上,模型达到完美的 F1 分数(1.0),表明其在具有挑战性的推断性问题类型上具备强大的泛化能力。
- 使用技能名称标记显著提升了对低资源技能的性能,表明其有效实现了问题类型的去歧义与控制。
- 随着训练数据增加,性能逐步提升,尽管在 10% 到 30% 数据量之间出现轻微下降,这与先前关于数据稀疏性影响的研究发现一致。
- 模型成功生成了高质量的推断性问题,且无需答案监督,验证了其在真实教育应用中的实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。