[论文解读] A Feasibility Study of Answer-Agnostic Question Generation for Education
本研究探讨了教育文本中的答案无关型问题生成(QG),发现当直接使用原始教科书段落作为输入时,模型生成的问题往往不相关或难以理解。通过将原文替换为人工撰写或自动生成的摘要,问题的可接受度从33%提升至83%,相关性从61%提升至95%,可解释性从56%提升至94%,表明摘要化能显著提升教育场景下QG的质量。
We conduct a feasibility study into the applicability of answer-agnostic question generation models to textbook passages. We show that a significant portion of errors in such systems arise from asking irrelevant or uninterpretable questions and that such errors can be ameliorated by providing summarized input. We find that giving these models human-written summaries instead of the original text results in a significant increase in acceptability of generated questions (33% $ ightarrow$ 83%) as determined by expert annotators. We also find that, in the absence of human-written summaries, automatic summarization can serve as a good middle ground.
研究动机与目标
- 使用教科书段落评估答案无关型问题生成模型在教育场景中的可行性。
- 识别答案无关型QG模型在应用于教育文本时的主要失效模式。
- 评估对输入段落进行摘要是否能提升生成问题的质量。
- 比较人工撰写摘要与自动生成摘要在提升QG输出效果方面的有效性。
- 测量在使用摘要输入时,问题可接受度、相关性和可解释性的提升程度。
提出的方法
- 在SQuAD数据上微调答案无关型QG模型,以从教科书段落生成问题。
- 通过人工标注者在五分制量表上对生成问题的可接受度、相关性和可解释性进行评分,以评估模型输出。
- 使用教科书章节的人工摘要作为QG模型的输入,并与原始段落的结果进行对比。
- 使用抽取式与抽象式结合的模型生成自动生成摘要,并将其作为QG模型的输入。
- 应用n-gram重叠度量指标(BLEU、ROUGE)评估生成问题的流畅性及与参考问题的相似度。
- 通过消融实验比较三种输入类型(原始文本、人工摘要、自动生成摘要)下的性能表现。
实验结果
研究问题
- RQ1当将答案无关型QG模型应用于教科书段落时,其主要失效模式是什么?
- RQ2输入摘要化如何影响生成问题的可接受度、相关性和可解释性?
- RQ3自动生成的摘要能否作为提升QG质量的人工摘要的可行替代方案?
- RQ4在原始文本、人工摘要和自动生成摘要输入下,问题质量度量指标(可接受度、相关性、可解释性)如何变化?
- RQ5人工标注者在判断生成问题与教科书章节整体主题的相关性方面,一致性如何?
主要发现
- 答案无关型QG模型的主要失效模式是:在输入为原始教科书段落时,生成的问题往往不相关或难以理解。
- 使用人工撰写的摘要作为输入,使问题可接受度从33%提升至83%,相关性从61%提升至95%,可解释性从56%提升至94%。
- 自动生成摘要显著提升了QG质量,当人工摘要不可用时,可作为强有力的替代方案。
- 人工撰写的摘要在可接受度、相关性和可解释性三个评估维度上均带来了最大提升。
- 模型性能对输入质量高度敏感,原始段落输入产生的输出质量最低。
- 标注者在相关性判断上表现出高度一致性,表明相关性是问题质量的一个可靠且可度量的维度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。