[论文解读] XTQA: Span-Level Explanations of the Textbook Question Answering
本文提出 XTQA,一种用于教科书问答(TQA)中跨度级解释的新型框架,采用从粗到精的解释抽取(EE)算法,从完整课程内容中识别相关句子跨度。通过弱监督方式利用答案标签优化解释抽取,XTQA 在解释质量方面达到 52.38% 的 mIoU,CK12-QA 测试集准确率达到 36.95%,展现出更优的可解释性与 TQA 性能。
Textbook Question Answering (TQA) is a task that one should answer a diagram/non-diagram question given a large multi-modal context consisting of abundant essays and diagrams. We argue that the explainability of this task should place students as a key aspect to be considered. To address this issue, we devise a novel architecture towards span-level eXplanations of the TQA (XTQA) based on our proposed coarse-to-fine grained algorithm, which can provide not only the answers but also the span-level evidences to choose them for students. This algorithm first coarsely chooses top $M$ paragraphs relevant to questions using the TF-IDF method, and then chooses top $K$ evidence spans finely from all candidate spans within these paragraphs by computing the information gain of each span to questions. Experimental results shows that XTQA significantly improves the state-of-the-art performance compared with baselines. The source code is available at https://github.com/keep-smile-001/opentqa
研究动机与目标
- 为解决当前教科书问答(TQA)系统缺乏可解释性的问题,这些系统仅提供答案而无推理依据。
- 开发一种生成跨度级解释的方法——即段落中句子的组合——以阐明为何选择特定答案。
- 通过将解释抽取模块整合到推理流程中,同时提升 TQA 性能与可解释性。
- 使解释模块可即插即用,与现有 TQA 模型集成,从而增强其可解释性与性能。
- 验证弱监督解释抽取的有效性,利用答案标签进行优化,因 CK12-QA 中缺乏标准答案解释标注。
提出的方法
- XTQA 将整个课程的文本内容视为候选证据,将每个段落建模为检索文档。
- 在粗粒度阶段,使用基于嵌入的查询扩展方法,检索与问题最相关的前 M 个段落。
- 在细粒度阶段,计算前 M 个段落中所有候选跨度的信息增益,以识别回答问题最具有信息量的跨度。
- 信息增益衡量一个跨度在多大程度上减少了问题的不确定性,数值越高表示解释相关性越强。
- 解释抽取采用弱监督方式:由于 CK12-QA 中无标准解释标注,因此利用答案标签优化解释质量。
- EE 算法可集成到其他 TQA 模型中,使其具备可解释性并提升性能。
实验结果
研究问题
- RQ1TQA 系统能否生成对人类学习者而言既准确又可解释的跨度级解释?
- RQ2从粗到精的方法在多模态教科书语境中识别相关句子跨度以生成解释方面有多有效?
- RQ3集成解释抽取在多大程度上提升了整体 TQA 性能?
- RQ4解释质量与答案准确率之间存在何种关联,尤其在涉及图表时?
- RQ5在缺乏标准答案标注的情况下,利用答案标签进行弱监督解释抽取能否产生可靠且有用的解释?
主要发现
- XTQA 在 CK12-QA 测试集前 300 个问题上取得最佳解释结果,mIoU 达 52.38%,其中包含 150 个无图问题与 150 个含图问题。
- 该方法将 TQA 性能提升至测试集准确率 36.95%,相比之前 SOTA 方法提高 2.89 个百分点。
- 对于正确回答的问题,解释 mIoU 达 73.65%,表明正确答案与准确解释之间具有强对齐性。
- 对于错误回答的问题,解释 mIoU 为 35.97%,表明除文本跨度外,图表理解等因素在答案准确率中也起着关键作用。
- 粗粒度阶段是主要瓶颈:段落检索错误会导致细粒度跨度抽取失败,凸显改进检索的必要性。
- 仅 4% 的文本问题与 12.5% 的图表问题需要教学图表,而 80% 依赖单个或多个句子,因此聚焦于跨度级文本解释具有充分合理性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。