[论文解读] Finding Generalizable Evidence by Learning to Convince Q&A Models
本文提出一种方法,其中证据智能体学习选择最能说服预训练问答(QA)模型特定答案的段落句子,从而生成可泛化、高质量的证据。该方法通过仅使用原始段落约20%的文本,提升了人类与模型的性能,展示了在不同模型和任务间强大的泛化能力。
We propose a system that finds the strongest supporting evidence for a given answer to a question, using passage-based question-answering (QA) as a testbed. We train evidence agents to select the passage sentences that most convince a pretrained QA model of a given answer, if the QA model received those sentences instead of the full passage. Rather than finding evidence that convinces one model alone, we find that agents select evidence that generalizes; agent-chosen evidence increases the plausibility of the supported answer, as judged by other QA models and humans. Given its general nature, this approach improves QA in a robust manner: using agent-selected evidence (i) humans can correctly answer questions with only ~20% of the full passage and (ii) QA models can generalize to longer passages and harder questions.
研究动机与目标
- 开发一种自动识别给定答案在基于段落的问答中最具说服力、可泛化的证据的方法。
- 探究为说服某一QA模型而选择的证据是否能泛化到其他模型和人类判断。
- 通过使用智能体选择的证据而非完整段落,提升问答效率与泛化能力。
- 评估证据智能体在辅助人类问答及提升模型泛化能力方面的有效性。
提出的方法
- 证据智能体被训练以选择使裁判QA模型对特定答案的预测概率最大化的段落句子。
- 每个智能体在序列决策框架下运行,贪心地添加最能提升裁判模型对其指定答案信心的句子。
- 智能体可在自由竞争或循环赛制下协作,共同选择证据,同时基于其他智能体的选择进行条件化,形成集体证据池。
- 该方法结合启发式检索(如TF-IDF、fastText)与学习的神经搜索(如BERT-base、BERT-large)来识别证据。
- 智能体被训练以预测答案概率或添加证据后概率的变化,从而实现端到端优化。
- 通过仅提供智能体选择的证据而非完整段落,衡量人类与模型的性能,以评估泛化能力。
实验结果
研究问题
- RQ1为说服某一QA模型而选择的证据是否能泛化到其他模型和人类评估者?
- RQ2当仅使用证据智能体选择的段落句子子集时,人类问答准确率能在多大程度上保持?
- RQ3使用智能体选择的证据是否能提升QA模型对更长段落和更难、分布外问题的泛化能力?
- RQ4不同证据选择策略(如BERT与TF-IDF)在支持正确答案与抑制错误答案方面表现如何比较?
主要发现
- 人类仅使用证据智能体选择的约20%段落句子,即可正确回答73.2%的RACE问题和83.8%的DREAM问题,保持了完整段落下90%的人类准确率。
- 与使用完整段落相比,使用智能体选择的证据训练的QA模型在更长段落上的泛化更准确。
- 仅使用最具说服力的证据时,基于中学阅读理解训练的QA模型在高中考试问题上的泛化能力更强。
- BERT-base搜索智能体在支持正确答案方面优于BERT-large(82.5% vs. 79.4%),且支持错误答案的可能性更低(34.6% vs. 38.7%)。
- 与基线方法相比,证据智能体选择的证据提升了人类QA准确率:BERT-base智能体在DREAM上达到83.8%的准确率,优于fastText(79.1%)和TF-IDF(69.2%)。
- 智能体选择的证据在多个QA模型和人类评估者中均提升了所支持答案的可信度,表明其泛化能力超越了原始裁判模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。