[论文解读] Do not let the history haunt you -- Mitigating Compounding Errors in Conversational Question Answering
本文针对对话式问答(CoQA)中因模型在推理时依赖自身预测答案而产生的暴露偏差所导致的误差累积问题。提出一种调度采样策略,在训练过程中动态混合真实答案与模型预测答案,显著提升在真实测试场景下的性能表现,尤其在缺乏真实历史答案的场景下,长对话及复杂问题类型上的F1得分最高提升5.5%。
The Conversational Question Answering (CoQA) task involves answering a sequence of inter-related conversational questions about a contextual paragraph. Although existing approaches employ human-written ground-truth answers for answering conversational questions at test time, in a realistic scenario, the CoQA model will not have any access to ground-truth answers for the previous questions, compelling the model to rely upon its own previously predicted answers for answering the subsequent questions. In this paper, we find that compounding errors occur when using previously predicted answers at test time, significantly lowering the performance of CoQA systems. To solve this problem, we propose a sampling strategy that dynamically selects between target answers and model predictions during training, thereby closely simulating the situation at test time. Further, we analyse the severity of this phenomena as a function of the question type, conversation length and domain type.
研究动机与目标
- 研究当CoQA系统在推理阶段使用模型生成的答案而非真实答案时,暴露偏差对模型性能的影响。
- 解决因早期问题的错误预测导致后续问题性能下降的误差累积问题。
- 提出一种训练策略,通过在训练中混合真实答案与预测答案,模拟真实推理条件。
- 评估所提方法在不同问题类型、对话长度及问题长度下的有效性。
- 倡导修订评估协议,确保测试阶段不提供真实答案。
提出的方法
- 提出一种调度采样(SS)的变体,基于递减调度,在训练过程中动态选择使用真实答案或模型自身预测答案。
- 在训练中混合使用目标答案与模型预测结果,逐步从完全真实监督过渡到完全依赖模型预测。
- 引入一种采样策略,从先前训练周期的预测结果和当前模型输出中选择,以减少暴露偏差。
- 采用类似课程学习的训练调度,随时间推移逐步提高使用模型预测的概率。
- 结合监督学习与调度采样训练模型,以提升在真实推理条件下的泛化能力。
- 在仅使用模型预测答案作为后续问题上下文的现实测试条件下评估性能。
实验结果
研究问题
- RQ1当CoQA模型在推理阶段使用模型生成答案而非真实答案时,暴露偏差如何影响其性能?
- RQ2调度采样是否能缓解CoQA系统中长对话下的误差累积问题?
- RQ3在真实推理条件下,CoQA模型在不同问题类型(如是/否、未知、跨度)下的表现如何变化?
- RQ4对话长度与问题长度对CoQA中误差累积严重程度有何影响?
- RQ5在测试阶段真实答案不可用时,基于采样的训练策略是否能提升模型的鲁棒性?
主要发现
- 在推理阶段使用模型预测答案而非真实答案,导致性能显著下降,长对话中整体F1从62.08降至55.28。
- SS[BM, USR]在长对话中的整体F1比CoQAM_SM高出5.5%(60.02 vs. 55.28),尤其在“否”类问题上表现更优(59.89 vs. 51.37)。
- 对于长度≥10个词的问题,SS[BM, USR]取得62.22的F1,优于CoQAM_SM的60.24,表明其在复杂查询上的有效性。
- 在短对话(<12轮)中,SS[BM, USR]在“是”类问题上F1提升2.76分(73.33 vs. 70.55),在“否”类问题上提升5.41分(52.70 vs. 47.29)。
- CoQAM_MP模型在所有问题类型上的表现均持续低于CoQAM_SM,证实标准训练中存在暴露偏差。
- 结果表明,当前CoQA评估协议允许使用真实答案历史,掩盖了模型的真实鲁棒性,应予以修订。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。