[论文解读] Domain Adaptation for Question Answering via Question Classification
该论文提出 QC4QA,一种用于问答任务的新型自监督域自适应框架,通过利用问题分类来减少域间差异和类内差异。通过在源域和目标域数据上联合训练,使用伪标签化的目标问题,并利用最大均值差异(MMD)最小化域偏移,QC4QA 在无需目标域标注数据的情况下,在多个数据集上实现了最先进性能。
Question answering (QA) has demonstrated impressive progress in answering questions from customized domains. Nevertheless, domain adaptation remains one of the most elusive challenges for QA systems, especially when QA systems are trained in a source domain but deployed in a different target domain. In this work, we investigate the potential benefits of question classification for QA domain adaptation. We propose a novel framework: Question Classification for Question Answering (QC4QA). Specifically, a question classifier is adopted to assign question classes to both the source and target data. Then, we perform joint training in a self-supervised fashion via pseudo-labeling. For optimization, inter-domain discrepancy between the source and target domain is reduced via maximum mean discrepancy (MMD) distance. We additionally minimize intra-class discrepancy among QA samples of the same question class for fine-grained adaptation performance. To the best of our knowledge, this is the first work in QA domain adaptation to leverage question classification with self-supervised adaptation. We demonstrate the effectiveness of the proposed QC4QA with consistent improvements against the state-of-the-art baselines on multiple datasets.
研究动机与目标
- 解决在将模型部署到未见目标域时问答任务中的域偏移问题。
- 减少因问题句法和上下文域分布变化导致的性能下降。
- 开发一种利用问题类别信息但无需目标数据标注的自监督适应框架。
- 通过最小化问答表示中的域间差异与类内差异,提升模型泛化能力。
- 在零样本域自适应设置下,证明结合问题分类与自监督适应的有效性。
提出的方法
- 在源数据上训练问题分类器,以对源问题和目标问题分配问题类别。
- 使用预训练的问答模型对未标注的目标问题进行伪标签化,生成训练信号。
- 采用分布感知采样策略构建反映目标问题分布的小批量数据,以提升差异估计的准确性。
- 框架通过最大均值差异(MMD)联合优化域对齐,以最小化域间差异。
- 通过最小化同一问题类别下样本的类内差异,实现细粒度适应。
- 整体目标函数结合基于 MMD 的域对齐与类内一致性正则化,以提升泛化性能。
实验结果
研究问题
- RQ1在无需目标数据标注的情况下,问题分类能否提升问答任务的域自适应性能?
- RQ2引入问题类别信息如何影响问答模型中域间与类内差异的减少?
- RQ3分布感知采样对低资源目标域适应性能有何影响?
- RQ4所提出框架对超参数(如 MMD 权重系数和伪标签置信度阈值)的选择是否具有鲁棒性?
- RQ5在零样本问答域自适应场景下,结合问题分类的自监督适应能否超越现有的域对抗与伪标签基线方法?
主要发现
- QC4QA 在多个数据集(包括 CNN、Daily Mail 和 NewsQA)上持续优于最先进基线方法,EM 和 F1 指标均有显著提升。
- 在 CNN 数据集上,采用分布感知采样策略时,QC4QA 达到 28.05 的 EM 和 36.18 的 F1,而随机采样仅达 26.69 的 EM 和 35.24 的 F1,表明采样策略的重要性。
- 伪标签化最优置信度阈值位于 0.4 至 0.8 之间,较高阈值在 SearchQA 等大规模数据集上通过过滤噪声预测可获得更优结果。
- MMD 超参数 λ 表现为非单调但峰值性能出现在 0.01 至 0.02 之间,表明对参数选择具有一定敏感性,但对中等范围变化具有鲁棒性。
- 即使使用无监督聚类进行问题分类,QC4QA 仍能实现优异性能,证明其在无需额外标注的情况下依然有效。
- 该框架在目标数据集问题格式差异较大的场景(如 CNN 和 Daily Mail)中尤为有效,此时域偏移更为显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。