[论文解读] MultiReQA: A Cross-Domain Evaluation for Retrieval Question Answering Models
MultiReQA 提出了一套用于检索问答(ReQA)的跨领域评估套件,包含从公开数据集中提取的八个多样化任务。该研究通过使用监督微调的 BERT 和 USE-QA,以及 BM25 方法,对检索模型进行了评估,结果表明,在领域内微调始终优于跨领域训练的通用模型。
Retrieval question answering (ReQA) is the task of retrieving a sentence-level answer to a question from an open corpus (Ahmad et al.,2019).This dataset paper presents MultiReQA, a new multi-domain ReQA evaluation suite composed of eight retrieval QA tasks drawn from publicly available QA datasets. We explore systematic retrieval based evaluation and transfer learning across domains over these datasets using a number of strong base-lines including two supervised neural models, based on fine-tuning BERT and USE-QA models respectively, as well as a surprisingly effective information retrieval baseline, BM25. Five of these tasks contain both training and test data, while three contain test data only. Performing cross training on the five tasks with training data shows that while a general model covering all domains is achievable, the best performance is often obtained by training exclusively on in-domain data.
研究动机与目标
- 建立一个全面的、多领域的检索问答(ReQA)模型评估基准。
- 探究在 ReQA 中跨多样化领域进行迁移学习的有效性。
- 比较监督神经网络模型(BERT、USE-QA)与传统信息检索基线(BM25)在跨领域设置下的表现。
- 评估在多个领域上训练的通用模型是否能超越领域特定模型。
- 评估领域特定微调与跨领域预训练对 ReQA 性能的影响。
提出的方法
- 使用八个公开可用的问答数据集构建 MultiReQA,作为多领域 ReQA 评估套件。
- 选取五个同时包含训练集和测试集的任务,用于跨领域训练与评估。
- 使用领域内和跨领域训练数据,对 BERT 和 USE-QA 模型进行监督微调。
- 将 BM25 作为强基准非神经网络方法用于对比。
- 使用标准 ReQA 指标在保留的测试集上评估模型在各领域中的性能。
- 分析领域内与跨领域训练策略之间的性能差异。
实验结果
研究问题
- RQ1一个在多个领域上训练的单一通用模型是否能在所有 ReQA 任务中实现优异性能?
- RQ2与跨领域训练相比,领域内微调在检索准确率方面表现如何?
- RQ3在跨领域 ReQA 中,神经网络模型(BERT、USE-QA)与传统信息检索方法(BM25)的相对性能如何?
- RQ4当在不同领域上进行训练和测试时,领域分布偏移对模型性能的损害程度有多大?
- RQ5与通用预训练相比,使用领域特定训练数据是否能带来显著的性能提升?
主要发现
- 尽管可在所有五个可用训练任务上联合训练一个通用模型,但其性能并未始终优于领域特定模型。
- 在每个任务上,仅使用领域内数据进行训练时,性能始终达到最佳。
- BM25 作为一种传统信息检索方法,表现出人意料的优异性能,且在某些任务上甚至优于神经网络基线。
- 微调后的 BERT 和 USE-QA 模型表现出较强性能,但其在跨领域迁移时性能提升有限。
- 跨领域训练导致在领域外任务上的性能下降,表明领域偏移仍是重大挑战。
- 结果表明,对于 ReQA 任务而言,领域特定微调比通用预训练更为有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。