[论文解读] Repartitioning of the ComplexWebQuestions Dataset
本文识别并解决了ComplexWebQuestions (v1.0)数据集中存在的数据泄露问题,该问题导致在训练集上训练阅读理解(RC)模型时因训练集与测试集之间存在重叠的种子问题而产生人为偏高的性能表现。作者通过在种子问题层级上重新划分数据,提出了一个新的数据集版本——ComplexWebQuestions v1.1,消除了虚假相关性,并在修正后的数据集上使用微调的DocumentQA模型,实现了34.2的新的SOTA precision@1性能表现。
Recently, Talmor and Berant (2018) introduced ComplexWebQuestions - a dataset focused on answering complex questions by decomposing them into a sequence of simpler questions and extracting the answer from retrieved web snippets. In their work the authors used a pre-trained reading comprehension (RC) model (Salant and Berant, 2018) to extract the answer from the web snippets. In this short note we show that training a RC model directly on the training data of ComplexWebQuestions reveals a leakage from the training set to the test set that allows to obtain unreasonably high performance. As a solution, we construct a new partitioning of ComplexWebQuestions that does not suffer from this leakage and publicly release it. We also perform an empirical evaluation on these two datasets and show that training a RC model on the training data substantially improves state-of-the-art performance.
研究动机与目标
- 识别并解决ComplexWebQuestions数据集中导致RC模型获得人为偏高性能的数据泄露问题。
- 通过消除训练集与测试集之间的虚假相关性,确保RC模型评估的公平性。
- 基于原始种子问题对数据集进行重新划分,防止训练集与测试集之间的重叠。
- 在修正后的数据集上,使用微调的RC模型实现ComplexWebQuestions任务的新SOTA性能。
- 公开发布修正后的数据集(v1.1),以确保未来研究的公平性与可复现性。
提出的方法
- 基于来自WebQuestionsSP的原始种子问题,对ComplexWebQuestions数据集进行重新划分。
- 确保任一种子问题不会同时出现在训练集与测试集中,从而消除因重叠引发的虚假相关性。
- 在原始复杂问题及其分解版本上微调DocumentQA RC模型,以提升性能。
- 在63,263个来自ComplexWebQuestions训练集的样本上训练RC模型,包括完整问题与分解后的问题。
- 在原始(v1.0)与重新划分(v1.1)两个版本的数据集上,均使用precision@1作为评估指标。
- 比较不同问题分解策略(SimpQA与SplitQA)以及不同RC模型变体(预训练模型、NoDecomp、Decomp)的性能表现。
实验结果
研究问题
- RQ1在ComplexWebQuestions训练集上训练阅读理解模型所获得的性能提升,是否主要源于数据泄露而非模型泛化能力?
- RQ2基于种子问题的新型划分策略是否能够消除训练集与测试集之间的虚假相关性?
- RQ3在修正后的数据集(v1.1)上微调RC模型是否能带来可测量且公平的性能提升?
- RQ4在RC模型训练过程中引入分解后的问题,对整体性能有何影响?
- RQ5能否在使用修正后数据集并结合微调RC模型的情况下,实现ComplexWebQuestions任务的新SOTA性能?
主要发现
- 在ComplexWebQuestions v1.0上微调RC模型后,在验证集上达到55.0的precision@1,该性能主要源于种子问题在训练集与测试集之间的重叠所导致的数据泄露。
- 在修正后的v1.1划分版本中,同一模型在验证集上的precision@1仅为31.1,表明v1.0上表现优异的原因是虚假相关性。
- 预训练RC模型在两个版本中表现稳定(precision@1为20.4–20.5),证实v1.1上性能下降是由于模型在v1.0上的过拟合所致。
- 在原始问题与分解后问题(SplitQA + Decomp)上联合训练RC模型后,v1.1验证集上的precision@1提升至35.6。
- 最终模型(SplitQA + Decomp)在v1.1测试集上实现了34.2的新的SOTA precision@1性能。
- 修正后的数据集ComplexWebQuestions v1.1已公开发布,以确保未来模型评估的公平性与可复现性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。