[论文解读] Break, Perturb, Build: Automatic Perturbation of Reasoning Paths Through Question Decomposition
本文提出了 Break, Perturb, Build (BPB) 框架,用于自动生成高质量、聚焦推理的阅读理解题-答对的扰动。通过将问题分解为 QDMR 推理路径,应用符号化扰动,并重构问题与答案,BPB 能够生成数千个多样化、语义丰富的评估样本,暴露模型缺陷并提升鲁棒性,且无需人工标注。
Recent efforts to create challenge benchmarks that test the abilities of natural language understanding models have largely depended on human annotations. In this work, we introduce the "Break, Perturb, Build" (BPB) framework for automatic reasoning-oriented perturbation of question-answer pairs. BPB represents a question by decomposing it into the reasoning steps that are required to answer it, symbolically perturbs the decomposition, and then generates new question-answer pairs. We demonstrate the effectiveness of BPB by creating evaluation sets for three reading comprehension (RC) benchmarks, generating thousands of high-quality examples without human intervention. We evaluate a range of RC models on our evaluation sets, which reveals large performance gaps on generated examples compared to the original data. Moreover, symbolic perturbations enable fine-grained analysis of the strengths and limitations of models. Last, augmenting the training data with examples generated by BPB helps close the performance gaps, without any drop on the original data distribution.
研究动机与目标
- 解决缺乏可扩展、高质量评估集的问题,这些评估集可测试模型在表面级扰动之外的推理鲁棒性。
- 克服人工标注对比集的局限性,后者成本高且多样性有限。
- 实现自动生成语义上有意义、聚焦推理层级的扰动,以检验模型的深层理解能力。
- 提供一种可扩展、模块化的流水线,用于创建能暴露跨多样化推理类型模型缺陷的评估集。
- 证明使用 BPB 生成的示例进行数据增强,可在不降低原始数据表现的前提下提升模型泛化能力。
提出的方法
- 将输入问题解析为问题分解意义表示(QDMR),以自然语言操作序列的形式表示推理步骤。
- 对 QDMR 分解应用基于规则的符号化扰动,改变推理路径(例如,将比较改为减法),同时保持语法连贯性。
- 使用预训练的问题生成(QG)模型,从扰动后的 QDMR 分解重构自然语言问题。
- 使用单跳阅读理解模型计算生成问题的答案,或在无法获得确切答案时推导答案约束(例如,类型、范围)。
- 通过众包验证生成的示例,确认其正确率 ≥85%。
- 将 BPB 生成的示例整合到训练数据中,以评估并提升模型在分布外推理模式下的泛化能力。
实验结果
研究问题
- RQ1能否在无需人工标注的情况下,通过自动扰动问题中的推理路径,生成高质量、多样化的评估示例?
- RQ2与原始基准相比,最先进阅读理解模型在 BPB 生成的对比集中表现如何?
- RQ3不同类型的推理扰动(例如,数值型、比较型、逻辑型)在多大程度上暴露了模型的不同缺陷?
- RQ4使用 BPB 生成的示例进行数据增强,能否在不损害原始数据分布表现的前提下,弥合分布外推理模式下的性能差距?
- RQ5当无法计算确切答案时,答案约束作为评估代理的有效性如何?
主要发现
- 在三个阅读理解基准(DROP、HotpotQA、IIRC)上,BPB 生成了原始示例的 63.5% 至 70.2%,且经众包确认正确率 ≥85%。
- 领先模型如 UnifiedQA 和 TASE 在 BPB 生成的测试集上表现出显著性能下降,F1 分数下降 13 至 36 个百分点,且一致性低于 40%。
- UnifiedQA 在需要数值计算的问题上完全失效,且模型对较小数字存在偏见,尤其在 '≥' 与 '≤' 等约束条件下。
- TASE 在 DROP 数据集上难以处理中间推理步骤,而 UnifiedQA 在包含较少是/否问题的数据集上微调后,约束满足率显著下降。
- 使用 BPB 生成示例进行数据增强,可在不降低原始数据分布表现的前提下,缩小分布外推理模式下的性能差距。
- 在 HotpotQA 和 IIRC 上微调 UnifiedQA 后,约束满足率分别从 94.7% 降至 76.3%,从 65.4% 降至 38.9%,表明领域分布偏移对约束预测产生了负面影响。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。