[论文解读] Break It Down: A Question Understanding Benchmark
本文提出了问题分解意义表示(QDMR),一种基于自然语言的形式化方法,可将复杂问题分解为有序、可执行的步骤。作者发布了Break数据集——涵盖10个数据集和3种模态的83,978个问题-QDMR配对,并证明QDMR在HotpotQA上的开放域问答任务中表现更优(F1:43.3 → 52.4),同时支持使用序列到序列模型实现有效的神经解析,准确率达54%。
Understanding natural language questions entails the ability to break down a question into the requisite steps for computing its answer. In this work, we introduce a Question Decomposition Meaning Representation (QDMR) for questions. QDMR constitutes the ordered list of steps, expressed through natural language, that are necessary for answering a question. We develop a crowdsourcing pipeline, showing that quality QDMRs can be annotated at scale, and release the Break dataset, containing over 83K pairs of questions and their QDMRs. We demonstrate the utility of QDMR by showing that (a) it can be used to improve open-domain question answering on the HotpotQA dataset, (b) it can be deterministically converted to a pseudo-SQL formal language, which can alleviate annotation in semantic parsing applications. Last, we use Break to train a sequence-to-sequence model with copying that parses questions into QDMR structures, and show that it substantially outperforms several natural baselines.
研究动机与目标
- 开发一种可扩展、可由人工标注的形式化方法,通过将复杂问题分解为可执行步骤来表示其语义。
- 解决开放域问答和语义解析中缺乏结构化、组合式问题理解的问题。
- 构建一个大规模、多模态的问题分解基准,且不依赖于底层信息源。
- 证明QDMR可提升问答系统中的推理能力,并可作为形式化语义解析的代理。
- 训练并评估一种带有复制机制的神经序列到序列模型,实现端到端的QDMR解析。
提出的方法
- 提出QDMR作为意义表示形式,将复杂问题表达为有序的自然语言步骤,每个步骤对应选择、过滤或投影等原子操作。
- 设计一种众包流水线,包含用户界面,训练非专家标注者大规模生成高质量的QDMR标注。
- 从10个数据集(涵盖文本、知识库和图像三种模态)中收集Break数据集,包含83,978个问题-QDMR配对。
- 证明QDMR可被确定性地映射到伪SQL形式语言,使其可用于语义解析,并减少对专家标注的逻辑形式的依赖。
- 训练一种带有复制机制(类似CopyNet)的序列到序列神经模型,将问题映射为QDMR结构。
- 通过人工错误分析验证QDMR标注的质量,报告正确率达97.4%,且标注者间一致性高。
实验结果
研究问题
- RQ1非专家能否可靠地通过大规模众包方式标注基于自然语言的问题分解?
- RQ2QDMR在多大程度上能提升开放域问答系统的表现?
- RQ3带有复制机制的神经序列到序列模型在多大程度上能学习将问题解析为QDMR结构?
- RQ4QDMR能否作为语义解析任务中形式化逻辑形式的可行代理?
- RQ5人类标注者生成的分解在多大程度上具有一致性和语义准确性?
主要发现
- Break数据集包含通过可扩展的众包流水线收集的83,978个高质量问题-QDMR配对,标注正确率达97.4%。
- 在HotpotQA上,结合检索增强模型后,QDMR将F1分数从43.3提升至52.4,显著改善了开放域问答性能。
- 基于带有复制机制的序列到序列模型的QDMR解析器在人工评估中达到54%的准确率,证明了自动QDMR解析的可行性。
- 在一致性分析中,85.7%的标注结果与标准答案一致,表明标注者具有高度一致性。
- 在30%的情况下,QDMR分解与标准答案语义等价,且在46%的错误案例中为错误分解,表明其与预期语义高度对齐。
- QDMR到伪SQL的确定性映射使其可用于语义解析,减少了对昂贵专家标注逻辑形式的依赖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。