Skip to main content
QUICK REVIEW

[论文解读] Answering Complicated Question Intents Expressed in Decomposed Question Sequences

Mohit Iyyer, Wen-tau Yih|arXiv (Cornell University)|Nov 4, 2016
Topic Modeling参考文献 13被引用 8
一句话总结

本文提出SQA,一个包含6,066个关于维基百科表格的相互关联、简单问题序列的新数据集,旨在模拟自然的多轮对话式阅读理解问答。该研究提出了表格重写与指代消解策略以处理指代关系与语义不匹配问题,但发现当前系统的主要问题在于问题与表格内容之间的语义匹配错误,而非指代消解问题。

ABSTRACT

Recent work in semantic parsing for question answering has focused on long and complicated questions, many of which would seem unnatural if asked in a normal conversation between two humans. In an effort to explore a conversational QA setting, we present a more realistic task: answering sequences of simple but inter-related questions. We collect a dataset of 6,066 question sequences that inquire about semi-structured tables from Wikipedia, with 17,553 question-answer pairs in total. Existing QA systems face two major problems when evaluated on our dataset: (1) handling questions that contain coreferences to previous questions or answers, and (2) matching words or phrases in a question to corresponding entries in the associated table. We conclude by proposing strategies to handle both of these issues.

研究动机与目标

  • 通过建模更自然的多轮对话式交互,解决单轮问答的局限性。
  • 研究现有语义解析器在处理相互关联的问题序列而非孤立复杂查询时的表现。
  • 识别当前问答系统在应用于序列化、上下文依赖的问答任务时的关键失败模式。
  • 评估表格重写与指代消解策略在提升序列化问答性能方面的有效性。
  • 分析序列化问答中错误的根本原因,特别是问题文本与表格条目之间的语义不匹配问题。

提出的方法

  • 从众包工作者处收集了6,066个问题序列,这些序列源自WikiTableQuestions数据集中复杂问题的分解。
  • 将每个问题精确锚定到维基百科HTML表格中的具体单元格,确保答案的精准定位。
  • 提出了五种表格重写策略:从不重写、始终重写、重写行/子集、基于指代的重写,以及使用真实答案的上限基准。
  • 使用语义解析器(fp)在开发集上评估这些重写策略的影响,以衡量准确率与最优性能。
  • 对70个开发集问题进行人工错误分析,以分类失败模式,区分指代错误与语义匹配问题。
  • 发现语义不匹配——尤其是问题措辞与表格单元格文本之间的差异——是主要错误来源,而非指代消解问题。

实验结果

研究问题

  • RQ1现有的语义解析器能否有效处理对话式问答场景中相互关联的简单问题序列?
  • RQ2问题与答案之间的指代关系在多轮问答中在在多大程度上影响语义解析器的性能?
  • RQ3表格重写策略在多大程度上能提升序列化问答的准确率?
  • RQ4当应用于半结构化表格时,序列化问答系统的主要错误来源是什么?
  • RQ5与指代错误相比,问题文本与表格内容之间的语义不匹配对解析器性能的影响如何?

主要发现

  • 现有问答系统在SQA数据集上的表现较差,当不应用重写策略时,开发集上的基础准确率仅为27.7%。
  • 基于预测答案的表格重写仅带来微小提升(例如,基于指代的重写准确率为29.2%),表明错误会从先前的错误预测中传播下来。
  • 上限性能——使用真实答案进行重写——达到37.0%的准确率,表明若能解决指代与匹配错误,可实现10%的绝对性能提升。
  • 在70个手动分析的错误中,仅有15个是由于指代消解失败导致,表明指代消解并非主要挑战。
  • 大多数错误源于问题措辞与表格内容之间的语义不匹配,例如术语差异(如“highway”与“road”)或缺乏世界知识。
  • 尽管SQA中已避免归一化问题(因答案为精确表格单元格匹配),但性能仍较低,凸显语义匹配问题的严重性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。