Skip to main content
QUICK REVIEW

[论文解读] QADiscourse -- Discourse Relations as QA Pairs: Representation, Crowdsourcing and Baselines

Valentina Pyatkin, Ayal Klein|arXiv (Cornell University)|Oct 6, 2020
Topic Modeling参考文献 39被引用 4
一句话总结

本文提出了 QADiscourse,一种新颖的框架,将话语关系表示为问题-答案(QA)配对,以实现可扩展的众包话语关系标注。通过将话语关系表示为问题前缀指示关系类型的 QA 配对,作者收集了一个大规模、开源的数据集,包含超过 16,600 对 QA,来自约 9,000 个句子,并建立了用于预测话语感知问题和答案的基线模型,在使用基于 BERT 的流水线、指针-生成问题生成和微调 SQuAD 答案预测的情况下,测试集 F1 达到 83.69%。

ABSTRACT

Discourse relations describe how two propositions relate to one another, and identifying them automatically is an integral part of natural language understanding. However, annotating discourse relations typically requires expert annotators. Recently, different semantic aspects of a sentence have been represented and crowd-sourced via question-and-answer (QA) pairs. This paper proposes a novel representation of discourse relations as QA pairs, which in turn allows us to crowd-source wide-coverage data annotated with discourse relations, via an intuitively appealing interface for composing such questions and answers. Based on our proposed representation, we collect a novel and wide-coverage QADiscourse dataset, and present baseline algorithms for predicting QADiscourse relations.

研究动机与目标

  • 为解决专家标注话语关系数据集成本高、可扩展性差的问题,通过使用直观的 QA 配对实现众包标注。
  • 开发一种将话语关系表示为 QA 配对的方法,其中问题前缀编码关系语义,使非专家能够标注复杂关系。
  • 从自然语言句子中收集广泛覆盖、开源的话语感知 QA 配对数据集。
  • 建立基线模型,从输入句子中联合预测问题(含关系语义)和答案(话语单元)。

提出的方法

  • 将话语关系表示为 QA 配对,其中问题前缀编码关系语义(例如,'为什么?' 表示因果关系),答案为目标话语单元。
  • 设计一种众包界面,通过聚焦于关系语义和话语单元对齐,引导非专家生成有意义的 QA 配对。
  • 使用 BERT 编码的指针-生成模型,从句子片段和关系前缀生成问题主体,支持词汇的复制与生成。
  • 在 SQuAD 和 QADiscourse 数据集子集上微调 BERT 模型,以从标准问题中预测答案跨度。
  • 采用两阶段流水线:首先生成问题,然后预测答案,损失函数对类别不平衡进行加权。
  • 使用 UQA(无标签 QA 对齐)和 LQA(有标签准确率)指标进行评估,包括关系语义预测的前缀准确率。

实验结果

研究问题

  • RQ1能否通过问题前缀编码关系语义的 QA 配对格式,有效表示并实现话语关系的众包标注?
  • RQ2非专家标注者能否通过这种基于 QA 的界面可靠地生成高质量的话语感知 QA 配对?
  • RQ3神经网络模型在从原始句子中联合预测话语感知问题和答案方面的有效性如何?
  • RQ4与传统标注方案相比,所提出的基于 QA 的表示在多大程度上保留了话语关系的语义和结构细微差别?
  • RQ5基线模型在 QADiscourse 框架中预测问题前缀和答案跨度的性能极限是什么?

主要发现

  • QADiscourse 数据集包含从约 9,000 个句子中收集的超过 16,600 对 QA,是一个广泛覆盖、开源的话语关系标注资源。
  • 完整流水线基线在测试集上使用 UQA 评估达到 83.69% 的 F1 分数,证明了端到端话语 QA 预测的可行性。
  • 关系语义预测的前缀准确率为 49.94%(测试集),表明语义分类仍有显著提升空间。
  • 在给定标准问题的情况下,答案预测准确率达到 72.3%(测试集),表明跨度抽取性能较强。
  • 定性分析显示,44% 的采样预测被判定为正确,模型在未见动词上泛化良好,并能从非相邻跨度生成问题。
  • 模型生成了 8 个语法错误但语义合理的 QA 对,以及 8 个语法正确但语义荒谬的 QA 对,凸显了流畅性与语义保持之间的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。