Skip to main content
QUICK REVIEW

[论文解读] ReviewQA: a relational aspect-based opinion reading dataset

Quentin Grail, Julien Pérez|arXiv (Cornell University)|Oct 29, 2018
Topic Modeling参考文献 13被引用 6
一句话总结

ReviewQA 引入了一个大规模、关系型的问答数据集,基于来自 TripAdvisor 的 100,000 条酒店评论,旨在评估超越简单跨度抽取的推理能力。该数据集包含超过 500,000 个自然语言问题,涵盖八种推理任务,答案从候选答案集中选择而非从文本中抽取,从而实现对复杂理解与情感推理的稳健评估。深度投影阅读器模型表现最佳,在大多数任务上优于基线模型。

ABSTRACT

Deep reading models for question-answering have demonstrated promising performance over the last couple of years. However current systems tend to learn how to cleverly extract a span of the source document, based on its similarity with the question, instead of seeking for the appropriate answer. Indeed, a reading machine should be able to detect relevant passages in a document regarding a question, but more importantly, it should be able to reason over the important pieces of the document in order to produce an answer when it is required. To motivate this purpose, we present ReviewQA, a question-answering dataset based on hotel reviews. The questions of this dataset are linked to a set of relational understanding competencies that we expect a model to master. Indeed, each question comes with an associated type that characterizes the required competency. With this framework, it is possible to benchmark the main families of models and to get an overview of what are the strengths and the weaknesses of a given model on the set of tasks evaluated in this dataset. Our corpus contains more than 500.000 questions in natural language over 100.000 hotel reviews. Our setup is projective, the answer of a question does not need to be extracted from a document, like in most of the recent datasets, but selected among a set of candidates that contains all the possible answers to the questions of the dataset. Finally, we present several baselines over this dataset.

研究动机与目标

  • 为解决 SQuAD 等抽取型问答数据集的局限性(即更倾向于模式匹配而非真正推理),引入一个需要关系与组合理解的数据集。
  • 将情感分析形式化为一个问答任务,使模型能够在用户评论上评估细微意见推理的能力。
  • 发布一个大规模的投影型问答基准,包含 100,000 条酒店评论和 500,000 个问题,涵盖八种不同的推理能力。
  • 通过将每个问题与特定的推理类型关联,为推理模型提供一个全面的评估框架,实现对模型优势与弱点的细粒度分析。
  • 为未来在阅读理解中进行推理研究建立强基线,包括一种新型的深度投影阅读器模型。

提出的方法

  • 该数据集构建自 TripAdvisor 的酒店评论,每条评论均标注了方面评分(如清洁度、性价比)和总体评分,作为问题生成的基础。
  • 问题通过众包生成,并经过回译以生成多样化、自然的语言表述,确保语言多样性同时保留语义含义。
  • 每个问题均关联至八种推理类型之一——从简单的跨度抽取到复杂的推理,如精确评分预测或比较推理。
  • 采用投影型答案选择机制:不从文档中抽取跨度,而是从预定义的候选答案集中选择正确答案,从而在不依赖精确跨度匹配的情况下评估推理能力。
  • 提出一种深度投影阅读器模型,结合双向 LSTM、问题-文档注意力、文档内部自注意力机制,以及将上下文映射到答案空间的投影层。
  • 基线模型包括简单的 LSTM、带有 5 次记忆跳跃的 MemN2N、逻辑回归,以及所提出的深度投影阅读器模型,所有模型均在完整数据集上训练,使用相同的超参数(Adam 优化器、300D GloVe 嵌入、批量大小 64)。

实验结果

研究问题

  • RQ1问答框架能否有效评估阅读理解中超越简单跨度抽取的关系推理能力?
  • RQ2不同模型架构在源自用户生成酒店评论的多样化推理任务上的表现如何?
  • RQ3在文档扰动存在的情况下,与抽取型基线相比,投影型答案选择机制在多大程度上提升了鲁棒性?
  • RQ4结合自注意力和问题感知编码的深度投影阅读器模型,能否在复杂意见推理任务上超越传统架构?
  • RQ5不同推理类型(如精确评分预测、比较推理)如何暴露当前阅读理解模型的特定弱点?

主要发现

  • 深度投影阅读器模型在 ReviewQA 测试集上整体表现最佳,在大多数推理任务上均优于其他所有基线模型。
  • 简单 LSTM 和 MemN2N 模型在高级推理任务上表现较差,特别是在任务 5(精确方面评分预测)中,表明其在建模复杂意见结构方面存在局限。
  • 逻辑回归在各项任务中表现尚可,其最差表现出现在任务 6(方面列表),表明其并非为多答案预测而优化。
  • 投影阅读器模型使用的问题-文档注意力和文档-文档注意力层,实现了更丰富的上下文编码,从而在需要上下文推理的任务上表现更优。
  • 数据集的投影设置——即答案从候选集选择而非从文本中抽取——在评估推理能力方面被证明是有效的,因为它减少了对精确跨度匹配的依赖,提高了鲁棒性。
  • 引入回译问题增强了语言多样性,同时保持了任务一致性,支持在语言变体上的泛化能力评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。