Skip to main content
QUICK REVIEW

[论文解读] Review Conversational Reading Comprehension

Hu Xu, Bing Liu|arXiv (Cornell University)|Feb 3, 2019
Topic Modeling参考文献 35被引用 16
一句话总结

本文提出了对话式阅读理解任务(Review Conversational Reading Comprehension, RCRC),该任务利用在线评论来回答多轮客户问题。提出了一种任务感知的预微调方法,仅使用未标注的问答对和评论数据,即使在RCRC数据集中标注数据有限的情况下,其性能仍可与在CoQA上进行监督微调的模型相媲美。

ABSTRACT

Inspired by conversational reading comprehension (CRC), this paper studies a novel task of leveraging reviews as a source to build an agent that can answer multi-turn questions from potential consumers of online businesses. We first build a review CRC dataset and then propose a novel task-aware pre-tuning step running between language model (e.g., BERT) pre-training and domain-specific fine-tuning. The proposed pre-tuning requires no data annotation, but can greatly enhance the performance on our end task. Experimental results show that the proposed approach is highly effective and has competitive performance as the supervised approach. The dataset is available at \url{https://github.com/howardhsu/RCRC}

研究动机与目标

  • 为解决利用非结构化在线评论回答关于产品的多轮客户问题的挑战。
  • 通过引入一种无需额外标注的预微调方法,克服基于评论的问答任务中小规模标注数据集的限制。
  • 开发一个对话式阅读理解智能体,通过理解先前交互的上下文,动态回答后续问题。
  • 在不依赖昂贵人工标注问答数据的前提下,弥合通用语言预训练与领域特定RCRC之间的差距。

提出的方法

  • 在BERT预训练与领域特定微调之间提出一种新颖的任务感知预微调步骤,仅使用未标注的评论文本和问答对数据。
  • 设计一种文本输入格式,将上下文(历史问题与答案)、当前问题和评论文本整合为BERT的单一输入序列。
  • 采用两阶段训练流程:首先在通用问答对和评论上进行预微调以注入任务意识,然后在RCRC数据集上进行微调。
  • 使用算法1从数据中采样用于预微调的相关问答对和评论,超参数通过验证集进行调优。
  • 采用BERT-base模型,最大序列长度为256,上下文+问题长度限制在96个token以内,预微调阶段训练10,000步。
  • 使用轮次级精确匹配(EM)和F1分数评估性能,并与包括DrQA和在CoQA上微调的BERT在内的监督基线模型进行比较。

实验结果

研究问题

  • RQ1是否可以通过无需人工标注RCRC数据的预微调方法,在低资源RCRC任务上显著提升性能?
  • RQ2任务感知预微调与在小规模RCRC数据集上直接微调BERT相比表现如何?
  • RQ3在通用问答对和评论上进行预微调是否优于仅在评论上直接微调的领域适应方法?
  • RQ4能否通过一种不使用任何标注数据的预微调方法,使在通用问答数据(如CoQA)上预训练的模型表现优于其本身?
  • RQ5所提出的RCRC系统的主要错误模式是什么?在哪些方面会失败?

主要发现

  • 所提出的BERT+预微调方法在笔记本电脑领域达到46.0%的EM和57.23%的F1,优于直接在RCRC数据集上微调的BERT(38.57% EM,48.67% F1),EM指标提升7.4个百分点。
  • BERT+预微调方法在餐厅领域达到54.57%的EM和64.43%的F1,较直接微调BERT(46.87% EM,55.07% F1)提升7.7个百分点。
  • 该预微调方法的性能可与使用108,000个标注轮次的BERT+CoQA(监督方法)相媲美,而整个过程无需任何RCRC标注数据。
  • 该方法优于仅进行领域适应的BERT+评论(domain-adaptation only),后者性能下降(34.53% EM vs. 38.57% EM),表明仅领域微调不足以提升性能。
  • 错误分析显示,跨度定位和边界预测是主要的失败模式,表明在跨度抽取准确性方面仍有改进空间。
  • 即使在RCRC数据有限的情况下,预微调步骤依然有效,表明任务感知预微调能显著缩小预训练与下游任务性能之间的差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。