Skip to main content
QUICK REVIEW

[论文解读] Conditional Augmentation for Aspect Term Extraction via Masked Sequence-to-Sequence Generation

Kun Li, Chengbo Chen|arXiv (Cornell University)|Apr 30, 2020
Sentiment Analysis and Opinion Mining参考文献 34被引用 4
一句话总结

本文提出了一种用于方面词抽取的可控数据增强方法,采用掩码序列到序列生成,模型在保留原始方面标签的同时重建评论句子的掩码片段。该方法通过生成多样化、流畅且标签一致的训练样本,显著提升了低资源 ATE 基准上的模型性能。

ABSTRACT

Aspect term extraction aims to extract aspect terms from review texts as opinion targets for sentiment analysis. One of the big challenges with this task is the lack of sufficient annotated data. While data augmentation is potentially an effective technique to address the above issue, it is uncontrollable as it may change aspect words and aspect labels unexpectedly. In this paper, we formulate the data augmentation as a conditional generation task: generating a new sentence while preserving the original opinion targets and labels. We propose a masked sequence-to-sequence method for conditional augmentation of aspect term extraction. Unlike existing augmentation approaches, ours is controllable and allows us to generate more diversified sentences. Experimental results confirm that our method alleviates the data scarcity problem significantly. It also effectively boosts the performances of several current models for aspect term extraction.

研究动机与目标

  • 通过开发一种可控的数据增强技术,解决方面词抽取(ATE)中的数据稀缺问题。
  • 确保生成的句子保留原始方面词标签,并将原始意见目标保持为有效的方面词。
  • 克服现有方法(如 GAN、VAE 和词替换)的局限性,实现更丰富多样且上下文连贯的句子生成。
  • 证明通过掩码序列到序列建模的条件生成在该特定增强任务中优于 BERT 和 GPT-2 等其他语言模型。
  • 建立一个可推广至其他低资源序列标注任务(如命名实体识别和名词短语切分)的框架。

提出的方法

  • 将数据增强建模为一个条件序列到序列生成任务,即模型根据部分掩码的输入和对应的标签序列,生成完整句子。
  • 采用类似 MASS 的掩码序列到序列预训练方式,使用基于 Transformer 的编码器-解码器架构,实现上下文感知且标签条件化的生成。
  • 在输入句子中掩码多个连续的词元,并训练模型利用上下文和标签序列作为条件信号,重建被掩码的片段。
  • 将标签信息整合到编码器输入中,以确保生成句子中的方面词仍为有效的意见目标。
  • 使用标准交叉熵损失在重建任务上端到端训练模型,实现自回归方式生成多样化且流畅的句子。
  • 与基于替换的增强方法(使用 WordNet 同义词)以及微调后的 BERT/GPT-2 变体进行比较,验证其在流畅性、多样性与标签一致性方面的优越性。

实验结果

研究问题

  • RQ1掩码序列到序列生成能否有效用于生成多样化、流畅且标签一致的句子,以实现方面词抽取的数据增强?
  • RQ2与 GAN、VAE 和基于词替换的方法相比,所提出的方法在保留方面词标签和维持句子连贯性方面表现如何?
  • RQ3为何所提出的带有掩码序列到序列学习的编码器-解码器框架在该条件生成任务中优于 BERT 和 GPT-2?
  • RQ4该增强方法在低资源数据集上对下游 ATE 模型性能的提升程度如何?
  • RQ5该框架能否推广至方面词抽取以外的其他低资源序列标注任务?

主要发现

  • 所提出的方法通过生成更多样化且标签一致的训练样本,在两个基准 ATE 数据集上显著提升了 F1 分数。
  • 与基于替换的方法相比,该模型在流畅性和 BLEU 分数上表现更优,后者受限于同义词可用性及上下文无关的词替换。
  • GPT-2 表现较差,因其缺乏编码器,导致生成不可控,无法与标签序列对齐。
  • BERT 表现劣于所提方法,因其独立重建词元的假设导致生成序列不连贯。
  • 定性分析表明,该方法能生成语义多样且上下文恰当的句子,同时保持方面词作为意见目标。
  • 该框架可迁移且适用于其他低资源序列标注任务,如命名实体识别和名词短语切分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。