Skip to main content
QUICK REVIEW

[论文解读] DomBERT: Domain-oriented Language Model for Aspect-based Sentiment Analysis

Hu Xu, Bing Liu|arXiv (Cornell University)|Apr 28, 2020
Topic Modeling参考文献 44被引用 5
一句话总结

DomBERT 是一种基于 BERT 的语言模型,通过从目标领域和相关源领域中学习,增强了低资源领域的情感分析性能。它通过动态采样与领域相关的训练样本,显著减少了对目标领域数据的依赖,在 AE、ASC 和 E2E-ABSA 任务上取得了最先进(SOTA)的性能表现。

ABSTRACT

This paper focuses on learning domain-oriented language models driven by end tasks, which aims to combine the worlds of both general-purpose language models (such as ELMo and BERT) and domain-specific language understanding. We propose DomBERT, an extension of BERT to learn from both in-domain corpus and relevant domain corpora. This helps in learning domain language models with low-resources. Experiments are conducted on an assortment of tasks in aspect-based sentiment analysis, demonstrating promising results.

研究动机与目标

  • 解决通用语言模型(如 BERT)因混合领域预训练而难以捕捉细粒度领域特定情感模式的问题。
  • 通过利用相关且多样化的源领域知识,缓解低资源领域中的数据稀缺问题。
  • 开发一种面向领域的学习框架,平衡领域内专注与语义相关领域之间的知识迁移。
  • 在无需人工标注领域特定数据的前提下,提升低资源环境下方面级情感分析(ABSA)的性能。

提出的方法

  • 扩展 BERT,引入一种领域感知的训练目标,根据训练样本与目标领域的相关性动态重加权。
  • 通过辅助的领域分类任务学习领域嵌入,以识别并优先选择相关源领域进行预训练。
  • 集成动态掩码机制,并移除下一句预测(NSP)任务,借鉴 RoBERTa 的改进。
  • 如 ALBERT 所示,移除 dropout 以减少低资源设置下的过拟合。
  • 在按领域标签分割的混合领域语料上训练 DomBERT,使其能够从目标领域和相关源领域中采样。
  • 使用带领域标签的弱监督进行自监督学习,避免对任务特定标注的依赖。

实验结果

研究问题

  • RQ1在目标领域与相关源领域混合预训练的语言模型,是否能在低资源 ABSA 任务中超越通用模型和仅在目标领域预训练的模型?
  • RQ2与均匀采样或随机采样相比,领域感知的样本采样在提升方面级情感分析任务性能方面有多高效?
  • RQ3语义相关领域(如 'Desktop' 对 'Laptop')的知识能在多大程度上弥补有限的领域内训练数据?
  • RQ4所提出的面向领域的学习框架是否能在不同 ABSA 子任务(AE、ASC、E2E-ABSA)上实现泛化?
  • RQ5DomBERT 的采样机制识别出的前几名源领域,是否与人类对领域相关性的直觉判断一致?

主要发现

  • 在方面抽取(AE)任务中,DomBERT 在笔记本电脑领域取得 83.89 的 F1 分数,在餐厅领域取得 77.21 的 F1 分数,表现优于 BERT-DK,且仅使用了 100 MB 的领域内数据。
  • 在方面情感分类(ASC)任务中,DomBERT 在笔记本电脑领域取得 73.46 的 MF1,在餐厅领域取得 75.00 的 MF1,即使在领域内数据有限的情况下也表现出色。
  • 在端到端 ABSA 任务中,DomBERT 在笔记本电脑领域取得 66.21 的 F1 分数,在餐厅领域取得 73.45 的 F1 分数,优于 BERT-Review 和 BERT-DK,表明其能有效整合通用知识与领域特定知识。
  • DomBERT 采样器为笔记本电脑和餐厅领域识别出的前 20 个源领域高度相关(如 'Computers & Accessories'、'Electronics Warranties'、'Coffee & Tea'),证实了模型学习有意义领域关系的能力。
  • BERT-Review 在 E2E-ABSA 任务中表现不佳,是因为 'Books' 等无关领域过度代表,凸显了 DomBERT 中领域感知采样的优势。
  • 模型的性能提升在 AE 和 E2E-ABSA 任务中最为显著,这两项任务更具领域特异性,表明面向领域的学习对细粒度、方面级任务最为有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。