QUICK REVIEW
[论文解读] DomBERT: Domain-oriented Language Model for Aspect-based Sentiment Analysis
Hu Xu, Bing Liu|arXiv (Cornell University)|Apr 28, 2020
Topic Modeling参考文献 44被引用 5
一句话总结
DomBERT 是一种基于 BERT 的语言模型,通过从目标领域和相关源领域中学习,增强了低资源领域的情感分析性能。它通过动态采样与领域相关的训练样本,显著减少了对目标领域数据的依赖,在 AE、ASC 和 E2E-ABSA 任务上取得了最先进(SOTA)的性能表现。
ABSTRACT
This paper focuses on learning domain-oriented language models driven by end tasks, which aims to combine the worlds of both general-purpose language models (such as ELMo and BERT) and domain-specific language understanding. We propose DomBERT, an extension of BERT to learn from both in-domain corpus and relevant domain corpora. This helps in learning domain language models with low-resources. Experiments are conducted on an assortment of tasks in aspect-based sentiment analysis, demonstrating promising results.
研究动机与目标
- 解决通用语言模型(如 BERT)因混合领域预训练而难以捕捉细粒度领域特定情感模式的问题。
- 通过利用相关且多样化的源领域知识,缓解低资源领域中的数据稀缺问题。
- 开发一种面向领域的学习框架,平衡领域内专注与语义相关领域之间的知识迁移。
- 在无需人工标注领域特定数据的前提下,提升低资源环境下方面级情感分析(ABSA)的性能。
提出的方法
- 扩展 BERT,引入一种领域感知的训练目标,根据训练样本与目标领域的相关性动态重加权。
- 通过辅助的领域分类任务学习领域嵌入,以识别并优先选择相关源领域进行预训练。
- 集成动态掩码机制,并移除下一句预测(NSP)任务,借鉴 RoBERTa 的改进。
- 如 ALBERT 所示,移除 dropout 以减少低资源设置下的过拟合。
- 在按领域标签分割的混合领域语料上训练 DomBERT,使其能够从目标领域和相关源领域中采样。
- 使用带领域标签的弱监督进行自监督学习,避免对任务特定标注的依赖。
实验结果
研究问题
- RQ1在目标领域与相关源领域混合预训练的语言模型,是否能在低资源 ABSA 任务中超越通用模型和仅在目标领域预训练的模型?
- RQ2与均匀采样或随机采样相比,领域感知的样本采样在提升方面级情感分析任务性能方面有多高效?
- RQ3语义相关领域(如 'Desktop' 对 'Laptop')的知识能在多大程度上弥补有限的领域内训练数据?
- RQ4所提出的面向领域的学习框架是否能在不同 ABSA 子任务(AE、ASC、E2E-ABSA)上实现泛化?
- RQ5DomBERT 的采样机制识别出的前几名源领域,是否与人类对领域相关性的直觉判断一致?
主要发现
- 在方面抽取(AE)任务中,DomBERT 在笔记本电脑领域取得 83.89 的 F1 分数,在餐厅领域取得 77.21 的 F1 分数,表现优于 BERT-DK,且仅使用了 100 MB 的领域内数据。
- 在方面情感分类(ASC)任务中,DomBERT 在笔记本电脑领域取得 73.46 的 MF1,在餐厅领域取得 75.00 的 MF1,即使在领域内数据有限的情况下也表现出色。
- 在端到端 ABSA 任务中,DomBERT 在笔记本电脑领域取得 66.21 的 F1 分数,在餐厅领域取得 73.45 的 F1 分数,优于 BERT-Review 和 BERT-DK,表明其能有效整合通用知识与领域特定知识。
- DomBERT 采样器为笔记本电脑和餐厅领域识别出的前 20 个源领域高度相关(如 'Computers & Accessories'、'Electronics Warranties'、'Coffee & Tea'),证实了模型学习有意义领域关系的能力。
- BERT-Review 在 E2E-ABSA 任务中表现不佳,是因为 'Books' 等无关领域过度代表,凸显了 DomBERT 中领域感知采样的优势。
- 模型的性能提升在 AE 和 E2E-ABSA 任务中最为显著,这两项任务更具领域特异性,表明面向领域的学习对细粒度、方面级任务最为有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。