Skip to main content
QUICK REVIEW

[论文解读] Cross-Domain Sentiment Classification with In-Domain Contrastive Learning

Tian Li, Xiang Chen|arXiv (Cornell University)|Dec 5, 2020
Domain Adaptation and Few-Shot Learning参考文献 39被引用 4
一句话总结

该论文提出了一种新颖的领域内对比学习框架,用于跨领域情感分类,通过学习领域不变表示而无需依赖分布匹配,从而提升泛化能力。该方法根据标签分布偏移的程度,自适应地应用领域内对比学习或熵最小化,在标准基准上实现了最先进性能,通过更优的决策边界对齐和在大领域偏移下减少错误,超越了强基线模型。

ABSTRACT

Contrastive learning (CL) has been successful as a powerful representation learning method. In this paper, we propose a contrastive learning framework for cross-domain sentiment classification. We aim to induce domain invariant optimal classifiers rather than distribution matching. To this end, we introduce in-domain contrastive learning and entropy minimization. Also, we find through ablation studies that these two techniques behaviour differently in case of large label distribution shift and conclude that the best practice is to choose one of them adaptively according to label distribution shift. The new state-of-the-art results our model achieves on standard benchmarks show the efficacy of the proposed method.

研究动机与目标

  • 为解决跨领域情感分类中的领域偏移问题,特别是在大标签分布偏移情况下的挑战。
  • 开发一种避免分布匹配、转而促进领域不变最优分类器的对比学习框架。
  • 研究在不同标签分布偏移程度下,领域内对比学习与熵最小化之间的互补行为。
  • 通过精心设计的掩码任务学习判别性、可迁移的表示,以提升模型泛化能力。
  • 在不依赖对抗训练或领域差异最小化的情况下,实现在标准跨领域情感分类基准上的最先进性能。

提出的方法

  • 提出领域内对比学习,仅在每个领域(源域或目标域)内部构建正样本对与负样本对,避免跨领域对比,从而降低领域差异。
  • 使用同义词替换和反向翻译作为数据增强技术,生成对比学习的正样本,确保有意义的表示学习。
  • 采用熵最小化方法,促使模型对无标签目标域数据做出置信预测,从而在低偏移设置下提升泛化能力。
  • 根据源域与目标域之间标签分布偏移的幅度,自适应地在领域内对比学习与熵最小化之间进行选择。
  • 在统一框架中结合领域内对比学习与熵最小化,利用t-SNE可视化验证了聚类效果与决策边界对齐的改善。
  • 使用BERT作为特征提取器,并通过对比学习与熵正则化目标端到端微调模型。

实验结果

研究问题

  • RQ1在领域差异与决策边界对齐方面,领域内对比学习与标准对比学习相比表现如何?
  • RQ2在不同程度的标签分布偏移下,领域内对比学习与熵最小化分别表现如何?
  • RQ3在不同领域偏移场景下,自适应地在领域内对比学习与熵最小化之间进行选择,能否提升整体性能?
  • RQ4使用情感感知的数据增强(同义词替换、反向翻译)作为预训练任务,能否增强跨领域情感分类中的可迁移性?
  • RQ5在大标签分布偏移下,避免分布匹配在多大程度上提升了模型的鲁棒性?

主要发现

  • 领域内对比学习通过减少跨领域差异并提升目标域上正样本与负样本聚类之间的边缘分离,优于标准对比学习。
  • 在大标签分布偏移下,熵最小化表现欠佳,因其使模型偏向目标域中的多数类,导致性能下降。
  • 当标签分布偏移较大时(如K→D中的7.39:1),领域内对比学习最为有效,能防止边界样本的误分类。
  • 自适应策略——在小偏移时使用熵最小化,在大偏移时使用领域内对比学习——在各基准上均取得了最佳整体性能。
  • t-SNE可视化结果证实,当同时应用领域内对比学习与熵最小化时,目标域上正负聚类之间的边缘被显著扩大。
  • 该模型在标准跨领域情感分类基准上取得了新的最先进结果,证明了所提方法相对于强基线的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。