Skip to main content
QUICK REVIEW

[论文解读] Heavy-tailed Representations, Text Polarity Classification & Data Augmentation

Hamid Jalalzai, Pierre Colombo|arXiv (Cornell University)|Mar 25, 2020
Topic Modeling被引用 13
一句话总结

本文提出了一种名为学习重尾表征(LHTR)的新颖对抗性方法,可将文本嵌入转换为满足多元极值理论(EVT)正则性条件的重尾分布。通过利用LHTR中角度分量的尺度不变性,该框架实现了对极端文本样本的改进分类,并提出了一种新颖的标签保持型数据增强方法(GENELIEX),该方法通过缩放高范数序列生成语义有意义且情感一致的文本,其在情感分类任务上优于基线模型。

ABSTRACT

The dominant approaches to text representation in natural language rely on learning embeddings on massive corpora which have convenient properties such as compositionality and distance preservation. In this paper, we develop a novel method to learn a heavy-tailed embedding with desirable regularity properties regarding the distributional tails, which allows to analyze the points far away from the distribution bulk using the framework of multivariate extreme value theory. In particular, a classifier dedicated to the tails of the proposed embedding is obtained which performance outperforms the baseline. This classifier exhibits a scale invariance property which we leverage by introducing a novel text generation method for label preserving dataset augmentation. Numerical experiments on synthetic and real text data demonstrate the relevance of the proposed framework and confirm that this method generates meaningful sentences with controllable attribute, e.g. positive or negative sentiment.

研究动机与目标

  • 解决NLP模型在分类分布尾部的罕见、高范数文本样本时缺乏鲁棒性的问题。
  • 开发一种将标准文本嵌入(如BERT)转换为适合极值理论(EVT)分析的重尾分布的方法。
  • 利用学习表征中角度分量的尺度不变性,实现标签保持型数据增强。
  • 通过实证验证,极端文本(按范数衡量)更难建模和分类,从而证明需专门设计极端区域分类器的合理性。
  • 证明长序列与高BERT范数在LHTR空间中与极端行为显著相关。

提出的方法

  • LHTR采用对抗性训练策略,学习一种将输入文本嵌入映射到具有幂律尾部行为的重尾分布的变换。
  • 该方法确保变换后向量的角度分量 Θ(x) = ||x||⁻¹x 能够捕捉极端行为,从而支持基于EVT的分类。
  • 在尾部区域 {||x|| ≥ t} 上训练专用角度分类器,其中 t 为高阈值(例如,范数的第25百分位数),并利用尺度不变性。
  • 该框架支持一种新颖的数据增强方法GENELIEX,通过缩放高范数序列(λ > 1)生成文本,由于尺度不变性,其标签得以保持。
  • 在Yelp和Amazon情感数据集上验证该方法,以BERT嵌入作为输入,通过范数阈值定义极端样本。
  • 使用皮尔逊与斯皮尔曼统计检验评估序列长度、BERT范数、LHTR范数与语言模型损失之间的相关性。

实验结果

研究问题

  • RQ1我们能否学习到一种满足多元极值理论(EVT)正则性假设的文本嵌入重尾表征?
  • RQ2LHTR表征的角度分量是否能提升对极端文本样本(如长序列或稀有序列)的分类性能?
  • RQ3能否利用LHTR表征中的尺度不变性生成保持情感标签的合成文本?
  • RQ4在BERT或LHTR表征中,按范数衡量的极端文本是否更难建模,以下一个词预测损失衡量?
  • RQ5序列长度、BERT范数、LHTR范数与建模难度(LM损失)之间是否存在显著相关性?

主要发现

  • 序列长度、BERT范数、LHTR范数与语言模型损失之间的所有成对相关性均具有统计显著性(p < 10⁻¹⁶),表明存在强烈正相关性。
  • LHTR表征中的极端样本平均长度显著长于非极端样本,Kolmogorov-Smirnov检验拒绝了长度分布相等的原假设(p < 0.05)。
  • LHTR范数与BERT范数高度相关,表明该变换保留了样本按范数大小的相对排序。
  • 高范数文本(极端样本)显著更难建模,表现为更高的下一个词预测损失,证实其复杂性更高。
  • 在极端区域训练的角度分类器在尾部样本上的表现优于标准分类器,验证了在极端NLP任务中采用基于EVT方法的必要性。
  • GENELIEX通过缩放高范数序列成功生成语义合理且情感一致的文本,展示了尺度不变性的实际应用价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。