Skip to main content
QUICK REVIEW

[論文レビュー] Heavy-tailed Representations, Text Polarity Classification & Data Augmentation

Hamid Jalalzai, Pierre Colombo|arXiv (Cornell University)|Mar 25, 2020
Topic Modeling被引用数 13
ひとこと要約

本稿では、多変量極値理論(EVT)の正則性条件を満たす重い尾を持つ分布にテキスト埋め込みを変換するための新規な敵対的手法、Learning a Heavy Tailed Representation(LHTR)を提案する。LHTRの角度成分におけるスケール不変性を活用することで、極端なテキストサンプルの分類性能が向上し、ラベルを保持する新しいデータ拡張手法(GENELIEX)が可能となる。GENELIEXは高ノルムシーケンスをスケーリングすることで、意味的に意味のある、センチメントが一貫したテキストを生成し、感情分類タスクにおいてベースラインを上回る性能を示す。

ABSTRACT

The dominant approaches to text representation in natural language rely on learning embeddings on massive corpora which have convenient properties such as compositionality and distance preservation. In this paper, we develop a novel method to learn a heavy-tailed embedding with desirable regularity properties regarding the distributional tails, which allows to analyze the points far away from the distribution bulk using the framework of multivariate extreme value theory. In particular, a classifier dedicated to the tails of the proposed embedding is obtained which performance outperforms the baseline. This classifier exhibits a scale invariance property which we leverage by introducing a novel text generation method for label preserving dataset augmentation. Numerical experiments on synthetic and real text data demonstrate the relevance of the proposed framework and confirm that this method generates meaningful sentences with controllable attribute, e.g. positive or negative sentiment.

研究の動機と目的

  • 稀で高ノルムのテキストサンプルが分布の尾部に位置する場合にNLPモデルのロバストネスが欠如しているという問題に対処すること。
  • 標準的なテキスト埋め込み(例:BERT)を、極値理論(EVT)分析に適した重い尾を持つ分布に変換する手法を開発すること。
  • 学習済み表現の角度成分におけるスケール不変性を活用して、ラベル保持型のデータ拡張を実現すること。
  • 極端なテキスト(ノルムによるもの)がモデル化および分類に難しいことを実証的に検証し、専用の極地域分類器の必要性を裏付けること。
  • 長文シーケンスおよび高BERTノルムが、LHTR空間における極端な挙動と相関しているかどうかを検証すること。

提案手法

  • LHTRは、入力テキスト埋め込みを重い尾を持つ分布(パワーロー尾挙動を示す)に写像する変換を学習するための敵対的訓練戦略を用いる。
  • この手法により、変換後のベクトルの角度成分Θ(x) = ||x||⁻¹xが極端な挙動を捉え、EVTに基づく分類が可能になる。
  • スケール不変性を活用して、尾領域{||x|| ≥ t}(tは高い閾値、例:ノルムの25百分位数)で動作する専用の角度分類器を訓練する。
  • このフレームワークにより、GENELIEXと呼ばれる新しいデータ拡張手法が可能となり、λ > 1で高ノルムシーケンスをスケーリングすることで、ラベルが保持される。
  • BERT埋め込みを入力として用い、YelpおよびAmazonの感情分類データセットで検証を行い、ノルムに基づく閾値で極端なサンプルを定義する。
  • 系列長、BERTノルム、LHTRノルム、言語モデル損失の間の相関を評価するために、ピアソンおよびスピアマンの検定を用いる。

実験結果

リサーチクエスチョン

  • RQ1多変量極値理論(EVT)の正則性仮定を満たすテキスト埋め込みの重い尾表現を学習することは可能か?
  • RQ2LHTR表現の角度成分は、極端なテキストサンプル(例:長文またはレアシーケンス)の分類を改善できるか?
  • RQ3LHTR表現におけるスケール不変性を活用して、センチメントラベルを保持する合成テキストを生成できるか?
  • RQ4BERTまたはLHTR表現におけるノルムによる極端なテキストは、次トークン予測損失で測定した場合、モデル化がより困難であるか?
  • RQ5系列長、BERTノルム、LHTRノルム、およびモデル化の難易度(LM損失)の間に有意な相関があるか?

主な発見

  • 系列長、BERTノルム、LHTRノルム、言語モデル損失の間のすべてのペアワイズ相関が統計的に有意(p < 10⁻¹⁶)であり、強い正の依存関係を示している。
  • LHTR表現における極端なサンプルは、非極端なサンプルよりも平均的に著しく長く、コルモゴロフ=スミルノフ検定により長さ分布の等価性が棄却された(p < 0.05)。
  • LHTRノルムはBERTノルムと強く相関しており、変換がノルムの大きさによるサンプルの相対的順序を保持していることを示している。
  • 高ノルムテキスト(極端な例)は、より高い次トークン予測損失によって、モデル化が著しく困難であることが裏付けられており、複雑性の増加が確認された。
  • 尾領域で訓練された角度分類器は、通常の分類器よりも尾サンプルで優れた性能を示しており、極値理論に基づく手法が極端なNLPタスクにおいて必要であることを検証した。
  • GENELIEXは、高ノルムシーケンスのスケーリングにより、意味的に意味のある、センチメントが一貫したテキストを効果的に生成でき、スケール不変性の実用的有用性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。