Skip to main content
QUICK REVIEW

[論文レビュー] Label Confusion Learning to Enhance Text Classification Models

Biyang Guo, Songqiao Han|arXiv (Cornell University)|Dec 9, 2020
Text and Document Classification Technologies被引用数 4
ひとこと要約

本稿では、テキスト分類モデルの新たな向上手法として、ラベルの1-of-K表現を、インスタンスとラベル間の意味的類似度に基づいて学習するラベル誤り分布(LCD)に置き換えるLabel Confusion Learning(LCM)を提案する。ラベルの重複や依存関係をモデル化することで、特に誤りや混乱が多いデータセットにおいて、ラベルスムージングやLSTM、CNN、BERTといったブースティングモデルを凌駕する性能を発揮し、英語および中国語の5つのベンチマークデータセットで優れた結果を示した。

ABSTRACT

Representing a true label as a one-hot vector is a common practice in training text classification models. However, the one-hot representation may not adequately reflect the relation between the instances and labels, as labels are often not completely independent and instances may relate to multiple labels in practice. The inadequate one-hot representations tend to train the model to be over-confident, which may result in arbitrary prediction and model overfitting, especially for confused datasets (datasets with very similar labels) or noisy datasets (datasets with labeling errors). While training models with label smoothing (LS) can ease this problem in some degree, it still fails to capture the realistic relation among labels. In this paper, we propose a novel Label Confusion Model (LCM) as an enhancement component to current popular text classification models. LCM can learn label confusion to capture semantic overlap among labels by calculating the similarity between instances and labels during training and generate a better label distribution to replace the original one-hot label vector, thus improving the final classification performance. Extensive experiments on five text classification benchmark datasets reveal the effectiveness of LCM for several widely used deep learning classification models. Further experiments also verify that LCM is especially helpful for confused or noisy datasets and superior to the label smoothing method.

研究の動機と目的

  • ラベルの独立性を仮定する1-of-Kラベル表現の限界を解決し、類似ラベル間の意味的重複を捉えられない点を是正する。
  • 人為的アノテーションデータセットにおけるノイズや曖昧なラベルが原因で生じるモデルの過信と過学習を軽減する。
  • 真のラベルの依存関係を反映するより現実的なラベル分布を学習することで、テキスト分類の一般化性能を向上させる。
  • 従来の深層学習モデルのアーキテクチャを変更せず、推論コストを増加させない、プラグイン型のコンponent(LCM)を開発する。
  • LCMの有効性を、高頻度の混乱やラベルノイズを含む多様なデータセットにおいて実証し、画像分類タスクへの応用可能性を拡張する。

提案手法

  • 共有の埋め込み層を用いてラベル表現を学習し、入力テキスト表現とラベル埋め込みとの間の意味的類似度を計算する。
  • すべてのラベルにおける類似度スコアを集約することで、ラベル誤り分布(LCD)を構築し、入力インスタンスに対する各ラベルの依存関係を捉える。
  • 学習可能なパラメータαを用いて、元の1-of-KラベルベクトルとLCDを結合し、ソフトマックスを適用してシミュレートラベル分布(SLD)に正規化する。
  • 訓練中に交差エントロピー損失のターゲットとしてSLDを用い、標準的な1-of-Kベクトルに代えて、より情報量の多い監視信号を提供する。
  • LCMを訓練時のみに適用する軽量でトレーニング可能なコンponentとして統合し、推論時やモデル構造に変更を加えない。これにより、即座に統合可能な拡張が可能となる。
  • LCMの訓練に早期停止を適用し、特に後期の訓練段階でモデルが劣化し始めるのを防ぐ。

実験結果

リサーチクエスチョン

  • RQ1学習された意味的類似度を用いてラベル誤りをモデル化することで、標準的な1-of-Kラベル化を上回るテキスト分類性能が向上するか?
  • RQ2ラベル類似度が高い(すなわち混乱しやすい)データセットにおいて、LCMはラベルスムージングや標準的訓練法と比較してどのように性能を発揮するか?
  • RQ3LCMは、ラベル誤りを含むノイズの多いデータセットにおいて、過学習を効果的に軽減し、耐性を向上させるか?
  • RQ4LCMはテキスト分類を越えて、画像分類などの他のタスクにも一般化可能か?
  • RQ5ハイパーパrameter(例:α)や訓練戦略(例:早期停止)は、異なるデータセットにおいてLCMの性能を最適化するためにどのように最適化されるか?

主な発見

  • LCMは、LSTM、CNN、BERTモデルを含む5つのベンチマークテキスト分類データセット(IMDB、20NG、中国語データセットを含む)で、顕著な分類精度の向上を達成した。
  • 高頻度の混乱が生じるデータセット(例:8NG-H、4NG-H)では、LCMが顕著な向上を示し、最大で3.5%の改善を達成した。一方、簡単で混乱の少ないデータセット(例:4NG-E)では、最小限または負の向上にとどまった。
  • LCMは、常にラベルスムージング(LS)を上回った。特にノイズが多い環境下(20NGで20%のノイズ)では、LSよりも2%以上の精度向上を達成した。
  • 画像分類においても、LCMはMNISTでベースラインCNNの98.22%から98.41%へ、Fashion MNISTでは89.29%から90.28%へとテスト精度を向上させ、多分野への応用可能性を裏付けた。
  • LCMの訓練に早期停止を適用することで、過学習を防止し、性能をさらに向上させることができた。特に、LCMを約10エポック後に無効化した場合に最適な結果が得られた。
  • 混乱やノイズの多いデータセットでは、αの値を小さく(例:0.5)することで、一般により良い結果が得られ、ラベル類似度や誤差率に敏感であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。