Skip to main content
QUICK REVIEW

[論文レビュー] An Effective Label Noise Model for DNN Text Classification

Ishan Jindal, Daniel Pressel|arXiv (Cornell University)|Mar 18, 2019
Machine Learning and Data Classification参考文献 37被引用数 5
ひとこと要約

本稿では、テキスト分類のためのCNNに統合された非線形ノイズモデル層を提案し、ラベルノイズをモデル化・緩和するためにネットワークと共同で訓練する。適切な初期化と正則化を施すことにより、極端なラベルノイズ下でもモデルは頑健な文表現を学習でき、標準的なDNNと比較して一般化性能が著しく向上する。

ABSTRACT

Because large, human-annotated datasets suffer from labeling errors, it is crucial to be able to train deep neural networks in the presence of label noise. While training image classification models with label noise have received much attention, training text classification models have not. In this paper, we propose an approach to training deep networks that is robust to label noise. This approach introduces a non-linear processing layer (noise model) that models the statistics of the label noise into a convolutional neural network (CNN) architecture. The noise model and the CNN weights are learned jointly from noisy training data, which prevents the model from overfitting to erroneous labels. Through extensive experiments on several text classification datasets, we show that this approach enables the CNN to learn better sentence representations and is robust even to extreme label noise. We find that proper initialization and regularization of this noise model is critical. Further, by contrast to results focusing on large batch sizes for mitigating label noise for image classification, we find that altering the batch size does not have much effect on classification performance.

研究の動機と目的

  • 人為的なラベル誤りによって汚染された大規模なテキストデータセット上で深層ニューラルネットワークを学習するという課題に対処すること。
  • 一般的にモデル性能を低下させるノイズの多いラベルが存在する状況下でも、文表現学習を改善すること。
  • 補助的なクリーンデータを必要としない手法を開発し、ノイズありラベルから直接頑健な学習を可能にすること。
  • 初期化、正則化、ミニバッチサイズがテキスト分類におけるノイズ耐性に与える影響を調査すること。

提案手法

  • CNNの上に配置された非線形ノイズモデル層を導入し、学習中にラベルノイズの統計をモデル化する。
  • ノイズモデルとCNNの重みを、ノイズありの訓練データ上でバックプロパゲーションを用いて共同最適化する。
  • ノイズモデルはラベルの入れ替え確率を表す遷移行列を学習し、効果的にラベルのノイズ除去演算子として機能する。
  • ノイズモデル層の適切な初期化が、ノイズありラベルへの過学習を防ぐために不可欠である。
  • ノイズモデルに正則化技術を適用し、一般化性能を向上させ、誤ったラベルの記憶を防ぐ。
  • 特徴表現の可視化と学習済み埋め込み表現に対するSVMの微調整を通じて、ノイズモデルの有効性を評価する。

実験結果

リサーチクエスチョン

  • RQ1人工的に注入されたラベルノイズを伴うテキスト分類タスクにおいて、非線形ノイズモデル層は深層ニューラルネットワークの性能を向上させることができるか?
  • RQ2ノイズモデルの初期化と正則化は、極端なラベルノイズに対する耐性にどのように影響するか?
  • RQ3ミニバッチサイズを変更すると、ラベルノイズありのテキスト分類タスクにおけるモデル性能に顕著な影響を与えるか?
  • RQ4標準的なDNNと比較して、ノイズモデルは学習済み文表現の質をどの程度向上させるか?
  • RQ5ノイズモデルは効果的にラベルをノイズ除去し、ノイズありの教師信号にもかかわらず、真の潜在的パターンをベースネットワークが学習するのを支援できるか?

主な発見

  • SST-2で40%のラベルノイズを想定した場合、提案手法は83.25%の精度を達成し、ベースモデル(70.24%)およびノイズモデルなしのモデル(70.95%)を上回った。
  • AG-Newsで70%のノイズを想定した場合、本手法は90.33%の精度に達し、ベースライン(59.70%)およびノイズモデルなしのモデル(52.44%)を著しく上回った。
  • ノイズモデルの適切な初期化と正則化が不可欠である。それらが欠如すると、極端なノイズ下でも一般化が失敗する。
  • ミニバッチサイズは性能にほとんど影響を与えないが、画像分類とは対照的に、大規模なミニバッチサイズがラベルノイズの緩和に寄与するとは限らない。
  • t-SNE可視化では、ノイズモデルにより特徴空間における真のクラスラベルのクラスタリングがより明確にされ、ベースモデルはノイズありで誤ってクラスタリングされた表現を学習していることが明らかになった。
  • 提案手法の特徴表現上で学習されたSVMは、より良い一般化性能を示した。真のラベルで学習したSVMはSST-2で83.25%の精度を達成し、提案手法の性能と一致した。これは、効果的な特徴学習が行われていることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。