Skip to main content
QUICK REVIEW

[論文レビュー] To Softmax, or not to Softmax: that is the question when applying Active Learning for Transformer Models

Julius Gonsior, Christian Falkenberg|arXiv (Cornell University)|Oct 6, 2022
Natural Language Processing Techniques参考文献 30被引用数 5
ひとこと要約

この論文は、Transformer モデルにおけるアクティブラーニングの不確実性推定手法を調査し、標準的なソフトマックスが外れ値を過剰に選択することを発見した。これを解決するために、最も不確実性の高い上位-k 個のサンプルを無視する単純なヒューリスティック「不確実性クリッピング」を提案する。この手法は、ソフトマックスを含むすべての手法において性能を向上させ、特にソフトマックスと組み合わせた場合でも競争力を持つ。

ABSTRACT

Despite achieving state-of-the-art results in nearly all Natural Language Processing applications, fine-tuning Transformer-based language models still requires a significant amount of labeled data to work. A well known technique to reduce the amount of human effort in acquiring a labeled dataset is extit{Active Learning} (AL): an iterative process in which only the minimal amount of samples is labeled. AL strategies require access to a quantified confidence measure of the model predictions. A common choice is the softmax activation function for the final layer. As the softmax function provides misleading probabilities, this paper compares eight alternatives on seven datasets. Our almost paradoxical finding is that most of the methods are too good at identifying the true most uncertain samples (outliers), and that labeling therefore exclusively outliers results in worse performance. As a heuristic we propose to systematically ignore samples, which results in improvements of various methods compared to the softmax function.

研究の動機と目的

  • 微調整された Transformer モデルに適用した際のアクティブラーニング(AL)の性能が著しく低い問題に対処すること。特に、不確実性推定にソフトマックスに依存する場合に顕著である。
  • Transformer ベースの NLP モデルにおける AL の文脈で、ソフトマックスを越える8つの代替不確実性推定手法を評価すること。
  • なぜ不確実性に基づく AL 策略が、特に学習が難しい外れ値(ハードな外れ値)を過剰に選択するため、Transformer ではしばしば失敗するのかを調査すること。
  • 不確実性の高いサンプルを体系的に無視することで、AL の性能を向上させるシンプルで効果的なヒューリスティック「不確実性クリッピング」を提案・検証すること。
  • 補正機構(例:不確実性クリッピング)と組み合わせた場合、ベーシックなソフトマックス関数が、Transformer における AL で依然として有効な選択肢であるかどうかを特定すること。

提案手法

  • 著者たちは8つの不確実性推定手法を比較した:ソフトマックス、モンテカルロドロップアウト、TrustScore、ラベルスムージング、ディープジニ、証拠ニューラルネットワーク、ソフトマックスアンサンブル、および温度スケーリング付きソフトマックス。
  • これらの手法を、BERT および RoBERTa をベースモデルとして用いた標準的なプールベースのアクティブラーニングサイクルに適用し、7つのテキスト分類データセットで評価した。
  • 主なイノベーションは「不確実性クリッピング(UC)」であり、ラベル付けの前にクエリバッチから最も不確実性の高い上位-k 個のサンプルを除外することで、外れ値への過剰依存を防ぐ。
  • この手法は、モデルの不確実性スコアに対して後処理として実装されており、アーキテクチャの変更や追加学習を必要としない。
  • 性能評価は、ラベルの予算内での精度、クラス分布の変化、複数の AL イテレーションにおける実行時間効率を用いて行った。
  • 実験ではエンドツーエンドの訓練と評価を実施し、実行時間はモデル微調整とは別に測定した。

実験結果

リサーチクエスチョン

  • RQ1なぜ不確実性に基づくアクティブラーニング戦略は、微調整された Transformer モデルに適用した際、性能向上を示さないのか?
  • RQ2代替の不確実性推定手法は、Transformer モデルにおけるアクティブラーニングで、ベーシックなソフトマックスと比べてどの程度優れているのか?
  • RQ3高不確実性(外れ値)のサンプルの選択が、Transformer におけるアクティブラーニングの性能に及ぼす悪影響はどの程度強いのか?
  • RQ4不確実性クリッピングのようなシンプルなヒューリスティックは、高不確実性(外れ値)のサンプルの選択がもたらす悪影響を緩和できるか?
  • RQ5補正機構(例:不確実性クリッピング)と組み合わせた場合、ベーシックなソフトマックス関数は、アクティブラーニングにおける不確実性推定に有効な選択肢のまま残るのか?

主な発見

  • 理論的に欠陥があるにもかかわらず、不確実性クリッピングと組み合わせたベーシックなソフトマックス関数は、Transformer におけるアクティブラーニングで競争力のある性能を示した。
  • モンテカルロドロップアウト や 証拠ニューラルネットワーク を含む大多数の代替手法は、外れ値の過剰選択により、ランダムサンプリングよりも性能が劣った。
  • 不確実性クリッピングは、ソフトマックスを含むすべての不確実性推定手法において、極端な外れ値のクエリバッチへの含みを減らすことで、性能を顕著に向上させた。
  • この手法は計算的に効率的であり、再訓練やアーキテクチャの変更を必要としないため、既存の AL パイプラインへの統合が容易である。
  • 不確実性クリッピングの下では、クエリバッチ内のラベル分布のシフトが減少し、クラス間でよりバランスの取れたサンプリングが実現していることが示された。
  • 実行時間分析では、アンサンブルベースの手法(例:ソフトマックスアンサンブル)は実行不可能なほど遅く、他の手法(例:モンテカルロドロップアウト や TrustScore)は僅かなオーバーヘッドしか発生しなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。