Skip to main content
QUICK REVIEW

[論文レビュー] LST: Lexicon-Guided Self-Training for Few-Shot Text Classification

Hazel Kim, Jaeman Son|arXiv (Cornell University)|Feb 5, 2022
Text and Document Classification Technologies被引用数 4
ひとこと要約

LSTは、注意重み付き頻出語を用いて語彙を精錬し、語彙に基づくデータ拡張を適用することで、言語的豊富な語彙知識を統合することにより、擬似ラベルの信頼性を向上させる少数-shotテキスト分類のための語彙誘導型自己学習手法を提案する。LSTは、1クラスあたり30件のラベル付きデータでの5つのベンチマークデータセットにおいて、先行手法を1.0–2.0%上回る最先端の性能を達成する。

ABSTRACT

Self-training provides an effective means of using an extremely small amount of labeled data to create pseudo-labels for unlabeled data. Many state-of-the-art self-training approaches hinge on different regularization methods to prevent overfitting and improve generalization. Yet they still rely heavily on predictions initially trained with the limited labeled data as pseudo-labels and are likely to put overconfident label belief on erroneous classes depending on the first prediction. To tackle this issue in text classification, we introduce LST, a simple self-training method that uses a lexicon to guide the pseudo-labeling mechanism in a linguistically-enriched manner. We consistently refine the lexicon by predicting confidence of the unseen data to teach pseudo-labels better in the training iterations. We demonstrate that this simple yet well-crafted lexical knowledge achieves 1.0-2.0% better performance on 30 labeled samples per class for five benchmark datasets than the current state-of-the-art approaches.

研究の動機と目的

  • 限定的なラベル付きデータからの信頼性の低い擬似ラベルによる自己学習における過信と誤りの伝搬を緩和すること。
  • モデルの信頼度を超えた構造的語彙知識を統合することで、少数-shotテキスト分類における擬似ラベルの信頼性を向上させること。
  • 語彙を用いた信頼度正則化、選択的サンプリング、ノイズ注入を実現する、シンプルでありながら効果的な手法の開発。
  • 意味的に意味のある語彙階層(類義語、上位語など)を有する精錬済み語彙が、最小限のラベル付きデータでもモデルの一般化性能を向上させることの実証。
  • データ拡張による語彙知識の統合が、未観測例に対するモデルの頑健性と性能を向上させることの実証。

提案手法

  • 各クラスの上位注意重み付き語を用いて、ゴールデンラベル付きデータから初期語彙を構築し、代表的な語を捉える。
  • 最も信頼度の高い注意重み付き語から、頻出語の上位k%を選択することで、語彙を精錬し、カバー範囲と信頼性のバランスを取る。
  • 精錬済み語彙を信頼度制御器として用い、擬似ラベルのフィルタリングとガイドラインを提供し、誤った予測における過信を軽減する。
  • 語彙との整合性を持つ語を含む未ラベル例を優先してサンプリングすることで、選択的サンプリングを実装し、学習データの情報量を向上させる。
  • WordNetを用いて入力テキストの意味的に類似するバリエーションを生成するデータ拡張を適用し、語彙を豊かにし、一般化性能を向上させる。
  • 教師-生徒フレームワークにおいて、語彙を反映した擬似ラベルとラベル付きデータの両方から学習する生徒モデルを反復的に更新し、語彙を再精錬する。

実験結果

リサーチクエスチョン

  • RQ1モデルの信頼度を超えて、言語的豊富な語彙が、少数-shotテキスト分類における擬似ラベルの信頼性を向上させ得るか?
  • RQ2語彙との整合性に基づく選択的サンプリングが、リソースが限られた環境における自己学習の性能に与える影響はいかほどか?
  • RQ3語彙的データ拡張が、自己学習におけるモデルの一般化性能を向上させ、誤りの蓄積を軽減する程度はどの程度か?
  • RQ4少数-shot学習における性能を最大化するための、語彙サイズと語の信頼度の最適なバランスは何か?
  • RQ5自己学習におけるテキスト分類において、語彙知識を信頼度制御器として統合することは、複雑な正則化手法を上回る性能を発揮するか?

主な発見

  • LSTは5つのベンチマークデータセットにおいて、1クラスあたり30件のラベル付きデータでのみ、既存の自己学習手法を1.0–2.0%上回る最先端の性能を達成する。
  • 上位10%の頻出語を高注意語から選択して語彙を精錬した場合に最良の性能が得られ、1%や50%、100%の語彙サイズよりも優れている。
  • データ拡張を用いないLSTでも、標準的な自己学習を平均3ポイント上回り、語彙が擬似ラベル品質の向上に不可欠であることを確認する。
  • 語彙的データ拡張は、語彙を豊かにし、意味的に有意義な未ラベル例を識別する能力を向上させることで、約1%の精度向上をもたらす。
  • 精錬済み語彙は、効果的な信頼度制御器および選択的サンプリング手法として機能し、誤りの伝搬を低減し、モデルの一般化性能を向上させる。
  • この手法は、強力なデータ拡張ベースラインであるUDAを平均3ポイント以上上回り、語彙誘導型学習の優位性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。