[論文レビュー] Text Classification Using Label Names Only: A Language Model Self-Training Approach
この論文では、ラベル名(例:'スポーツ'、'政治')のみを用いて、完全にラベルなしのデータで学習する弱教師ありテキスト分類モデルであるLOTClassを提案する。事前学習済み言語モデルを用いてカテゴリを示す語を特定し、文脈化された単語レベルのカテゴリ予測による自己学習を行うことで、AG News や IMDB といったベンチマークデータセットで、ラベル付き文書を一切使用せずに約90%の精度を達成し、既存の弱教師あり手法を上回り、教師ありベースラインと同等の性能を発揮する。
Current text classification methods typically require a good number of human-labeled documents as training data, which can be costly and difficult to obtain in real applications. Humans can perform classification without seeing any labeled examples but only based on a small set of words describing the categories to be classified. In this paper, we explore the potential of only using the label name of each class to train classification models on unlabeled data, without using any labeled documents. We use pre-trained neural language models both as general linguistic knowledge sources for category understanding and as representation learning models for document classification. Our method (1) associates semantically related words with the label names, (2) finds category-indicative words and trains the model to predict their implied categories, and (3) generalizes the model via self-training. We show that our model achieves around 90% accuracy on four benchmark datasets including topic and sentiment classification without using any labeled documents but learning from unlabeled data supervised by at most 3 words (1 in most cases) per class as the label name.
研究の動機と目的
- テキスト分類における人的ラベル付きデータの高コストを軽減するため、モデルがラベル名のみから学習できる仕組みを提供すること。
- 事前学習済み言語モデルが、ラベル名から導かれる単語レベルの監視情報のみで、効果的な分類を実現できるかを検証すること。
- 単語レベルのカテゴリ理解を文書レベル分類に一般化する自己学習フレームワークを開発すること。
- 遠隔監視やデータ拡張に依存する既存の弱教師あり手法を上回ること。
提案手法
- 事前学習済み言語モデルを用いて、ラベル名に関連する意味的関連語を特定し、各クラスごとにカテゴリ語彙を構築する。
- マスクされたカテゴリ予測(MCP)タスクを通じて、文脈に基づいて語の示唆されるカテゴリを言語モデルが予測できるように学習する。
- 学習済みモデルを用いて、ラベルなし文書に対して高信頼度の予測を生成し、自己学習に活用する。
- 自己学習中に予測のターゲット分布を段階的に精練することで、一般化性能を向上させる。
- 最新のモデルバージョンがラベルなしデータに対して生成した予測を用いて、モデルを更新する自己学習目的関数を適用する。
- 事前学習済み言語モデルの文脈化された表現を活用し、正確な分類に寄与する長距離の意味的依存関係を捉える。
実験結果
リサーチクエスチョン
- RQ1ラベル名とラベル付き文書を一切使用せずに、テキスト分類モデルが高精度を達成できるか?
- RQ2事前学習済み言語モデルが、ラベル名から導かれる単語レベルの監視情報のみで、カテゴリの違いを効果的に学習できるか?
- RQ3ラベル名のみを監視情報として用いる場合、ラベルなしデータ上で自己学習を実施することで性能が著しく向上するか?
- RQ4低リソース環境下で、提案手法が既存の弱教師ありおよび半教師あり手法と比較してどのように性能を発揮するか?
主な発見
- LOTClassは、ラベル付き文書を一切使用せずに、4つのベンチマークデータセット(AG News、DBPedia、IMDB、Amazon)で約90%の精度を達成する。
- 遠隔監視やデータ拡張技術に依存する既存の弱教師あり手法を上回る。
- 自己学習により性能が著しく向上し、モデルが予測を精練するに従って精度が段階的に向上する。
- 単純なラベル名マッチングで微調整したBERTを上回ることから、文脈化された単語レベルの監視が不可欠であることが示された。
- マスクされたカテゴリ予測を通じてカテゴリを示す語を学習した後、モデルは文書レベル分類にうまく一般化する。
- 1クラスあたり1語のみをラベル名として使用しても性能が高く維持されることから、ラベル名が効果的な監視情報であることが強調される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。