Skip to main content
QUICK REVIEW

[論文レビュー] X-Class: Text Classification with Extremely Weak Supervision

Zihan Wang, Dheeraj Mekala|arXiv (Cornell University)|Oct 24, 2020
Topic Modeling参考文献 19被引用数 7
ひとこと要約

X-Class は、分類名のみを監視情報として用いる新しい枠組みを提案する。BERTに基づく適応的表現とクラスタリングを活用し、高品質な偽ラベル付き学習データを生成する。7つのベンチマークデータセットにおいて最先端の性能を達成し、初期語やラベル付き例を一切必要としないにもかかわらず、シード語駆動の弱教師あり手法を上回る。

ABSTRACT

In this paper, we explore text classification with extremely weak supervision, i.e., only relying on the surface text of class names. This is a more challenging setting than the seed-driven weak supervision, which allows a few seed words per class. We opt to attack this problem from a representation learning perspective -- ideal document representations should lead to nearly the same results between clustering and the desired classification. In particular, one can classify the same corpus differently (e.g., based on topics and locations), so document representations should be adaptive to the given class names. We propose a novel framework X-Class to realize the adaptive representations. Specifically, we first estimate class representations by incrementally adding the most similar word to each class until inconsistency arises. Following a tailored mixture of class attention mechanisms, we obtain the document representation via a weighted average of contextualized word representations. With the prior of each document assigned to its nearest class, we then cluster and align the documents to classes. Finally, we pick the most confident documents from each cluster to train a text classifier. Extensive experiments demonstrate that X-Class can rival and even outperform seed-driven weakly supervised methods on 7 benchmark datasets. Our dataset and code are released at https://github.com/ZihanWangKi/XClass/ .

研究の動機と目的

  • 分類名のみが監視情報として提供される極めて弱い教師あり設定におけるテキスト分類を解決すること。初期語やラベル付きドキュメントは一切不要である。
  • ユーザーが指定した分類名に適応する文書表現学習フレームワークを構築し、クラスタリングが望ましい分類目的と整合するようにすること。
  • クラスタリングから自動的に高品質な偽トレーニングデータを生成できることを示し、人為的アノテーションを最小限に抑えた強力な性能を達成できることを示すこと。
  • 多様なデータタイプと分類カテゴリ(トピック、場所、感情など)をカバーする、極めて弱い教師あり設定におけるテキスト分類のベンチマークを確立すること。

提案手法

  • 不一致が生じるまで、各分類に対して類似度が最も高い語を繰り返し追加することで、分類指向の表現を推定する。
  • BERT からの文脈付き語表現の重み付き平均として、文書表現を、分類に特化した混合注意メカニズムを用いて計算する。
  • 初期表現に基づき、ドキュメントを最も近い分類に事前割り当てすることで、GMM などのクラスタリングを初期化する。
  • K 個のクラスタ(K は分類数)にドキュメントをクラスタリングし、初期事前割り当てを維持することで、クラスタと分類の対応を保つ。
  • 各クラスタから信頼度の高いドキュメントを選別し、スコア付きラベル付き学習データセットを構築する。その後、BERT などの監視付き分類器の微調整に用いる。
  • 偽ラベル付きデータ上で最終的なテキスト分類器を学習し、事前学習済み言語モデルを活用して強力な一般化性能を達成する。

実験結果

リサーチクエスチョン

  • RQ1初期語やラベル付き例が一切ない状況でも、分類名のみを監視情報として用いてテキスト分類を効果的に行うことができるか?
  • RQ2文書表現をどのようにしてユーザー指定の分類名に適応させれば、望ましい分類目的と整合するクラスタリングを実現できるか?
  • RQ3クラスタリングに基づく偽ラベル付与によって、ゼロショットまたはフェイントショット設定でも強力な性能を達成できる高品質な学習データを生成できるか?
  • RQ4人為的シードが提供されない状況において、提案手法の性能はシード語駆動の弱教師あり手法と比べてどうなるか?

主な発見

  • X-Class は、初期語を一切必要としないにもかかわらず、WeSTClass や ConWea を含む 7 つのベンチマークデータセットにおいて、シード語駆動の弱教師あり手法を上回る性能を示した。
  • NYT-Small データセットでは、X-Class-Hier が微細分類で 92.66 の micro-F1 と 80.92 の macro-F1 を達成し、X-Class-End や他のベースラインを上回った。
  • X-Class は、分類名がコーパスに一度しか現れない場合でも、頑健に動作する。これは、頻度の高いまたは多様な文脈での出現に依存する手法とは対照的である。
  • ニュースやレビューなど多様なデータタイプ、トピック、場所、感情など多様な分類タイプにおいて、強力な性能を発揮した。
  • 複数のデータセットにわたる一貫性と安定性のある性能を示しており、極めて弱い教師あり設定下での一般化能力を裏付けている。
  • 階層的分類設定においても、微細な分類同士の類似度が著しく異なる状況でも、本フレームワークは有効であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。