Skip to main content
QUICK REVIEW

[論文レビュー] Few-Shot Text Classification with Pre-Trained Word Embeddings and a Human in the Loop

Katherine Bailey, Sunny Chopra|arXiv (Cornell University)|Apr 5, 2018
Topic Modeling参考文献 3被引用数 6
ひとこと要約

本稿では、1〜2例のラベル付き例で分類可能な、人間が関与する少样本テキスト分類手法を提案する。事前学習済み単語埋め込みとコサイン類似度を用い、1〜2例のラベル付き例で全ドキュメントバッチを分類する。LDAを用いてトピックを推定し、TF-IDF重みを付けて単語埋め込みを平均化することで、少数の明確なカテゴリを持つデータセットで最大97%の精度を達成し、リソースが限られた分類タスクの実現可能性を示した。

ABSTRACT

Most of the literature around text classification treats it as a supervised learning problem: given a corpus of labeled documents, train a classifier such that it can accurately predict the classes of unseen documents. In industry, however, it is not uncommon for a business to have entire corpora of documents where few or none have been classified, or where existing classifications have become meaningless. With web content, for example, poor taxonomy management can result in labels being applied indiscriminately, making filtering by these labels unhelpful. Our work aims to make it possible to classify an entire corpus of unlabeled documents using a human-in-the-loop approach, where the content owner manually classifies just one or two documents per category and the rest can be automatically classified. This "few-shot" learning approach requires rich representations of the documents such that those that have been manually labeled can be treated as prototypes, and automatic classification of the rest is a simple case of measuring the distance to prototypes. This approach uses pre-trained word embeddings, where documents are represented using a simple weighted average of constituent word embeddings. We have tested the accuracy of the approach on existing labeled datasets and provide the results here. We have also made code available for reproducing the results we got on the 20 Newsgroups dataset.

研究の動機と目的

  • ラベルがほとんどないもしくは全くない状況において、産業分野での大規模な未ラベル付きドキュメントコーパスを分類する課題に対処すること。
  • 少样本学習と人間が関与するカテゴリ代表の選択を活用し、最小限の人的ラベル付けで正確なテキスト分類を可能にすること。
  • 事前学習済み単語埋め込みとLDAベースのトピックモデリングが、少样本分類のための高品質なカテゴリプロトタイプを特定するのにどの程度有効であるかを評価すること。
  • 本手法のスケーラビリティと、数個のカテゴリより多いデータセットへの限界を調査すること。
  • 今後の研究において、ガイド付きまたはニューラルトピックモデルを用いてトピック推定を改善し、プロトタイプ選択を支援すること。

提案手法

  • ドキュメントは、TF-IDFを用いて頻出語を軽減した、事前学習済み単語埋め込みの重み付き平均で埋め込み化される。
  • 各バッチに対して、潜在ディリクレ割り当て(LDA)を適用し、各カテゴリの代表ドキュメントを特定し、人間のユーザーに提示する。
  • ユーザーが1〜2件のドキュメントを手動でラベル付けし、その埋め込みを平均化してカテゴリプロトタイプベクトルを形成する。
  • 未ラベルドキュメントは、その埋め込みと各カテゴリプロトタイプとのコサイン類似度を計算し、類似度が最も高いものに分類を割り当てる。
  • ドキュメント埋め込みにPCAを適用しているが、実験では単純な平均化に比べて精度向上がほとんど見られない。
  • 本手法は20 NewsgroupsとDBPediaのサブセットで評価され、小規模なサブセットにおける最大達成可能精度を確認するためにブルートフォーステストが用いられた。

実験結果

リサーチクエスチョン

  • RQ11〜2例のラベル付き例でのみ分類可能な少样本テキスト分類システムが、高い精度を達成できるか?
  • RQ2LDAは、高品質なカテゴリプロトタイプとして適した代表ドキュメントを効果的に特定できるか?
  • RQ3TF-IDF重み付き事前学習済み単語埋め込みとコサイン類似度を用いることで、少样本状況でも競争力のある分類性能が得られるか?
  • RQ44〜5個以上のカテゴリを持つデータセットに適用した場合、本手法にどのような限界があるか?
  • RQ5ガイド付きまたはニューラルトピックモデルを用いることで、今後の研究においてトピック推定ステップを改善し、プロトタイプ選択をより効果的にできるか?

主な発見

  • 最適なカテゴリ代表を採用した場合、DBPediaデータセットの4カテゴリサブセットで最大97%の精度を達成した。
  • LDAは多くの場合、良い代表ドキュメントを特定するのに有効であったが、性能は変動し、ときにはトピックを明確に分離できなかった。
  • ドキュメント埋め込みにPCAを適用しても、単純な単語埋め込みの平均化に比べて分類精度の向上はほとんど得られなかった。
  • 単語の使用が明確にクラスを区別する2〜3つの明確なカテゴリを持つデータセットで、本手法は最も効果を発揮した。
  • 相反する語の使用がトピックの立場を反映するため、二値分類タスク(例:スタンス検出)においても本手法は有望であることが示された。
  • 今後の改善は、ガイド付きLDA、ガウス型LDA、またはProdLDAのようなニューラルトピックモデルによるトピック推定の強化によって期待できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。