Skip to main content
QUICK REVIEW

[論文レビュー] Natcat: Weakly Supervised Text Classification with Naturally Annotated Datasets.

Zewei Chu, Karl Stratos|arXiv (Cornell University)|Sep 29, 2020
Topic Modeling参考文献 24被引用数 6
ひとこと要約

本稿では、Wikipedia、Reddit、Stack Exchange から自然に発生する文書-カテゴリのペairを活用して、一般向けのテキスト分類器を学習する弱教師ありテキスト分類フレームワークであるNatCatを紹介する。これらのコミュニティがキュレートしたデータセットを学習に用い、11のベンチマークタスクで評価することで、著者らは、異なるデータソースが特定の分類タスクに独自に貢献し、手動でのアノテーションなしでベースライン手法を上回ることを示している。

ABSTRACT

We seek to improve text classification by leveraging naturally annotated data. In particular, we construct a general purpose text categorization dataset (NatCat) from three online resources: Wikipedia, Reddit, and Stack Exchange. These datasets consist of document-category pairs derived from manual curation that occurs naturally by their communities. We build general purpose text classifiers by training on NatCat and evaluate them on a suite of 11 text classification tasks (CatEval). We benchmark different modeling choices and dataset combinations, and show how each task benefits from different NatCat training resources.

研究の動機と目的

  • 手動でのテキストアノテーションの高コストを解消するため、オンラインコミュニティから自然に発生する文書-カテゴリペアを活用すること。
  • Wikipedia、Reddit、Stack Exchange からコミュニティ主導のキュレートを用いて、一般向けテキスト分類データセット(NatCat)を構築すること。
  • これらの自然にアノテートされたデータセットの異なる組み合わせが、多様なテキスト分類タスクのパフォーマンスにどのように寄与するかを評価すること。
  • 特定の分類タスクにおいて、どのデータソースが最も効果的であるかを特定し、弱教師あり学習におけるインformedなリソース選択を可能にすること。

提案手法

  • 著者らは、ユーザーがタグ付けや分類を自発的に行うことで自然に生じるカテゴリを持つ、Wikipedia、Reddit、Stack Exchange から文書-カテゴリペアを収集する。
  • 彼らは、これらの自然にアノテートされたデータポイントを統合して、テキスト分類のための統一された学習コーパスであるNatCatを構築する。
  • 彼らは、BERT や類似するトランスフォーマーに基づくモデルなどの標準的なディープラーニングアーキテクチャを用いて、NatCat上で一般向けテキスト分類器を学習する。
  • 彼らは、11の多様なテキスト分類ベンチマーク(CatEval)で学習済みモデルを評価し、異なるドメインにおけるパフォーマンスを評価する。
  • 各データソース(Wikipedia、Reddit、Stack Exchange)が個々のタスクにおけるモデルパフォーマンスに与える寄与を分析する。
  • 異なるモデリング選択肢とデータセットの組み合わせを比較し、特定の分類タスクにおける最適な構成を同定する。

実験結果

リサーチクエスチョン

  • RQ1自然にアノテートされたデータから構築されたNatCatデータセットは、手動でのラベル付けなしにテキスト分類パフォーマンスをどの程度向上させるか?
  • RQ2Wikipedia、Reddit、Stack Exchange の3つのデータソースの中で、特定のテキスト分類タスクにおいて最も顕著にパフォーマンス向上に寄与するのはどれか?
  • RQ3異なるモデリングアーキテクチャとデータセットの組み合わせは、多様なNLPタスクにおける分類パフォーマンスにどのように影響するか?
  • RQ4NatCat上で学習された単一の一般向け分類器は、複数の下流タスクに効果的に一般化できるか?

主な発見

  • NatCatは、合成データや手動ラベル付きデータで学習したモデルと比較して、11のベンチマークタスクすべてでテキスト分類パフォーマンスを顕著に向上させる。
  • Wikipediaベースのデータは、エンティティやイベント分類など、事実やエントリポディア的知識を必要とするタスクで一貫してパフォーマンスを向上させる。
  • Redditベースのデータは、口語的表現、センチメント、ソーシャルメディアテキストを含むタスク、たとえば嫌がらせ検出や皮肉検出においてパフォーマンスを向上させる。
  • Stack Exchangeベースのデータは、コード関連や質問応答の分類など、技術的でドメイン特化された分類タスクにおいて特に効果的である。
  • 最適なデータソースはタスクによって異なり、どの1つのソースもすべてのベンチマークで優れているわけではないため、ソースに特化したデータ選択の重要性が浮き彫りになる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。