Skip to main content
QUICK REVIEW

[論文レビュー] Multi-label Dataless Text Classification with Topic Modeling

Daochen Zha, Chenliang Li|arXiv (Cornell University)|Nov 5, 2017
Text and Document Classification Technologies被引用数 3
ひとこと要約

本論文は、ラベルなし学習データを一切使用せず、各カテゴリに対してわずかなシード語を用いることで文書を分類する、シード語誘導型マルチラベルトピックモデルSMTMを提案する。スパイクアンドスラブおよび弱いスムージング事前分布を用いてカテゴリのスパarsityをモデル化し、シード語誘導型のバイアス付きGPUサンプリング手順を採用することで、SMTMはマルチラベル分類タスクで最先端の性能を達成し、特定の状況では一部の教師あり手法を上回ることすら可能である。

ABSTRACT

Manually labeling documents is tedious and expensive, but it is essential for training a traditional text classifier. In recent years, a few dataless text classification techniques have been proposed to address this problem. However, existing works mainly center on single-label classification problems, that is, each document is restricted to belonging to a single category. In this paper, we propose a novel Seed-guided Multi-label Topic Model, named SMTM. With a few seed words relevant to each category, SMTM conducts multi-label classification for a collection of documents without any labeled document. In SMTM, each category is associated with a single category-topic which covers the meaning of the category. To accommodate with multi-labeled documents, we explicitly model the category sparsity in SMTM by using spike and slab prior and weak smoothing prior. That is, without using any threshold tuning, SMTM automatically selects the relevant categories for each document. To incorporate the supervision of the seed words, we propose a seed-guided biased GPU (i.e., generalized Polya urn) sampling procedure to guide the topic inference of SMTM. Experiments on two public datasets show that SMTM achieves better classification accuracy than state-of-the-art alternatives and even outperforms supervised solutions in some scenarios.

研究の動機と目的

  • テキスト分類のための大規模なマルチラベル訓練データセットを構築する際の高コストおよび高複雑性を低減すること。
  • ラベルなしテキスト分類を単一ラベルからマルチラベル設定へ拡張すること、ここで文書は複数のカテゴリに属しうる。
  • しきい値チューニングやラベル付き例なしに、各文書に対して関連するカテゴリを自動で特定する手法を開発すること。
  • 語の共起パターンとカテゴリ-トピック関係をモデル化することで、限られたシード語を効果的に活用すること。
  • 低データまたは低品質データの状況において、教師ありベースラインと同等または優れた性能を達成すること。

提案手法

  • SMTMは各カテゴリを1つのカテゴリトピックとしてモデル化し、カテゴリの意味的意味を捉える。
  • カテゴリのスパarsityを強制するためにスパイクアンドスラブ事前分布を用い、各文書が確率的かつ部分的にのみカテゴリに関連付けられるようにする。
  • ラベルなしの文書に対しても耐性を高めるために、弱いスムージング事前分布を適用し、シード語のカバレッジが不完全であっても対応できるようにする。
  • 共起語と関連カテゴリトピックを促進することでトピック推論を誘導する、シード語誘導型のバイアス付き一般化ポリア・アーン(GPU)サンプリング手順を導入する。
  • コーパス全体における語の共起統計を活用して、初期のシード語を超える関連語を推定する。
  • シード語の監視とカテゴリスパarsity制約を統合した、ギブスサンプリングに基づく推論アルゴリズムを採用する。

実験結果

リサーチクエスチョン

  • RQ1文書が複数のカテゴリに属する状況において、ラベルなしテキスト分類を効果的にマルチラベル設定へ拡張できるか?
  • RQ2ラベルなしデータの下で、しきい値チューニングに依存せずにカテゴリスパarsityをどのようにモデル化できるか?
  • RQ3わずかな数のシード語を用いて、マルチラベル分類におけるトピック推論とラベル割り当てを効果的に誘導できるか?
  • RQ4ラベル付きデータが限られている、または品質が低い状況において、ラベルなしマルチラベル分類器の性能は教師ありベースラインと比べてどうなるか?
  • RQ5共起パターンを介して、初期のシード語を超える関連語をモデルが発見できるか?

主な発見

  • SMTMは2つの公開マルチラベルデータセットにおいて、最先端のラベルなしベースラインを上回る分類精度を達成した。
  • 一部の状況では、ラベル付きデータが限られる場合や品質が低い場合に、SMTMは教師あり学習手法を上回ることすらある。
  • 文書内にシード語が存在しない場合でも、語の共起パターンを活用することで、関連するカテゴリを効果的に特定できた。
  • スパイクアンドスラブ事前分布により、しきい値チューニングなしに確率的かつ自動的に各文書の関連カテゴリを選択可能となった。
  • シード語誘導型のバイアス付きGPUサンプリング手順により、関連するカテゴリトピックと語が効果的に促進され、推論精度が向上した。
  • デリシャスデータセットの実験から、シード語が欠落している文書に対してもSMTMは耐性を示し、正しくカテゴリを割り当てた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。