Skip to main content
QUICK REVIEW

[論文レビュー] Generative and Discriminative Text Classification with Recurrent Neural Networks

Dani Yogatama, Chris Dyer|arXiv (Cornell University)|Mar 6, 2017
Topic Modeling被引用数 110
ひとこと要約

論文は生成的LSTMベースのテキスト分類器と識別的LSTMベースのテキスト分類器を比較し、識別モデルは漸近的誤差が低いが、生成モデルは少量データでより速く学習し、継続学習やゼロショット学習の設定で分布シフトに対してより頑健であることを示す。

ABSTRACT

We empirically characterize the performance of discriminative and generative LSTM models for text classification. We find that although RNN-based generative models are more powerful than their bag-of-words ancestors (e.g., they account for conditional dependencies across words in a document), they have higher asymptotic error rates than discriminatively trained RNN models. However we also find that generative models approach their asymptotic error rate more rapidly than their discriminative counterparts---the same pattern that Ng & Jordan (2001) proved holds for linear classification models that make more naive conditional independence assumptions. Building on this finding, we hypothesize that RNN-based generative classification models will be more robust to shifts in the data distribution. This hypothesis is confirmed in a series of experiments in zero-shot and continual learning settings that show that generative models substantially outperform discriminative models.

研究の動機と目的

  • 識別的 vs. 生成的LSTMモデルのテキスト分類タスクでの性能を評価する。
  • モデルタイプ間の漸近的誤差とサンプル複雑性の差を特定する。
  • 継続学習とゼロショット学習実験を通じた分布シフトへの頑健性を評価する。

提案手法

  • peephole 接続と平均隠れ状態プーリングを用いた文書表現で識別的LSTMを実装する。
  • 共有および独立LSTMを用いて p(x|y) と p(y) を計算するクラスベース言語モデルとして生成モデルを開発する。
  • 推定時には Bayes ルールに従い、識別モデルは p(y|x) を最大化、生成モデルは p(x|y)p(y) を最大化する。
  • 生成モデルの Shared LSTM バリアントでクラス間で語彉埋め込みと LSTM パラメータを共有する。
  • Naive Bayes、Kneser–Ney、NB ニューラルネットワークを含むベースラインと6つのデータセットで比較する。
  • Generative Shared LSTM の未ラベルデータでの事前訓練を行い、クラス埋め込みを微調整して Generative Shared LSTM を構築する。

実験結果

リサーチクエスチョン

  • RQ1識別的LSTMは生成的LSTMよりテキスト分類で漸近的誤差を低く抑えられるか。
  • RQ2生成的LSTMは小データ領域でより速く学習し、一般化性能が高いか。
  • RQ3継続学習・ゼロショット学習設定において生成モデルはデータ分布シフトに対してより頑健か。

主な発見

  • 識別的LSTMは生成的LSTMより漸近的精度が高く、線形モデルに対する Ng & Jordan (2001) の結果と一致する。
  • 生成的LSTMsは漸近的誤差へより速く到達し、小データシナリオで独立性の強い仮定を持つベースライン生成モデルを上回る。
  • 継続学習では、生成モデルが逐次的に導入されるクラスをより良く扱い、致命的忘却を緩和する。
  • ゼロショット学習では、固定ラベル埋め込みを用いた生成LSTMは unseen クラスで顕著な適合度と再現率を示し、自己学習を用いた場合に識別モデルをいくつかの設定で上回る。
  • 未ラベルデータで事前訓練した Generative Shared LSTM は、独立して訓練された生成モデルの性能に近づき、新しいクラスへの適応をより速く提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。