Skip to main content
QUICK REVIEW

[論文レビュー] Authorship Attribution Using a Neural Network Language Model

Zhenhao Ge, Yufang Sun|arXiv (Cornell University)|Feb 17, 2016
Authorship Attribution and Profiling参考文献 4被引用数 9
ひとこと要約

この論文は、限られたテキストデータを用いた著者識別に向けたフィードフォワードニューラルネットワーク言語モデル(NNLM)を提案し、ケスラー=ネイ平滑化を施した伝統的なN-gramモデルを上回る性能を示した。5文程度のテストセットでも平均3.43%の精度向上と2.5%のパープレキシティ低減を達成し、データ制約下でも優れた性能を発揮することを示した。

ABSTRACT

In practice, training language models for individual authors is often expensive because of limited data resources. In such cases, Neural Network Language Models (NNLMs), generally outperform the traditional non-parametric N-gram models. Here we investigate the performance of a feed-forward NNLM on an authorship attribution problem, with moderate author set size and relatively limited data. We also consider how the text topics impact performance. Compared with a well-constructed N-gram baseline method with Kneser-Ney smoothing, the proposed method achieves nearly 2:5% reduction in perplexity and increases author classification accuracy by 3:43% on average, given as few as 5 test sentences. The performance is very competitive with the state of the art in terms of accuracy and demand on test data. The source code, preprocessed datasets, a detailed description of the methodology and results are available at https://github.com/zge/authorship-attribution.

研究の動機と目的

  • 従来の言語モデルが苦戦するようなデータが限られた状況での著者識別の精度を向上させること。
  • ケスラー=ネイ平滑化を施した従来のN-gramモデルと比較して、フィードフォワードNNLMの有効性を評価すること。
  • テキストのトピックが著者分類の性能に与える影響を調査すること。
  • 限られたデータ環境に適した計算効率が高くカスタマイズ可能なNNLMフレームワークを構築すること。
  • 再現性およびさらなる研究を促進するため、オープンソースのコードとデータセットを提供すること。

提案手法

  • 4-gramの文脈を用いて次の単語を予測するようにフィードフォワードニューラルネットワーク言語モデルを学習し、バックプロパゲーションにより単語埋め込みを学習する。
  • 単語入力をワンホットベクトルとして表現し、埋め込み層を介して密な分散表現に変換する。
  • 隠れ層にシグモイド関数を用い、出力層にソフトマックス関数を適用して単語確率を予測する。学習は多項分布交差エントロピー損失関数によって駆動される。
  • 学習率、モーメンタム、隠れ層サイズといったモデルパラメータは、著者ごとに最適化されるように調整される。
  • STEM分野の16のCourseraコースから得たテキストデータは、ポーター法による語幹抽出と単語頻度のプルーニングを用いて前処理され、著者1人あたりの語彙数を1800〜2700語に制限した。
  • データセットは80%を学習、10%を検証、10%をテストに割り当て、性能指標の平均値と分散を求めるために10通りのランダムな分割を実施した。

実験結果

リサーチクエスチョン

  • RQ1限られたデータ下で、ケスラー=ネイ平滑化を施した最適化されたN-gramベースラインと比較して、フィードフォワードNNLMの著者識別性能はどの程度優れているか?
  • RQ2テキストのトピックが著者識別モデルの性能にどの程度影響を及ぼすか?
  • RQ3計算効率の高いフィードフォワードNNLMは、最小限の学習データでも競争力のある結果を達成できるか?
  • RQ4分類に使用するテスト文の数が増えるにつれて、モデルの性能はどのように変化するか?
  • RQ5従来のN-gramと比較して、NNLMは著者スタイルの違いに敏感であるか、それともトピック固有のパターンに敏感であるか?

主な発見

  • 提案されたNNLMは、ケスラー=ネイ平滑化を施したN-gramベースラインと比較して、著者分類精度で平均3.43%の向上を達成した。
  • NNLMは平均して2.5%のパープレキシティ低減を達成し、N-gramモデルの69.0 ± 2.4に対して、平均パープレキシティ67.3 ± 2.4を達成した。
  • 5文程度のテスト文でもNNLMは高い性能を維持し、データ量が少ない状況でも頑健であることが示された。
  • 同じインstructerが担当する2つのコース間で誤認識が高くなったことから、モデルはトピックよりも著者スタイルにより敏感であると示された。
  • 限られた著者数と一貫した学習/テストデータの分布を考慮しても、最先端の手法と比較して一貫した競争力を持つ結果を示した。
  • 訓練データとテストデータのトピックの一貫性が、データセットの難易度を低下させ、観察された性能差を限定している可能性があると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。