Skip to main content
QUICK REVIEW

[論文レビュー] Syntactic Recurrent Neural Network for Authorship Attribution

Fereshteh Jafariakinabad, Sansiri Tarnpradab|arXiv (Cornell University)|Feb 26, 2019
Authorship Attribution and Profiling参考文献 32被引用数 13
ひとこと要約

本稿では、文書レベルのライティングスタイルを、畳み込みフィルタ(短期的依存性のため)とLSTM(長期的依存性のため)を用いて品詞(POS)タグ列をモデル化することで、文書レベルの書きぶりを符号化する構文的再帰ニューラルネットワークを提案する。その後、RNNを用いて文の表現を統合し、文書レベルの埋め込み表現を生成する。このモデルは、PAN 2012著者識別データセットにおいて、語彙ベースの対比モデルより14%高い精度を達成し、トピックの変動に対して優れた耐性を示している。

ABSTRACT

Writing style is a combination of consistent decisions at different levels of language production including lexical, syntactic, and structural associated to a specific author (or author groups). While lexical-based models have been widely explored in style-based text classification, relying on content makes the model less scalable when dealing with heterogeneous data comprised of various topics. On the other hand, syntactic models which are content-independent, are more robust against topic variance. In this paper, we introduce a syntactic recurrent neural network to encode the syntactic patterns of a document in a hierarchical structure. The model first learns the syntactic representation of sentences from the sequence of part-of-speech tags. For this purpose, we exploit both convolutional filters and long short-term memories to investigate the short-term and long-term dependencies of part-of-speech tags in the sentences. Subsequently, the syntactic representations of sentences are aggregated into document representation using recurrent neural networks. Our experimental results on PAN 2012 dataset for authorship attribution task shows that syntactic recurrent neural network outperforms the lexical model with the identical architecture by approximately 14% in terms of accuracy.

研究の動機と目的

  • 多様なトピックを扱う際の語彙ベースのモデルのスケーラビリティの限界を克服すること。
  • 文書全体にわたって一貫したライティングスタイルを捉える、コンテンツに依存しない構文的基盤のニューラルネットワークの開発。
  • POSタグ列における短期的(CNN)および長期的(LSTM)依存性の組み合わせが、スタイルモデリングに与える影響の調査。
  • 短文と長文における性能評価、および構文的モデリングと語彙的モデリングのアプローチの比較。

提案手法

  • モデルはまず、各文を品詞(POS)タグの系列に変換し、構文的パターンを抽出する。
  • 局所的で短期的な構文的n-gramをPOS系列から捉えるために、畳み込みニューラルネットワーク(CNN)層を用いる。
  • POS系列全体の長期的依存性をモデル化し、グローバルな構文的構造を捉えるためにLSTM層を用いる。
  • 階層的なRNNを用いて、文レベルの構文的表現を統合し、文書レベルの表現に変換する。
  • 著者識別に最も情報を与える文に注目を向けるために、アテンション機構を適用する。
  • 最終的な文書表現は、ソフトマックス出力を有する全結合層を介して分類に用いられる。

実験結果

リサーチクエスチョン

  • RQ1トピックの変動下でも、語彙ベースのモデルを上回る性能を示す構文的ニューラルネットワークが、著者識別において有効であるか。
  • RQ2POSタグ列の短期的(CNN)および長期的(LSTM)モデリングが、スタイルベース分類の性能に与える影響は何か。
  • RQ3部分的な文書(特に短文と長文)で学習した場合、モデルの性能はどのように変化するか。
  • RQ4文書長の異なる領域において、CNN-LSTMとLSTM-LSTMのどちらのモデルアーキテクチャが、著者特有のライティングスタイルをよりよく捉えられるか。

主な発見

  • 構文的再帰ニューラルネットワークは、PAN 2012のテストセットで文書レベルの精度が100.00%に達し、最高の語彙ベースモデル(85.71%)を上回った。
  • 構文的モデルは語彙ベースモデルと比較して、セグメントレベルの精度を14%向上させ、トピックの変動に対してより優れた汎化性能と耐性を示した。
  • セグメントレベルの精度において、CNN-LSTMモデルがLSTM-LSTMモデルを約4%わずかに上回り、局所的な構文的n-gramをよりよく捉えられると示唆された。
  • 短い文書(学習に使用したセグメントの30%未満)では、LSTM-LSTMモデルがCNN-LSTMモデルよりも高いテスト精度を示し、データが少ない状況下でもスタイルを素早く学習できることを示した。
  • 構文的モデルは全クラスで高い再現率を示し、CNN-LSTMおよびLSTM-LSTMの両方とも14件のテスト文書をすべて正しく分類した。
  • 両方の構文的モデルは大多数のクラスで完全な再現率を達成したが、クラス13ではわずかな低下が見られた。一方、語彙ベースモデルはクラス1、4、7、11、12でより困難な分類を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。