Skip to main content
QUICK REVIEW

[論文レビュー] Experiments with Neural Networks for Small and Large Scale Authorship Verification

Marjan Hosseinia, Arjun Mukherjee|arXiv (Cornell University)|Mar 17, 2018
Authorship Attribution and Profiling参考文献 6被引用数 8
ひとこと要約

本稿では、小規模なデータセットおよび短い多様なドキュメントを対象とした著者識別検証のための2つのニューラルネットワークモデルを提案する。TE(変換エンコーダ)は、1つのドキュメントを別のドキュメントに変換する際の再構成誤差を類似度の信号として用いる。PRNN(並列再帰ニューラルネットワーク)は、ドキュメントペアの学習済み言語モデルを比較することで動作する。両モデルとも、PAN、Amazon、MLのデータセットにおいて安定的かつ競争力のある性能を示し、特に大規模データセットではベースラインを上回る結果を得た。

ABSTRACT

We propose two models for a special case of authorship verification problem. The task is to investigate whether the two documents of a given pair are written by the same author. We consider the authorship verification problem for both small and large scale datasets. The underlying small-scale problem has two main challenges: First, the authors of the documents are unknown to us because no previous writing samples are available. Second, the two documents are short (a few hundred to a few thousand words) and may differ considerably in the genre and/or topic. To solve it we propose transformation encoder to transform one document of the pair into the other. This document transformation generates a loss which is used as a recognizable feature to verify if the authors of the pair are identical. For the large scale problem where various authors are engaged and more examples are available with larger length, a parallel recurrent neural network is proposed. It compares the language models of the two documents. We evaluate our methods on various types of datasets including Authorship Identification datasets of PAN competition, Amazon reviews, and machine learning articles. Experiments show that both methods achieve stable and competitive performance compared to the baselines.

研究の動機と目的

  • 著者に関する事前学習済みの文章サンプルが入手できない状況における著者識別検証を扱う。特に、短くジャンルが多様なドキュメントに対して有効であることを目的とする。
  • 訓練データが限られている、ドキュメント長が短い、トピックやジャンルのばらつきがあるといった要因による小規模著者識別検証の課題を克服すること。
  • 多様な著者と長文を含む大規模データセットにおいても効果的なスケーラブルなニューラルモデルの開発。
  • PANコンペティション、Amazonレビュー、科学的論文を含む多様なデータセットを対象にモデルを評価すること。
  • 公平な比較のため、要約ベクトルと標準的な機械学習類似度測定法を用いた強力なベースラインを確立すること。

提案手法

  • 1つのドキュメントを別のドキュメントに再構成することを学習する変換エンコーダ(TE)を提案。再構成誤差を著者識別検証の判別的特徴として用いる。
  • TEが生成する誤差ベクトルを用いて、ナイーブベイズ(NB)または決定木(DT)の分類器を訓練し、同一著者対と異なる著者対を区別する。
  • 2つの入力ドキュメントを別個のRNN隠れ状態にエンコードし、融合層を介して言語モデルを比較する並列再帰ニューラルネットワーク(PRNN)を設計。
  • ベースライン比較のため、バイナリ著者識別検証タスクを要約ベクトルを用いて標準的なバイナリ分類形式に変換する。
  • 小規模データセットにおける学習安定性を向上させるために、長文ドキュメントを等分された文の部分に分割するデータ拡張を実施。
  • PRNNの融合層出力における意思決定境界の分離状態を可視化するためにt-SNEを用いる。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みの文章サンプルが存在しない状況でも、ニューラル変換モデルが著者類似度を効果的に学習できるか?
  • RQ2ドキュメント変換からの再構成誤差は、従来の類似度測定法と比較して、著者識別検証において優れた性能を示すか?
  • RQ3並列RNNアーキテクチャは、大規模著者識別検証のためのドキュメントペアの言語モデルを効果的に学習・比較できるか?
  • RQ4PRNNは、レビューや科学的論文など多様なドメインに一般化できるか?
  • RQ5提案モデルは、小規模および大規模著者識別検証ベンチマークにおいて、既存のベースラインと比較してどのように性能を発揮するか?

主な発見

  • 変換エンコーダ(TE)は、サイズ、ジャンル、トピックの違いに関係なく、PANの4つのデータセットすべてで安定した性能を示した。
  • Amazonレビューのデータセットでは、PRNNがすべてのベースラインを上回り、最高の正答率を達成した。これは、訓練データサイズが大きいことに相関している。
  • PAN2013およびPAN2014Eでは、PRNNが2番目の正答率を記録した。ドキュメント分割とデータ拡張により、学習の不安定性が軽減された。
  • t-SNEの可視化結果から、正例と負例は大部分で分離しているが、まれな領域では重複が見られ、誤分類の可能性があることが示された。
  • SVMはTEベースの分類においてNBおよびDTより成績が悪く、低次元の誤差ベクトル(7次元未満)では性能が著しく劣ることが原因と考えられる。
  • 十分な訓練データがある場合、PRNNモデルは過学習を回避し、大規模データセットにおいても高い耐性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。