Skip to main content
QUICK REVIEW

[論文レビュー] Assessing the Stylistic Properties of Neurally Generated Text in Authorship Attribution

Enrique Manjavacas, Jeroen De Gussem|arXiv (Cornell University)|Aug 18, 2017
Authorship Attribution and Profiling参考文献 20被引用数 3
ひとこと要約

本稿は、再帰的ニューラル言語モデル(RNNLM)とn-gram言語モデル(NGLM)を用いて、著者識別を目的とした神経的生成テキストのスタイル的忠実度を評価する。RNNLMが生成するテキストはNGLM出力よりも曇った性質を持ち、直接の著者識別精度は低いが、実データのみに依存する場合と比較して、スタイルに豊かで多様な訓練例を導入することで、データ拡張の場面で顕著な性能向上を達成し、分類器の一般化性能を向上させることを示している。

ABSTRACT

Recent applications of neural language models have led to an increased interest in the automatic generation of natural language. However impressive, the evaluation of neurally generated text has so far remained rather informal and anecdotal. Here, we present an attempt at the systematic assessment of one aspect of the quality of neurally generated text. We focus on a specific aspect of neural language generation: its ability to reproduce authorial writing styles. Using established models for authorship attribution, we empirically assess the stylistic qualities of neurally generated text. In comparison to conventional language models, neural models generate fuzzier text that is relatively harder to attribute correctly. Nevertheless, our results also suggest that neurally generated text offers more valuable perspectives for the augmentation of training data.

研究の動機と目的

  • 神経的生成テキストのスタイル的性質が著者識別文脈においてどのように現れるかを体系的に評価すること。
  • RNNLMという神経的言語モデルと、従来のn-gram言語モデル(NGLM)の間で、著者スタイルをどの程度保持できるかを比較すること。
  • 神経的生成テキストが、特に参考データが限られた著者に対して、有効な訓練データ拡張手段として機能するかどうかを評価すること。
  • 生成テキストにおけるスタイルの忠実度と多様性のトレードオフが分類器性能に与える影響を調査すること。

提案手法

  • RNNLMおよびNGLMアーキテクチャを用いた文字レベルの言語モデリングによるテキスト生成。
  • 温度制御付きの多項分布サンプリングを用いて、多様性と滑らかさのバランスをとる。
  • 実データ、生成データ、および実データ+生成データを組み合わせたデータで著者識別分類器を学習し、性能を評価する。
  • 文書のベクトル化および主成分分析(PCA)可視化のため、正規化されたn-gram頻度(2~4次)をスタイル特徴量として使用する。
  • 複数の著者に対して、本物のテキストと生成テキストとの間の語彙的重複度を測るため、ジャカード類似度を用いる。
  • 実データと生成データの間のスタイル的分布シフトを可視化するため、主成分分析(PCA)を適用する。

実験結果

リサーチクエスチョン

  • RQ11人の著者の作品集から生成されたテキストが、標準的な著者識別手法を用いても、元の著者に帰属できる程度はどの程度か?
  • RQ2RNNLMが生成するテキストのスタイル的質は、NGLMが生成するテキストと比較して、本物の元データにどの程度類似しているか?
  • RQ3神経的生成テキストを訓練データ拡張に組み込むことで、著者識別性能がどのように向上するか?
  • RQ4n-gramの重複度および分布的類似度によって測定した場合、生成テキストが元の著者のスタイルの語彙的および構文的特徴をどの程度保持しているか?

主な発見

  • RNNLMが生成するテキストは、本物のテキストとは顕著に異なるn-gram頻度分布を示しており、スタイルの曇り(fuzziness)と直接の著者識別精度の低下を示している。
  • NGLMが生成するテキストは、元のコーパスのn-gram頻度分布を非常によく再現しており、孤立して使用された場合、より高い著者識別精度を示している。
  • データ拡張の文脈では、RNNLMが生成するデータを用いることで、実データのみに依存する場合と比較して、著者識別性能が顕著に向上し、NGLMが生成するデータを上回っている。
  • ジャカード類似度分析の結果、NGLMが生成するテキストはRNNLMが生成するテキストよりも本物のテキストとの語彙的重複度がはるかに高く、後者のスタイル的乖離を裏付けている。
  • PCA可視化により、RNNLMが生成するデータがスタイル空間においてより広範かつ散らばった領域を占めていることが確認され、多様性と複雑性の高さが示された。
  • 結果から、RNNLM出力の「曇り」が、データ拡張の文脈で分類器の一般化性能を向上させる価値あるスタイル的変動をもたらすことが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。