Skip to main content
QUICK REVIEW

[論文レビュー] A Machine Learning Framework for Authorship Identification From Texts

Rahul Radhakrishnan Iyer, Carolyn Penstein Rosé|arXiv (Cornell University)|Dec 21, 2019
Authorship Attribution and Profiling参考文献 20被引用数 8
ひとこと要約

本稿では、品詞(POS)ビグラムおよび文字n-グラムを含むスタイルメトリクス特徴量と、語彙特徴量(語unigram、bigram)を組み合わせた教師あり機械学習フレームワークを提案し、50人の著者を対象にホールドアウトテストセットで81.6%の精度を達成した。この結果は、言語的スタイルメトリクス特徴量を統合することで、ベースラインunigramモデルに比べて分類性能が顕著に向上することを示している。

ABSTRACT

Authorship identification is a process in which the author of a text is identified. Most known literary texts can easily be attributed to a certain author because they are, for example, signed. Yet sometimes we find unfinished pieces of work or a whole bunch of manuscripts with a wide variety of possible authors. In order to assess the importance of such a manuscript, it is vital to know who wrote it. In this work, we aim to develop a machine learning framework to effectively determine authorship. We formulate the task as a single-label multi-class text categorization problem and propose a supervised machine learning framework incorporating stylometric features. This task is highly interdisciplinary in that it takes advantage of machine learning, information retrieval, and natural language processing. We present an approach and a model which learns the differences in writing style between $50$ different authors and is able to predict the author of a new text with high accuracy. The accuracy is seen to increase significantly after introducing certain linguistic stylometric features along with text features.

研究の動機と目的

  • 未学習のテキストの著者を特定するための堅牢な機械学習フレームワークの開発。
  • 特にPOSビグラムを含む新しい特徴空間の有効性が、著者識別精度に与える影響の調査。
  • 語彙的特徴量(例:unigram、bigram)とスタイルメトリクス特徴量(例:助詞、n-グラム)を組み合わせた場合の分類性能への影響の評価。
  • ホールドアウトテストセットにおける汎化性能の評価および最適化モデルとベースラインモデルの比較。
  • 短いテキストや非英語コーパスの処理における限界の特定および今後の研究の方向性の同定。

提案手法

  • 著者識別の問題を単一ラベル多クラステキスト分類問題として定式化する。
  • 語彙的特徴量(語unigram、bigram)とスタイルメトリクス特徴量(助詞、文字n-グラム、POSビグラム、語-POSペア)の組み合わせを用いて、LibLINEAR SVM分類器を学習する。
  • ハイパーパramータチューニングおよびモデル選択に10分割交差検証を適用し、バイアス項のみをチューニング対象とする。
  • モデルの最適化と汎化性能の向上を目的に特徴量選択を実施する。
  • 交差検証およびチューニングの後、最終評価にホールドアウトテストセットを用いる。
  • 最適化モデルとベースラインモデルの性能向上の有意性を統計的有意性検定(t検定、p値)で評価する。

実験結果

リサーチクエスチョン

  • RQ1特徴空間に品詞(POS)ビグラムを統合することで、著者識別精度が顕著に向上するか?
  • RQ2助詞や文字n-グラムなどのスタイルメトリクス特徴量を含めることで、語彙的特徴量のみのベースラインモデルに比べて分類性能はどのように変化するか?
  • RQ3モデルの性能は未学習データに対しても一般化可能か?また、語unigramのみを用いたベースラインモデルと比較するとどうなるか?
  • RQ4短いテキスト(例:マイクロブログ投稿)や非英語コーパスに対しても、モデルの汎化性能はどの程度達成できるか?
  • RQ5特徴量エンジニアリングおよびモデル最適化によって得られた性能向上の統計的有意性はどの程度か?

主な発見

  • 最適化モデルはホールドアウトテストセットで81.6%の精度とCohenのkappa係数0.8122を達成し、ベースラインモデルの79.8%精度と0.7939のkappa係数を上回った。
  • 精度の向上は統計的に有意ではなかった(p = 0.106、t = -1.619)ため、性能向上は偶然による可能性も示唆された。
  • 最も優れた性能を示したモデルはバイアス項を1に設定しており、これはデフォルト設定そのものであった。この結果は、この状況ではハイパーパramータチューニングの必要性がなかったことを示している。
  • 誤差解析により、スタイルメトリクス特徴量の統合がモデル性能を顕著に向上させることを確認し、こうした特徴量が著者スタイルの強力な指標であるという仮説を裏付けた。
  • POSビグラムおよび語-POSペアの使用が性能向上に寄与しており、構文的パターンが信頼できるスタイル的マーカーであることが示唆された。
  • モデルは未学習データに対し、合理的に汎化可能であり、80%以上のテストインスタンスが正しく分類された。ただし、非常に短いテキストや非英語言語処理においては依然として限界が残っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。