Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised authorship attribution

David A. Fifield, Torbjørn Follan|arXiv (Cornell University)|Mar 26, 2015
Authorship Attribution and Profiling参考文献 9被引用数 4
ひとこと要約

この論文では、事前に既知の文体に関する知識がなく、テキスト断片に対して確率的著者割り当て重みを付与するための教師なし著者識別手法を提案する。重なり合う複数の断片クラスタリングを用い、境界をずらしながらラベルをペアワイズ一致によって整列させることで、著者割り当てに滑らかで細分化された遷移を実現する。ボキャブラリーのテキスト分割において、正解ラベルと72%の一致を示した。

ABSTRACT

We describe a technique for attributing parts of a written text to a set of unknown authors. Nothing is assumed to be known a priori about the writing styles of potential authors. We use multiple independent clusterings of an input text to identify parts that are similar and dissimilar to one another. We describe algorithms necessary to combine the multiple clusterings into a meaningful output. We show results of the application of the technique on texts having multiple writing styles.

研究の動機と目的

  • 訓練データや著者の事前スタイル知識が入手できないテキストにおける著者識別課題に対処すること。
  • 著者変更が徐々に起こる、または明確に区別されない場合でも、テキスト断片を複数の著者に細分化して識別できること。
  • スタイルの代表性を確保するための断片長と、著者変更を検出できる解像度の間のトレードオフを克服すること。
  • 複数の独立したクラスタリングを統合し、一貫性のある平均化された著者割り当てを生成する堅牢な手法を開発すること。
  • 任意のラベル付けスキームに対しても、ペアワイズ一致最大化によりラベルの一貫性を保証すること。

提案手法

  • 入力テキストを固定長(例:1000語)の重複する断片に分割し、連続するシフト(例:50語)を用いて複数の断片セットを生成する。
  • 各断片セットに対して独立したクラスタリング(例:スタイルメトリクス特徴量や圧縮ベースの類似度を用いて)を適用し、スタイル的に類似したセグメントをグループ化する。
  • 異なる実行結果間でのクラスタ識別子を一致させるために、置換戦略を用いて全クラスタリング間でラベルを再編集する。
  • 再編集されたクラスタリングの平均を計算し、各セグメントをn人の著者それぞれに確率的(ソフト)に割り当てる。
  • クラスタリングのためのスタイル特徴量を抽出するために、JStyloの「WritePrints (Limited)」機能セットを用いる。
  • 高次元特徴ベクトルのクラスタリング性能を向上させるために、次元削減(例:ランダム射影を用いて)を適用する。

実験結果

リサーチクエスチョン

  • RQ1事前に既知の著者で訓練されていない状態でも、重なり合うテキスト断片の教師なしクラスタリングが著者変更のシフトを信頼性高く検出できるか?
  • RQ2重なり合う断片クラスタリングは、単一クラスタリング手法と比較して、著者識別における解像度と滑らかさをどのように向上させるか?
  • RQ3複数のクラスタリング間でのラベル整列は、著者識別におけるノイズ低減と一貫性向上にどの程度寄与するか?
  • RQ4著者変更が徐々に起こる、または明確に区別されない実際のテキストにおいて、この手法はどの程度効果的か?
  • RQ5この教師なし設定において、次元削減はクラスタリング品質と識別精度にどのような影響を与えるか?

主な発見

  • 1768語のデリアン部の断片に対して、正解ラベルと72%の一致を示し、実際の複数著者テキストにおいて優れた性能を示した。
  • 3726語のピュイアノン部の断片に適用したところ、正解ラベルと最大76%の一致を記録し、長いセグメントにおいても高い信頼性を示した。
  • 次元削減(例:ランダム射影)の適用によりクラスタリング性能が向上し、翻訳済みのハイメンにおいて削減後、一致率が56%から72%に上昇した。
  • 著者変更が徐々に起こる領域においても、滑らかなラベル遷移を的確に捉えた。図5.2に示すように、特に著者変更が段階的に起こる領域で顕著であった。
  • ラベルの順列変更と平均化により、複数実行におけるラベルの不一致を低減したため、ベースラインクラスタリング手法を上回った。
  • 断片サイズやシフトオフセットの選択に強く、20の重複クラスタリング(1000語断片、50語シフト)が最適な解像度と安定性を提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。