Skip to main content
QUICK REVIEW

[論文レビュー] Higher Criticism for Discriminating Word-Frequency Tables and Testing Authorship

Alon Kipnis|arXiv (Cornell University)|Oct 30, 2019
Authorship Attribution and Profiling参考文献 30被引用数 5
ひとこと要約

本稿では、手動による特徴工学を必要とせず、語彙頻度表間の乖離を測るための新しい自動手法を提案する。語彙頻度に二項分布モデルを適用し、ハイヤー・クリティシズム(HC)統計の低分散に敏感な性質を活用することで、著者固有の語を特定し、著者識別において最先端の精度を達成する。HC検定は、自動的に著者的スタイルを反映する判別性の高い語を選択する。

ABSTRACT

We adapt the Higher Criticism (HC) goodness-of-fit test to measure the closeness between word-frequency tables. We apply this measure to authorship attribution challenges, where the goal is to identify the author of a document using other documents whose authorship is known. The method is simple yet performs well without handcrafting and tuning; reporting accuracy at the state of the art level in various current challenges. As an inherent side effect, the HC calculation identifies a subset of discriminating words. In practice, the identified words have low variance across documents belonging to a corpus of homogeneous authorship. We conclude that in comparing the similarity of a new document and a corpus of a single author, HC is mostly affected by words characteristic of the author and is relatively unaffected by topic structure.

研究の動機と目的

  • 手動による特徴選択を回避する、自動的かつチューニング不要の著者識別手法の開発。
  • ハイヤー・クリティシズム統計が、著者識別タスクにおける語彙頻度表間の類似性を効果的に測定できるかどうかの評価。
  • HCが特定する語が、トピック構造ではなく著者的特徴を反映しているかどうかの調査。
  • 特徴工学なしで、本手法が最先端の性能を達成することの実証。

提案手法

  • 本手法は、ドキュメントの語彙頻度を基準コーパスの頻度と比較することで、語レベルのP値を計算する。
  • それらのP値を統合するため、ハイヤー・クリティシズム(HC)統計を用い、2つの語彙頻度表間のグローバルな乖離尺度 d_HC を得る。
  • HC検定は、乖離に最も寄与する語のサブセットを自動的に同定する。これらの語は、均一なコーパス内での文書間で低い分散を示す。
  • 著者識別は、テストドキュメントに対して最小の d_HC スコアを示すコーパスを選択することで実施する。
  • 本手法は、ハイパーパrameterのチューニングなしに、連邦党論説など複数の著者識別課題に適用された。
  • 選択された語が著者的スタイルを反映しているか否かを評価するため、コーパス内での語彙頻度の変動係数(CV)を評価した。

実験結果

リサーチクエスチョン

  • RQ1ハイヤー・クリティシズム統計は、著者識別タスクにおける語彙頻度表間の類似性を効果的に測定できる自動的指標として機能できるか?
  • RQ2HC検定が特定する語は、トピック依存の特徴ではなく、低分散で著者固有の特徴を示すものか?
  • RQ3チューニングや特徴工学なしで、HCに基づく手法の性能は、既存の最先端手法と比較してどうなるか?
  • RQ4HCの乖離は、著者特有の語に起因するか、それともトピック構造の特徴に起因するか、その程度はいかほどか?

主な発見

  • HCに基づく手法は、手動による特徴選択やハイパーパrameterのチューニングなしに、著者識別で最先端の精度を達成した。
  • HCが特定した語は、均一な著者コーパス内において顕著に低い変動係数(CV)を示し、安定的かつ著者固有であることが判明した。
  • 本手法は、コーパス内で分散が低い語に最も敏感であることが示され、著者的スタイルを捉えていることが示唆された。
  • 同一著者(コンcordant)のドキュメント-コーパスペアでは、低HC P値順の語の平均CVが、非同一著者(discordant)ペアよりも顕著に低く、本手法の著者的特徴への感受性が裏付けられた。
  • HCのしきい値は一貫して低CVの語のサブセットを特定し、そのサブセットは著者固有の語使用パターンと強く相関していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。