[論文レビュー] Stylometry Analysis of Multi-authored Documents for Authorship and Author Style Change Detection
本稿では、複数のトランスフォーマーモデルと最適化手法(PSO、Nelder-Mead、Powell)を組み合わせたメリットベースの遅延ファージョンフレームワークを提案し、マルチオーサー文書におけるスタイルメトリクスタスクに応用する。前処理段階で特殊文字を保持することで性能が著しく向上し、最先端手法と比較して複数の著者切り替え検出タスクで最大5.35%高いF1スコアを達成したことが示された。
In recent years, the increasing use of Artificial Intelligence based text generation tools has posed new challenges in document provenance, authentication, and authorship detection. However, advancements in stylometry have provided opportunities for automatic authorship and author change detection in multi-authored documents using style analysis techniques. Style analysis can serve as a primary step toward document provenance and authentication through authorship detection. This paper investigates three key tasks of style analysis: (i) classification of single and multi-authored documents, (ii) single change detection, which involves identifying the point where the author switches, and (iii) multiple author-switching detection in multi-authored documents. We formulate all three tasks as classification problems and propose a merit-based fusion framework that integrates several state-of-the-art natural language processing (NLP) algorithms and weight optimization techniques. We also explore the potential of special characters, which are typically removed during pre-processing in NLP applications, on the performance of the proposed methods for these tasks by conducting extensive experiments on both cleaned and raw datasets. Experimental results demonstrate significant improvements over existing solutions for all three tasks on a benchmark dataset.
研究の動機と目的
- AI生成文書およびマルチオーサーテキストにおける著者識別とスタイル変更検出の増大する課題に対処すること。
- 単一/複数著者文書分類、単一著者切り替え検出、複数著者切り替え検出の3つのスタイルメトリクスタスクにおける性能向上。
- 通常のNLP前処理で除去される傾向にあるが、スタイルメトリクス分析に与える影響を調査すること。
- 高度な最適化手法を用いてモデル重みを最適化するメリットベースのファージョンフレームワークの開発。
- 現行の研究を拡張し、現実世界のマルチオーサーテキストにおける単一および複数の著者切り替え検出を対象とする。
提案手法
- トランスフォーマーベースのモデル(例:BERT、RoBERTa、DistilBERT)を用いて、3つのスタイルメトリクスタスクをすべてテキスト分類問題として定式化する。
- 個々のモデルの予測を重み付き平均を用いて統合する遅延ファージョン戦略を実装する。
- 粒子群最適化(PSO)、ネルダーミード法、パワエル法の3つのメタヒューリスティック最適化手法を用いてモデル重みを最適化する。
- 前処理の影響を評価するために、クリーンデータセットと生データセットの両方で実験を実施し、ストップワード、縮約形、句読点の保持に注目する。
- すべてのタスクでF1スコアを主評価指標として用い、既存の最先端手法と比較する。
- 標準的なNLPパイプラインで捨てられがちなスタイルマーカー(特殊文字など)を保持するための特徴工学的アプローチを適用する。

実験結果
リサーチクエスチョン
- RQ1複数のトランスフォーマーモデルを組み合わせたメリットベースの遅延ファージョンフレームワークは、個々のモデルと比較してスタイルメトリクスタスクの性能を向上させることができるか?
- RQ2異なる最適化手法(PSO、Nelder-Mead、Powell)は、著者識別およびスタイル変更検出における統合モデルの性能にどのように影響を与えるか?
- RQ3特殊文字およびストップワード/短縮語は、マルチオーサーテキストにおける著者スタイルの区別にどの程度寄与するか?
- RQ4前処理段階で生テキスト特徴(例:句読点、縮約形)を保持することで、スタイルメトリクス分類タスクに測定可能な改善が得られるか?
- RQ5提案手法の性能は、特に複数の著者切り替えイベントの検出において、さまざまなスタイルメトリクスタスクでどのように変動するか?
主な発見
- PSOおよびネルダーミード法を用いたファージョン手法は、クリーンデータセットを用いた複数著者切り替え検出タスク(タスク3)でF1スコア0.5535を達成し、既存手法を約5%上回った。
- タスク2(単一著者切り替え検出)では、単純なファージョン手法がF1スコア0.782を達成し、最良の既存手法と比較して3%の向上を示した。
- 特殊文字およびストップワードの含めがモデル性能を著しく向上させ、それらを除去した場合、すべてのタスクでF1スコアが顕著に低下した。
- ネルダーミード法およびPSOベースのファージョン手法は、個々のモデルや他のファージョン戦略を上回り、特に複数の著者切り替えを含む複雑なタスクで優れた性能を示した。
- タスク3では、クリーンデータセットと生データセットの性能差が最小限に抑えられており、特殊文字の保持によって前処理のばらつきに対して本手法が頑健であることが示された。
- BERT-baseモデルはタスク3で最高の個別性能(クリーンデータでF1 = 0.5309)を示したが、ファージョン手法がそれを上回ったことから、スタイルメトリクスにおけるアンサンブル学習の有効性が裏付けられた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。