[論文レビュー] Can Large Language Models Identify Authorship?
この論文は、ドメイン特化した微調整を施さずに、ゼロショットの著者識別検証および著者属性付与に大規模言語モデル(LLMs)を用いることの有効性を調査している。独自の言語的インスパイラブルプロンプティング(LIP)技術を用いることで、GPT-4などのLLMsは、複数のデータセットにおいて、従来のモデルやBERTベースのモデルを上回る最先端の性能と、向上した説明可能性を達成している。
The ability to accurately identify authorship is crucial for verifying content authenticity and mitigating misinformation. Large Language Models (LLMs) have demonstrated an exceptional capacity for reasoning and problem-solving. However, their potential in authorship analysis remains under-explored. Traditional studies have depended on hand-crafted stylistic features, whereas state-of-the-art approaches leverage text embeddings from pre-trained language models. These methods, which typically require fine-tuning on labeled data, often suffer from performance degradation in cross-domain applications and provide limited explainability. This work seeks to address three research questions: (1) Can LLMs perform zero-shot, end-to-end authorship verification effectively? (2) Are LLMs capable of accurately attributing authorship among multiple candidates authors (e.g., 10 and 20)? (3) Can LLMs provide explainability in authorship analysis, particularly through the role of linguistic features? Moreover, we investigate the integration of explicit linguistic features to guide LLMs in their reasoning processes. Our assessment demonstrates LLMs' proficiency in both tasks without the need for domain-specific fine-tuning, providing explanations into their decision making via a detailed analysis of linguistic features. This establishes a new benchmark for future research on LLM-based authorship analysis.
研究の動機と目的
- 微調整なしにゼロショットでエンドツーエンドの著者識別検証にLLMsを効果的に適用できるかを評価すること。
- 複数の候補著者(例:10人および20人)の間でLLMsが著者属性付与の正確性を保てるかを評価すること。
- 言語的特徴をLLMの推論に統合することで、著者分析における説明可能性を向上させること。
- LLMがスタイル的・言語的特徴に注目できるように導く新しいプロンプティング技術「言語的インスパイラブルプロンプティング(LIP)」を考案・検証すること。
- 低リソースおよびクロスドメイン設定におけるLLMベースの著者分析のための新たなベンチマークを確立すること。
提案手法
- LLMが「トーン」や「ユーモア」、「文法構造」などの言語的特徴を分析できるように明示的に誘導する、言語的インスパイラブルプロンプティング(LIP)というプロンプティングフレームワークを提案する。
- 中間の特徴工学を回避し、ゼロショットでエンドツーエンドの方法でLLMを著者識別検証および属性付与タスクに直接適用する。
- 主にGPT-4とGPT-3.5をLLMとして用い、TF-IDF、BERT、RoBERTa、DeBERTa、ELECTRAと性能を比較する。
- LLMのプロンプティングプロセスに言語的特徴検出を統合し、意思決定の透明性を高め、スタイル的特徴に焦点を当てる。
- 自然言語による著者判断の説明を生成し、ワードクラウドなどの可視化手法を用いてモデルが言語的用語に注目しているかを分析する。
- すべてのモデル出力、入力テキスト、分析結果をGitHubリポジトリに公開し、再現性とベンチマークの構築を支援する。
実験結果
リサーチクエスチョン
- RQ1LLMsはゼロショットでエンドツーエンドの著者識別検証を効果的に行えるか?
- RQ2LLMsは複数の候補著者(例:10人および20人)の間で著者属性付与を正確に行えるか?
- RQ3LLMsは、言語的特徴の役割を通じて著者分析における説明可能性をどのように提供できるか?
- RQ4明示的な言語的誘導を統合することで、LLMsの性能と意思決定の透明性が著者タスクで向上するか?
主な発見
- GPT-4にLIPを適用した場合、BERTベースのモデルやTF-IDFを含むすべてのベースラインモデルを上回り、著者識別検証および属性付与の両タスクで優れた性能を示した。
- LLMsの性能は、候補著者の数が10人から20人に増加しても安定しており、従来のモデルが顕著な性能低下を示すのとは対照的である。
- 言語的誘導付きプロンプティングは、LLMの説明の的を射た specificity と関連性を顕著に向上させ、ワードクラウドでは「ユーモア」「皮肉」「口語的表現」などの高レベルな特徴に注目が集まっていることが示された。
- トーンやレジスタといった言語的特徴が、LIP誘導出力において一貫して検出され強調されており、モデルがスタイルのニュアンスを推論できる能力を示している。
- LIP手法により、意思決定が観察可能な言語的属性に根ざし、ブラックボックスな埋め込みよりも明確で解釈可能な根拠を提供する、説明可能性が向上した。
- 本研究は、ドメイン特化した微調整なしに、複数のデータセットで強いゼロショット一般化性能と頑健性を示すLLMベースの著者分析の新たなベンチマークを確立した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。