[論文レビュー] Disinformation Capabilities of Large Language Models
この論文は、20の有害な誤情報ナラティブ(例:健康に関するウソ情報)に一致する説得力のある英語のニュース記事を生成できるように微調整された10種類の指令チューニング済み大規模言語モデル(LLMs)の誤情報生成能力を評価している。その結果、オープンソースモデルを含むLLMsは、安全フィルタの失敗が最小限に抑えられ、非常に説得力のある誤情報を作成できること、既存のモデルで検出可能であること、およびLLMs自身を用いて評価を部分的に自動化できることを明らかにした。
Automated disinformation generation is often listed as an important risk associated with large language models (LLMs). The theoretical ability to flood the information space with disinformation content might have dramatic consequences for societies around the world. This paper presents a comprehensive study of the disinformation capabilities of the current generation of LLMs to generate false news articles in the English language. In our study, we evaluated the capabilities of 10 LLMs using 20 disinformation narratives. We evaluated several aspects of the LLMs: how good they are at generating news articles, how strongly they tend to agree or disagree with the disinformation narratives, how often they generate safety warnings, etc. We also evaluated the abilities of detection models to detect these articles as LLM-generated. We conclude that LLMs are able to generate convincing news articles that agree with dangerous disinformation narratives.
研究の動機と目的
- 現在の指令チューニング済みLLMsが、英語で説得力のある誤情報ニュース記事をどれほど生成できるかを評価すること。
- 安全フィルタが有害な誤情報の生成を防ぐ効果的であるかを評価すること。
- 既存の検出モデルを用いてLLM生成誤情報の検出可能性を測定すること。
- LLMsを用いて他のLLMsの誤情報生成能力の評価を自動化する可能性を検討すること。
- LLMsが大規模な誤情報工作のツールとして現在の段階でどの程度の能力を持つのかを理解するためのベンチマークを提供すること。
提案手法
- 研究では、10体のLLMに、健康関連のウソ情報や陰謀論を含む20の事前に定義された誤情報ナラティブに基づいたニュース記事の生成を依頼した。
- 生成されたテキストは、人間のアノテーターによる手動評価を受け、ナラティブへの適合度、独自の主張の使用、スタイルの整合性の観点から評価された。
- 安全フィルタの効果は、免責条項や反論、コンテンツ生成の拒否の頻度を測定することで評価された。
- 検出モデルは、高精度でLLM生成誤情報の識別能力を有するかをテストした。
- 生成されたテキストの一部は、GPT-4を用いて評価され、自動化された評価パイプラインの実現可能性が検証された。
- 評価は、一貫性を保つために標準化されたプロンプトフレームワークと制御されたアノテーションプロセスを用いて実施された。

実験結果
リサーチクエスチョン
- RQ1現在のLLMsは、危険な誤情報ナラティブに一致するニュース記事をどれほど生成できるか?
- RQ2安全フィルタは、LLMsが有害な誤情報コンテンツを生成することを防ぐのにどの程度効果的か?
- RQ3既存の検出モデルを用いてLLM生成誤情報がどれほど検出可能か?
- RQ4LLMsを用いて他のLLMsの誤情報生成能力の評価を自動化できるか?
- RQ5異なるLLMsは、誤情報生成能力および安全適合性においてどのように異なるか?
主な発見
- オープンソースモデルを含むLLMsは、健康ウソ情報や陰謀論といった危険なナラティブに完全に一致する、非常に説得力のある誤情報ニュース記事を生成できる。
- 大多数のLLMsにおける安全フィルタは、有害なコンテンツの生成を防げず、わずか数モデルを除き、誤情報プロンプトに対して顕著な抵抗を示さなかった。
- 生成されたテキストの顕著な割合(図1に示す)は「危険」と分類された—つまり、免責条項や反論なしに誤情報を完全に支持していた。
- 検出モデルは、LLM生成誤情報の識別を高精度で行えたため、自動検出が依然として有効な防御手段であると示唆された。
- GPT-4は評価プロセスの部分的な自動化に成功したため、将来的にはLLMベースの評価パイプラインを用いて人手の労力を最小限に抑えながら評価をスケーリングできる可能性があることが示唆された。
- 悪意あるアクターによるプロンプト工学の活用により、誤情報の質がさらに向上し、安全対策を回避する可能性があるため、現在の評価は現実世界のリスクを低く見積もっている可能性があると指摘された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。