[論文レビュー] The Myths of Our Time: Fake News
本論文では、収集済みのニュースデータセットを用いてトレーニングされたLSTMベースの言語モデルを用い、フェイクニュース記事を生成する機械学習パイプラインを提示する。これは、メディアアートの一形態として、ウイルス性の誤情報の模倣を試みるものである。プロジェクトはオンラインブログ www.newsby.ml としてホスティングされ、AIが実際のフェイクニュースのスタイルや感情的パターンを再現する仕組みを示し、背後にある社会的不安や願望を明らかにする。また、今後の検出研究のためのラベル付きデータセットを提供する。
While the purpose of most fake news is misinformation and political propaganda, our team sees it as a new type of myth that is created by people in the age of internet identities and artificial intelligence. Seeking insights on the fear and desire hidden underneath these modified or generated stories, we use machine learning methods to generate fake articles and present them in the form of an online news blog. This paper aims to share the details of our pipeline and the techniques used for full generation of fake news, from dataset collection to presentation as a media art project on the internet.
研究の動機と目的
- 人工知能とインターネット文化が現代の「神話」に相当するフェイクニュースの生成をどのように可能にするかを調査すること。
- 機械学習を用いた合成フェイクニュース記事の再現可能なパイプラインを開発すること。
- 生成された記事をウェブベースのメディアアートプロジェクトとして提示し、誤情報とその心理的背景に対する反省を促すこと。
- 今後のフェイクニュース検出研究のためのラベル付きデータセットを提供すること。
提案手法
- トピック特化検索クエリを用いて、多様なソースから合計245,973件のニュース記事(1億9,695万語分)を収集した。
- NLPツールを用いたキーワードベースのトピックタグ付け(例:「北朝鮮」「トランプ」「フェイクニュース」)により、データセットをフィルタリングし、専用のサブセットを作成した。
- 各トピック特化データセットに対して、2層構造(128ユニット)とビームサーチを用いたLSTM言語モデルをトレーニングした。
- トレーニング済みモデルを用いて記事の抜粋を生成し、一貫性と構造の向上のため最小限の手動編集を実施した。
- Machinebox Textbox NLPツールを自動的に適用し、現実的なタグを記事に割り当てた。
- 独自に構築したブログ(www.newsby.ml)に生成コンテンツをデプロイし、架空のジャーナリスト像とAI生成ポートレートを追加した。
実験結果
リサーチクエスチョン
- RQ1機械学習モデルを用いて、実世界の誤情報と同様のスタイルと感情的トーンを再現するフェイクニュース記事を生成する方法は何か?
- RQ2現代のフェイクニュース(デジタル神話の新形態として)の内容と構造を形作る要因として、社会的不安や願望が果たす役割は何か?
- RQ3AIが生成したフェイクニュースは、FakerFactのような自動信頼性検出ツールをどれほど効果的に回避できるか?
- RQ4制御された芸術的生成パイプラインは、ウイルス性誤情報のメカニズムを理解する上でどのように貢献できるか?
- RQ5公共的かつ芸術的文脈でAIを用いてフェイクニュースのメカニズムを模倣・暴露することの倫理的含意は何か?
主な発見
- FakerFactによる分類結果、生成されたフェイクニュース記事は「意図的で偏った内容」または「意見表明」と判定され、実際の誤情報と同様のトーンと意図を効果的に模倣していることが示された。
- 本プロジェクトは、3つのテーマ的カテゴリーにわたり245,973件の生成記事を収録した、完全に機能する公開可能なブログ(www.newsby.ml)を成功裏に構築した。
- トピック特化LSTMの使用により、政治的・感情的高揚状態の分野において、実際のニュースの言語的パターンを反映した一貫性のある文章が生成可能であることが実証された。
- 手動による干渉は最小限に抑えられ(冗長語や壊れた文の修正に限定)、生成出力の堅牢性を示している。
- AI生成ジャーナリスト(Misun Lean)とポートレート(PGGANによる生成)の導入により、プロジェクトの現実性と芸術的インパクトが向上した。
- 本プロジェクトは、今後のフェイクニュース検出および生成研究のためのラベル付きデータセットをGitHubに寄付した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。