[論文レビュー] In Generative AI we Trust: Can Chatbots Effectively Verify Political Information?
本研究では、ChatGPTとBing Chat(現在のMicrosoft Copilot)が、英語、ロシア語、ウクライナ語の多言語プロンプトを用いて、COVID-19、ロシアによるウクライナ侵攻、ホロコースト、気候変動、LGBTQ+問題の5つの感受性の高いトピックについて、政治的主張の検証能力を評価している。微調整なしでChatGPTは平均72%の正確性を達成し、Bing Chatの67%を上回ったが、言語、トピック、出典の帰属によって顕著な差が見られた。
This article presents a comparative analysis of the ability of two large language model (LLM)-based chatbots, ChatGPT and Bing Chat, recently rebranded to Microsoft Copilot, to detect veracity of political information. We use AI auditing methodology to investigate how chatbots evaluate true, false, and borderline statements on five topics: COVID-19, Russian aggression against Ukraine, the Holocaust, climate change, and LGBTQ+ related debates. We compare how the chatbots perform in high- and low-resource languages by using prompts in English, Russian, and Ukrainian. Furthermore, we explore the ability of chatbots to evaluate statements according to political communication concepts of disinformation, misinformation, and conspiracy theory, using definition-oriented prompts. We also systematically test how such evaluations are influenced by source bias which we model by attributing specific claims to various political and social actors. The results show high performance of ChatGPT for the baseline veracity evaluation task, with 72 percent of the cases evaluated correctly on average across languages without pre-training. Bing Chat performed worse with a 67 percent accuracy. We observe significant disparities in how chatbots evaluate prompts in high- and low-resource languages and how they adapt their evaluations to political communication concepts with ChatGPT providing more nuanced outputs than Bing Chat. Finally, we find that for some veracity detection-related tasks, the performance of chatbots varied depending on the topic of the statement or the source to which it is attributed. These findings highlight the potential of LLM-based chatbots in tackling different forms of false information in online environments, but also points to the substantial variation in terms of how such potential is realized due to specific factors, such as language of the prompt or the topic.
研究の動機と目的
- 大規模言語モデル(LLM)ベースのチャットボットが、多様で重要なトピックにおける政治的主張の真偽を検出できる能力を評価すること。
- 英語、ロシア語、ウクライナ語を含む、高リソース言語と低リソース言語の間で性能がどのように異なるかを調査すること。
- チャットボットが、誤情報、誤解情報、陰謀論といった政治的コミュニケーションの概念をどのように解釈し、適用するかを検討すること。
- 主張を特定の政治的・社会的参加者(例:政府、NGO、過激主義団体)に帰属させることで、その出典がチャットボットの真偽評価にどのように影響するかを分析すること。
- 異なるプロンプトや文脈において、LLMベースの事実確認に見られる体系的なバイアスや一貫性の欠如を同定すること。
提案手法
- OpenAIのChatGPTとMicrosoftのBing Chat(現在はCopilotにリブランド)という2つの代表的なLLMベースのチャットボットを用いた比較分析を実施。
- AI監査手法を採用し、COVID-19、ウクライナにおけるロシアの侵略、ホロコースト、気候変動、LGBTQ+に関する議論の5つの政治的トピックについて、合計150の主張を対象に、チャットボットの反応を体系的にテスト。
- 定義に基づくプロンプトを用いて、チャットボットが誤情報、誤解情報、陰謀論としての主張を正しく分類できるかを評価。
- 英語(高リソース言語)、ロシア語、ウクライナ語(低リソース言語)の3言語で性能をテストし、言語的バイアスを評価。
- 同一の主張を異なる政治的・社会的参加者(例:政府、NGO、過激主義団体)に帰属させることで、出典バイアスを模擬し、反応の一貫性を評価。
- 真のラベルを用いて全タスクの正確性を定量的に測定し、質的出力を分析してニュアンスと一貫性を検証。
実験結果
リサーチクエスチョン
- RQ1ChatGPTとBing Chatは、多様で感受性の高いトピックにおいて、政治的主張の真偽をどの程度正確に評価できるか?
- RQ2同じ評価タスクにおいて、高リソース言語(英語)と低リソース言語(ロシア語、ウクライナ語)の間で性能にどのような差が生じるか?
- RQ3チャットボットは、誤情報、誤解情報、陰謀論といった政治的コミュニケーション現象をどの程度正しく識別・分類できるか?
- RQ4主張を異なる政治的・社会的参加者に帰属させることで、チャットボットの真偽評価にどのような影響が生じるか?
- RQ5LLMベースの事実確認において、トピック、言語、出典帰属の観点から、性能にどのような体系的なばらつきが見られるか?
主な発見
- ChatGPTは微調整なしで、全言語および全トピックにおいて平均72%の正確性を示し、Bing Chatを上回った。
- Bing Chatは同様の評価タスクにおいて平均67%の正確性を示したが、低い性能を示した。
- 高リソース言語と低リソース言語の間で顕著な差が生じ、英語に比べてロシア語およびウクライナ語の正確性が著しく低下した。
- ChatGPTは誤情報や陰謀論といった政治的コミュニケーション概念を分類する際、より洗練され、文脈に適した回答を提供した。
- トピックによって性能に顕著な差が見られ、気候変動のような事実中心のトピックでは高い正確性を示したが、ホロコーストやLGBTQ+に関する議論のような感情的・イデオロギー的敏感なトピックでは正確性が低かった。
- 出典の帰属が評価に顕著な影響を及ぼしており、主張の事実内容が同一であっても、出典の信頼性やイデオロギー的性質に応じてチャットボットの評価が変化する傾向が見られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。