[論文レビュー] ChatGPT and Bard Responses to Polarizing Questions
本研究は、米国中心の対立的トピックに関して、ChatGPTとBardの偏りを調査するため、公開可能でアノテート済みのデータセットを構築した。両モデルとも左寄りのバイアスを示しているが、Bardはより包括的かつ一般的でない回答を提供しており、誤情報のリスクが高まる一方で、複雑な議論においてより有用であることがわかった。
Recent developments in natural language processing have demonstrated the potential of large language models (LLMs) to improve a range of educational and learning outcomes. Of recent chatbots based on LLMs, ChatGPT and Bard have made it clear that artificial intelligence (AI) technology will have significant implications on the way we obtain and search for information. However, these tools sometimes produce text that is convincing, but often incorrect, known as hallucinations. As such, their use can distort scientific facts and spread misinformation. To counter polarizing responses on these tools, it is critical to provide an overview of such responses so stakeholders can determine which topics tend to produce more contentious responses -- key to developing targeted regulatory policy and interventions. In addition, there currently exists no annotated dataset of ChatGPT and Bard responses around possibly polarizing topics, central to the above aims. We address the indicated issues through the following contribution: Focusing on highly polarizing topics in the US, we created and described a dataset of ChatGPT and Bard responses. Broadly, our results indicated a left-leaning bias for both ChatGPT and Bard, with Bard more likely to provide responses around polarizing topics. Bard seemed to have fewer guardrails around controversial topics, and appeared more willing to provide comprehensive, and somewhat human-like responses. Bard may thus be more likely abused by malicious actors. Stakeholders may utilize our findings to mitigate misinformative and/or polarizing responses from LLMs
研究の動機と目的
- LLMの対立的トピックに対する反応に関するアノテート済みデータセットの不足に応えること。特に規制や政策開発の文脈において。
- ChatGPTとBardが、銃撃規制、中絶、移民改革といった極めて対立的な米国問題に対してどのように反応するかを調査すること。
- これらのモデルが、分断的な社会的・政治的トピックに対して、トーンや内容の両面でバイアスを示すかどうかを評価すること。
- 一般的なデフォルト(例:「AI言語モデルとして…」)とトピック固有の回答との間の応答生成のパターンを同定すること。
- 根拠に基づく政策的・設計的対策を通じて、LLMベースのチャットボットが引き起こす誤情報や分極化のリスクを低減するためのステークホルダーへの知見提供。
提案手法
- Quoraから100件の極めて対立的な質問を収集し、米国特有の社会的・政治的問題に焦点を当てた。
- 標準化されたプロンプトを用いて、各質問に対してChatGPTおよびGoogleのBard(LaMDAを基盤とする)から応答を生成した。
- n-gram頻度分析を用いて応答内容を分析し、繰り返し現れるフレーズやテーマ的焦点を特定した。
- 一般的なテンプレートの使用とトピック固有の詳細の両面から、応答スタイルの定性的・定量的比較を実施した。
- 言語的トーン、事実に関する主張、および進歩的・保守的立場との整合性を評価することで、応答バイアスを評価した。
- 今後のLLM行動や政策開発に関する研究を目的として、公開可能でアノテート済みの応答データセットを構築した。
実験結果
リサーチクエスチョン
- RQ1ChatGPTとBardは、米国における極めて対立的なトピックに対してどのように反応するか?
- RQ2ChatGPTとBardは、対立的な社会的・政治的トピックに対して、検出可能なイデオロギー的バイアスを示しているか?
- RQ3応答生成のパターン(例:「AI言語モデルとして…」のような一般的な免責条項の使用)はどのようなものか?また、トピックごとにどのように変化するか?
- RQ4ChatGPTとBardの応答スタイルは、深さ、具体的さ、中立性の観点でどのように異なるか?
- RQ5これらのモデルはどれほど非特定的またはテンプレートベースの応答に依存するか?また、どのトピックがより包括的な回答を引き出すか?
主な発見
- ChatGPTとBardの両方とも、対立的トピックに対する応答で左寄りのバイアスを示しており、Bardは進歩的フレーミングへの傾向がより強い。
- Bardは、銃撃規制や予防接種といった対立的トピックに対して、ChatGPTよりも詳細で一般的でない回答を提供する傾向が高かった。
- ChatGPTは、ビーガニズム、移民改革、中絶といったトピックに対して、「AI言語モデルとして…」のような一般的なフレーズを頻繁に使用しており、応答の抑制またはセーフティフィルタリングの兆候が示された。
- n-gram分析により、Bardの応答はよりトピックに焦点を当てており、『銃撃規制法』や『予防接種は安全で効果的』といったフレーズが、より深い関与を示していることがわかった。
- ChatGPTは応答行動に一貫性がなく、警察の暴力といった一部の対立的トピックでは詳細な回答を提供する一方、他のトピックではテンプレートに依存していた。
- Bardは強いガードレールを備えていなかったため、包括的で人間らしい応答を生成しやすく、結果として誤情報の拡散リスクが高まった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。