[論文レビュー] People's Perceptions Toward Bias and Related Concepts in Large Language Models: A Systematic Review
本システマティックレビューは、一般利用者が大規模言語モデル(LLM)のバイアスに関する経験的知見を統合し、15件の研究を通じて、主なバイアス、応用分野、およびユーザーの認識を特定した。ユーザーは、ステレオタイプ化、一貫性の欠如、および幻覚的生成(hallucinations)に対して感受性を示しており、その認識はタスクの文脈、メンタルモデル、信頼のダイナミクスに強く影響を受ける。バイアスの定義に関する明確な欠落と、ユーザー中心の設計のギャップが顕在化している。
Large language models (LLMs) have brought breakthroughs in tasks including translation, summarization, information retrieval, and language generation, gaining growing interest in the CHI community. Meanwhile, the literature shows researchers' controversial perceptions about the efficacy, ethics, and intellectual abilities of LLMs. However, we do not know how people perceive LLMs that are pervasive in everyday tools, specifically regarding their experience with LLMs around bias, stereotypes, social norms, or safety. In this study, we conducted a systematic review to understand what empirical insights papers have gathered about people's perceptions toward LLMs. From a total of 231 retrieved papers, we full-text reviewed 15 papers that recruited human evaluators to assess their experiences with LLMs. We report different biases and related concepts investigated by these studies, four broader LLM application areas, the evaluators' perceptions toward LLMs' performances including advantages, biases, and conflicting perceptions, factors influencing these perceptions, and concerns about LLM applications.
研究の動機と目的
- 実世界の応用において、一般ユーザーが大規模言語モデル(LLM)のバイアスおよび関連問題をどのように認識しているかを理解すること。
- ユーザーが経験すると報告する、特定のバイアスの種類および関連概念(例:ステレオタイプ化、幻覚的生成、一貫性の欠如)を同定すること。
- タスクの種類、分野、ユーザーの期待などの文脈要因が、LLMのパフォーマンスおよび公平性に関する認識にどのように影響するかを検討すること。
- ユーザーのメンタルモデル、信頼性、説明可能性がLLMの認識に与える役割を調査すること。
- 定義の明確さ、バイアスの測定、認識における個人差に関する点で、現在の研究におけるギャップを同定すること。
提案手法
- PRISMA指針に従い、231件の論文をスクリーニングし、含まれる基準を満たす15件を全文レビュー対象として選定したシステマティックレビューを実施した。
- 人間の評価者(一般ユーザーまたは専門外のユーザー)が、実際またはシミュレートされた応用環境でLLMの経験を評価した研究に焦点を当てた。
- バイアスの種類、応用分野、使用されたLLMモデル、対象ユーザー、評価者の人口統計的・経験的プロファイル、および報告された認識をコード化した。
- テーマ的分析を用いて、認識されたバイアス、パフォーマンス上の利点、矛盾する認識、信頼のダイナミクスに関する知見を分類した。
- タスクの文脈、ユーザーの期待、メンタルモデルなどの要因がLLM行動の認識にどのように影響するかを検討した。
- 定義の不一致や、評価者の特徴に関する報告の不足を含む、メソドロジカルなギャップを同定した。
実験結果
リサーチクエスチョン
- RQ1RQ1: ユーザーはLLMにおいて、具体的にどのようなバイアスおよび関連概念(例:ステレオタイプ化、一貫性の欠如、幻覚的生成)を認識しているか?
- RQ2RQ2: LLMはどのような応用分野や文脈でユーザーによって評価されており、それらの文脈が認識にどのように影響しているか?
- RQ3RQ3: 評価者たちはLLMのパフォーマンスについてどのような認識を持ち、特に、利点、バイアス、信頼性や信頼性に関する矛盾する見解は何か?
- RQ4RQ4: タスクの種類、分野、ユーザーの期待、またはメンタルモデルなどの要因が、ユーザーのLLM認識にどのように影響しているか?
- RQ5RQ5: ユーザーのLLMバイアス認識に関する研究における主な懸念事項とギャップは何か?
主な発見
- ユーザーは、人種、性別、宗教、社会的身分に関連するバイアスを頻繁に認識しており、例としてムスリムと暴力を結びつけるステレオタイプ的関連性が含まれる。
- 多くのユーザーが、情報抽出や要約タスクにおいて、事実と異なるまたは架空の内容を生成する「幻覚的生成(hallucinations)」に起因するバイアスを強く感じている。
- 多くのユーザーがLLMをGoogleやWikipediaの代替手段として捉えており、モデルが信ぴょう性のあるが誤った出力を生成した場合に、期待と一致しないことから混乱を示した。
- LLMの認識は文脈依存性が強く、クリエイティブタスク(例:詩の作成)では信頼が厚いが、意思決定や事実中心のタスクではより強い懐疑的態度を示した。
- ユーザーの認識には矛盾が見られた:一部のユーザーは一貫性と流暢さを称賛した一方で、他方では一貫性の欠如、透明性の欠如、推論能力の不足を批判しており、信頼と懐疑の二面性が顕在化した。
- 本レビューでは、研究における深刻なギャップを同定した。具体的には、バイアスの定義が一貫していなく、評価者の人口統計的特徴の報告が限られ、また、認識やメンタルモデルにおける個人差への十分な注目が不足している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。