Skip to main content
QUICK REVIEW

[論文レビュー] Who's Thinking? A Push for Human-Centered Evaluation of LLMs using the XAI Playbook

Teresa Datta, John P. Dickerson|arXiv (Cornell University)|Mar 10, 2023
Topic Modeling被引用数 4
ひとこと要約

この論文は、説明可能なAI(XAI)のアプローチを応用することで、人間中心の大型言語モデル(LLM)の評価を提唱している。主な焦点は、メンタルモデル、ユースケースの有用性、認知的関与である。LLMは技術的指標だけでなく、人間の認知、バイアス、現実世界のタスクに基づいて評価されなければならないと主張し、過剰な依存や幻覚現象のリスクを強調している。

ABSTRACT

Deployed artificial intelligence (AI) often impacts humans, and there is no one-size-fits-all metric to evaluate these tools. Human-centered evaluation of AI-based systems combines quantitative and qualitative analysis and human input. It has been explored to some depth in the explainable AI (XAI) and human-computer interaction (HCI) communities. Gaps remain, but the basic understanding that humans interact with AI and accompanying explanations, and that humans' needs -- complete with their cognitive biases and quirks -- should be held front and center, is accepted by the community. In this paper, we draw parallels between the relatively mature field of XAI and the rapidly evolving research boom around large language models (LLMs). Accepted evaluative metrics for LLMs are not human-centered. We argue that many of the same paths tread by the XAI community over the past decade will be retread when discussing LLMs. Specifically, we argue that humans' tendencies -- again, complete with their cognitive biases and quirks -- should rest front and center when evaluating deployed LLMs. We outline three developed focus areas of human-centered evaluation of XAI: mental models, use case utility, and cognitive engagement, and we highlight the importance of exploring each of these concepts for LLMs. Our goal is to jumpstart human-centered LLM evaluation.

研究の動機と目的

  • LLMが広く公に利用されているにもかかわらず、人間中心の評価が不足している問題に対処する。
  • 人間の認知、バイアス、現実世界の意思決定を無視する現行のLLM評価フレームワークにおけるギャップを特定する。
  • 説明可能なAI(XAI)からの知見をLLMに適用し、同様に人間中心の評価原則がLLM開発を導くべきだと主張する。
  • LLM出力に対する無検討な認知的関与のリスク、特に過剰な信頼や幻覚現象を浮き彫りにする。
  • ユーザーがLLMのメンタルモデルをどのように形成するか、それが現実のタスクでどれほど有用か、そして出力に対してどれほど関与するかを調査する研究を呼びかける。

提案手法

  • XAIの評価フレームワーク(特にメンタルモデル、ユースケースの有用性、認知的関与)を、LLM評価のための構造的アプローチに適応する。
  • XAIの人間中心の評価と現在のLLMの状態との類似性を強調し、信頼性、解釈可能性、使いやすさの分野で共通する課題を指摘する。
  • 実世界のタスク(例:メール作成や意思決定支援)におけるLLMの有用性を評価する、ユースケースベースのユーザースタディを提案する。
  • ユーザーの関与を高め、過剰な依存によるエラーを減らすために、認知的フォースティング戦略(例:事前チェックタスク)を導入する。
  • 定性的および定量的分析を用いて、ユーザーがLLM出力をどのように解釈し、信頼し、対話するかを評価する。
  • モデルのパフォーマンスだけでなく、確認バイアスやユーザーの意図との不一致を含む、人間とAIの相互作用のダイナミクスを測定することの重要性を強調する。

実験結果

リサーチクエスチョン

  • RQ1一般ユーザーは、LLMが応答を生成する仕組みについて、どのようにメンタルモデルを形成するか?
  • RQ2メール作成や意思決定支援などの実世界のユースケースにおいて、LLMはどの程度実用的な有用性を提供するか?
  • RQ3LLM出力に対する認知的関与は、ユーザー行動、信頼性、エラー率にどのように影響するか?
  • RQ4確認バイアスなどの認知的バイアスは、ユーザーがLLM出力をどのように解釈するかにどのような影響を与えるか?
  • RQ5認知的フォースティング戦略は、ユーザーの出力への注意を高め、過剰な依存を減らすのにどの程度効果的か?

主な発見

  • 現在のLLM評価指標は人間中心ではなく、認知バイアス、メンタルモデル、現実世界の使いやすさを十分に反映していない。
  • XAIと同様に、LLMの説明には真の基準がないため、技術的忠実性と頑健性だけでは評価が不十分である。
  • 実際には、LLM出力に対する認知的関与は低く、時間的圧力や高信頼度の幻覚がある状況ではエラーのリスクが高まる。
  • 研究では、ユーザーが応答が誤りであっても、特に自信を持って表現された場合にLLMを信頼しがちなことが示されており、これは「サービスとしてのマスプリンティング」とも例えられる。
  • 事前確認を義務付けるなどの認知的フォースティング戦略は、パフォーマンスの向上とエラーの削減に顕著な効果を示している。
  • 特にChatGPTのような公的向けツールでのLLMの規模の大きな展開は、制御のない認知的オフローディングのリスクを拡大しており、人間中心の評価が急務である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。