[論文レビュー] What Large Language Models Know and What People Think They Know
本研究では、大規模言語モデル(LLMs)の内部的信頼度と、人間のユーザーがその信頼度をどのように認識するかの乖離(キャリブレーションギャップ)を、複数選択式の質問・回答タスクにおいて調査している。LLMの説明を、内部的信頼度を反映するように調整したプロンプトを用いることで、研究者はユーザーがモデルの信頼性をより正確に評価できるようになり、過剰な自信を減らし、AI出力に対する信頼を高めることができた。
As artificial intelligence (AI) systems, particularly large language models (LLMs), become increasingly integrated into decision-making processes, the ability to trust their outputs is crucial. To earn human trust, LLMs must be well calibrated such that they can accurately assess and communicate the likelihood of their predictions being correct. Whereas recent work has focused on LLMs' internal confidence, less is understood about how effectively they convey uncertainty to users. Here we explore the calibration gap, which refers to the difference between human confidence in LLM-generated answers and the models' actual confidence, and the discrimination gap, which reflects how well humans and models can distinguish between correct and incorrect answers. Our experiments with multiple-choice and short-answer questions reveal that users tend to overestimate the accuracy of LLM responses when provided with default explanations. Moreover, longer explanations increased user confidence, even when the extra length did not improve answer accuracy. By adjusting LLM explanations to better reflect the models' internal confidence, both the calibration gap and the discrimination gap narrowed, significantly improving user perception of LLM accuracy. These findings underscore the importance of accurate uncertainty communication and highlight the effect of explanation length in influencing user trust in AI-assisted decision-making environments. Code and Data can be found at https://osf.io/y7pr6/ . Journal publication can be found on Nature Machine Intelligence at https://www.nature.com/articles/s42256-024-00976-7 .
研究の動機と目的
- LLMが出力する回答における内部的信頼度と、人間のユーザーがその信頼度をどのように認識するかの乖離を調査すること。
- 説明スタイルの変更によって、人間がLLM出力に対する信頼度を向上させられるかどうかを検討すること。
- モデルの信頼度に配慮した説明が、正しい回答と誤りの回答をユーザーがどれだけ正確に識別できるかに与える影響を評価すること。
- 自己評価した専門性が、ユーザーがLLMの信頼性を判断する能力に与える影響を評価すること。
- LLMの内部的信頼度とユーザーの認識を一致させる手法を開発・検証すること。
提案手法
- MMLUデータセットを用いた行動実験を実施し、参加者に複数選択式の質問とそれに伴うLLMの回答を提示した。
- 各LLMの回答について、ユーザーがその正答性をどの程度信じているかを確率として評価した(人間の信頼度推定)。
- 2種類の異なるプロンプティング戦略を用いてLLMの説明を生成した:デフォルトの説明と、内部モデルの信頼度に基づいた信頼度修正済みの説明。
- 信頼度修正済みのプロンプトを用い、モデルの内部的確信度に応じて、低信頼度(例:「あまり確信がない…」)から高信頼度(例:「自信がある…」)までの説明を生成した。
- GPT-3.5とPaLM2の両方のLLMを用い、異なる説明タイプとLLMの組み合わせにおいて、ユーザーの正答推定の正確性と識別能力(AUC)を比較した。
- 自己評価した専門性が、ユーザーの信頼度キャリブレーションと識別性能に与える影響を分析した。

実験結果
リサーチクエスチョン
- RQ1LLMの内部的信頼度と、人間のユーザーがLLMの信頼性を認識する際の乖離は、どの程度大きいのか?
- RQ2LLMの内部的信頼度を反映するように説明を調整することで、人間がLLM出力に対する信頼度を向上させられるか?
- RQ3信頼度を修正した説明を用いることで、ユーザーがLLMの回答に対して過剰な自信を持つのを減らせるか?
- RQ4自己評価した専門性が、ユーザーがLLMのパフォーマンスを正確に判断する能力に影響を与えるか?
- RQ5GPT-3.5とPaLM2などの異なるLLMでは、ユーザーの信頼度キャリブレーションの観点で、どの程度異なるか?
主な発見
- デフォルトの説明に依存する場合、ユーザーは誤った回答についても、常にその正答性を過剰に評価していた。
- LLMの内部的信頼度を反映するように説明を調整した場合、ユーザーの信頼度推定が著しく改善され、モデルの実際の信頼度レベルに近づいた。
- 信頼度を修正した説明が使用された場合、正しい回答と誤った回答を識別する能力(AUC)が向上し、ユーザーの識別能力が向上した。
- GPT-3.5とPaLM2の両方において、ユーザーの信頼度キャリブレーションの向上が一貫して見られ、このアプローチの強固さが裏付けられた。
- 自己評価した専門性は、ユーザーがLLMの正答性を推定する能力や、正しい・誤った回答を識別する能力に顕著な影響を及ぼさなかった。
- デフォルト設定では、ユーザーが誤った回答に対して、モデルの信頼度よりも高い信頼度を割り当てており、顕著なキャリブレーションギャップが確認された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。