[論文レビュー] In-context learning agents are asymmetric belief updaters
この論文は、大規模言語モデル(LLMs)における文脈内学習が、意思決定の責任(アジェンシー)が想定される状況では、予測誤差が期待値を上回る(より良い結果)場合に、それより悪い結果(負の予測誤差)よりも多く学習するという非対称な信念更新を示すことを示している。この楽観バイアスは、選択されなかった選択肢についての反事後的フィードバックでは逆転し、アジェンシーが存在しない場合には消滅する。これは人間の認知パターンと類似しており、最適な学習を目的としたメタ強化学習(Meta-RL)エージェントにも同様の傾向が現れる。これは、特定のフレーミング下では、このような非対称性が合理的である可能性を示唆している。
We study the in-context learning dynamics of large language models (LLMs) using three instrumental learning tasks adapted from cognitive psychology. We find that LLMs update their beliefs in an asymmetric manner and learn more from better-than-expected outcomes than from worse-than-expected ones. Furthermore, we show that this effect reverses when learning about counterfactual feedback and disappears when no agency is implied. We corroborate these findings by investigating idealized in-context learning agents derived through meta-reinforcement learning, where we observe similar patterns. Taken together, our results contribute to our understanding of how in-context learning works by highlighting that the framing of a problem significantly influences how learning occurs, a phenomenon also observed in human cognition.
研究の動機と目的
- 制御された強化学習タスクにおけるLLMsの文脈内学習ダイナミクスと人間の認知プロセスを比較する。
- 問題のフレーミングを変化させることで、LLMsにおける非対称な信念更新が認知バイアスであるか、合理的な戦略であるかを特定する。
- メタ強化学習(Meta-RL)を用いて最適な学習を目的とした理想化された文脈内学習エージェントが、LLMsおよび人間で観察された非対称な学習パターンを再現するかを評価する。
- アジェンシーと反事後的フィードバックが、人工的および人間のエージェントにおける学習非対称性をどのように形成するかを評価する。
- これらの発見が、実世界の応用における効果的な文脈内学習プロンプト設計に与えるインパクトを検討する。
提案手法
- 認知心理学の二択強制選択(2AFC)タスクを改変し、LLMs、人間、およびメタ強化学習(Meta-RL)エージェントにおける文脈内学習ダイナミクスを研究した。
- 行動データにリスコラ=ウォーゲルモデルの変種を適合させ、学習速度を推定し、信念更新ルールを推察した。
- アドバンスド・アダム(ADAM)最適化を用いたアクタークリティック強化学習により、TransformerベースのMeta-RLエージェントを2AFCタスクで学習させ、収束時にベイズ最適な文脈内学習が可能になった。
- 部分的フィードバック(選択された選択肢のみ)、完全なフィードバック(両方の選択肢)、強制選択(アジェンシーなし)の3条件を比較した。
- 計算モデリングを用いて学習速度パラメータを抽出・比較し、正のおよび負の予測誤差間の非対称性に注目した。
- 訓練後、重みの更新を一切行わず、文脈内学習行動を分離して評価した。

実験結果
リサーチクエスチョン
- RQ1LLMsにおける文脈内学習は、正の予測誤差(期待値を上回る結果)よりも負の予測誤差(期待値を下回る結果)を重視する非対称な信念更新を示すか?
- RQ2タスクフレーミングにおけるアジェンシーの有無が、LLMsにおける学習非対称性にどのように影響するか?
- RQ3選択されなかった(反事後的)選択肢についてのフィードバックが提供された場合、学習パターンは逆転するか?
- RQ4最適な学習を目的とした理想化されたMeta-RLエージェントは、LLMsおよび人間と同様の非対称な学習パターンを再現するか?
- RQ5Meta-RLエージェントの行動が示唆するように、研究されたタスク条件下で非対称な信念更新は合理的か?
主な発見
- LLMsは、アジェンシーが想定される状況では、予測誤差が期待値を上回る(より良い結果)場合に、それより悪い結果(負の予測誤差)よりも多く学習する楽観バイアスを示す。
- 選択されなかった選択肢についてのフィードバックが提供されると、学習非対称性は逆転する:LLMsは、その選択肢に関して、正の予測誤差よりも負の予測誤差から多く学習する。
- アジェンシーが想定されない強制選択の試行では、楽観バイアスが消失する。これは、選択と制御のフレーミングが非対称な更新の出現に極めて重要であることを示している。
- 2AFCタスクでベイズ最適な学習を目的としたMeta-RLエージェントは、LLMsおよび人間と同様の非対称な学習パターンを再現する。これは、このような行動がタスク構造下では合理的である可能性を確認している。
- 観察された学習非対称性は、モデルアーキテクチャの副産物ではなく、特にアジェンシーと反事後的フィードバックといった問題のフレーミングによって駆動されている。これは、設計選択が学習結果に顕著に影響することを示唆している。
- これらの発見は、人間およびLLMsにおける楽観バイアスが認知的欠陥ではなく、特に選択された結果しか観測されないような特定のタスク構造に対する合理的な反応である可能性を示唆している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。