[論文レビュー] Learning Zero-Shot Cooperation with Humans, Assuming Humans Are Biased
本稿では、自己対戦学習中に人間の行動バイアスを隠れた報酬関数として明示的にモデル化する、新しいマルチエージェント強化学習フレームワークであるHidden-Utility Self-Play(HSP)を提案する。多様なバイアス付き目的関数に基づいて最適化された方策をポリシー・プールに追加することで、HSPは人間とのゼロショット協調を可能にし、Overcookedベンチマークにおいて、学習済みモデル、スクリプト化された方策、および実際の人間参加者を含む、あらゆる種類のパートナーに対して、ベースラインと比較して顕著に高い報酬と優れた人間支援評価を得た。
There is a recent trend of applying multi-agent reinforcement learning (MARL) to train an agent that can cooperate with humans in a zero-shot fashion without using any human data. The typical workflow is to first repeatedly run self-play (SP) to build a policy pool and then train the final adaptive policy against this pool. A crucial limitation of this framework is that every policy in the pool is optimized w.r.t. the environment reward function, which implicitly assumes that the testing partners of the adaptive policy will be precisely optimizing the same reward function as well. However, human objectives are often substantially biased according to their own preferences, which can differ greatly from the environment reward. We propose a more general framework, Hidden-Utility Self-Play (HSP), which explicitly models human biases as hidden reward functions in the self-play objective. By approximating the reward space as linear functions, HSP adopts an effective technique to generate an augmented policy pool with biased policies. We evaluate HSP on the Overcooked benchmark. Empirical results show that our HSP method produces higher rewards than baselines when cooperating with learned human models, manually scripted policies, and real humans. The HSP policy is also rated as the most assistive policy based on human feedback.
研究の動機と目的
- 既存の自己対戦マルチエージェント強化学習手法が、人間パートナーが同一の環境報酬関数を最適化すると仮定しているという制限を解消すること。
- 人間の行動バイアスを明示的にモデル化することで、人間-AI協調におけるゼロショット一般化を向上させること。
- 自己対戦中に多様でバイアスのかかった方策を生成するスケーラブルな手法を開発し、未観測の人間パートナーへの適応性を高めること。
- 実際の人間との対話においてフレームワークを評価し、先行手法を上回る支援的行動を示すこと。
提案手法
- HSPは、人間のバイアスを未知だが一貫したものと仮定して、標準的な自己対戦に隠れた報酬関数を導入することで拡張する。
- 隠れた報酬空間を環境報酬の線形関数として近似することで、バイアス付き目的関数の効率的探索を可能にする。
- 近似された隠れた報酬空間におけるランダムサーチにより、多様な人間の好みに一致する戦略を含むポリシー・プールを生成する。
- 最終的な適応的ポリシーは、この拡張済みポリシー・プールに対して訓練されることで、未観測の人間行動へのゼロショット一般化を向上させる。
- 本手法は二段階フレームワークを維持する:(1) バイアス付き目的関数によるポリシー・プール生成、(2) 陰伏的学習またはマルチエージェント強化学習による適応的ポリシー訓練。
- 本手法は、実際の人間参加者、学習済み人間モデル、スクリプト化されたバイアス付き方策を含むOvercookedベンチマークで評価された。

実験結果
リサーチクエスチョン
- RQ1自己対戦において人間のバイアスを隠れた報酬関数としてモデル化することで、人間とのゼロショット協調が向上するか?
- RQ2実データに基づいて訓練された人間行動モデルと協調する際、HSPはベースラインと比較してどのように性能を発揮するか?
- RQ3HSPは、最適化されない戦略やスキルレベルの違いを含む多様な人間の好みにも、より良い一般化を示せるか?
- RQ4実際の人間参加者がHSPを、既存のAIエージェントと比較して、どの程度支援的だと評価するか?
- RQ5HSPは、他のエージェントが学習に失敗するような複雑な協調戦略(例:カウンターパassing、ミックススープ回避)を発見・実行できるか?
主な発見
- HSPは、Many Ordersレイアウトにおいて平均エピソード報酬が最も高く、2つの人間役でそれぞれ384.3点および380.7点を記録し、すべてのベースラインを顕著に上回った。
- Counter Circuitレイアウトでは、HSPが平均155.2の報酬を達成し、次善のベースラインであるMEP(134.5)を上回り、1エピソードあたり1回分のスープ配達に相当する20.7ポイントの差を付けた。
- Coordination Ringを除くすべてのレイアウトで、人間参加者から最も支援的だと評価された。
- Distant Tomatoレイアウトでは、HSPは必要なときにトマトを正しく配置することで、無効な注文を回避したが、FCP、MEP、TrajDivエージェントは繰り返しトマトが入った鍋にオニオンを配置していた。
- HSPはCounter Circuitでカウンターパassing戦略を正常に実行し、上位および下位の両プレイヤーがタスクに貢献した。一方、他のエージェントはこの複雑なパターンの協調に失敗していた。
- 人間の好み分析では、HSPはMany Ordersで+0.38、Counter Circuitで+0.32の好みスコアを示し、ベースラインを上回る大多数の支持を得た。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。