[論文レビュー] Learning Altruistic Behaviours in Reinforcement Learning without External Rewards
本論文では、他のエージェントの将来の選択肢(状態の到達可能性)を最大化することで、外部報酬や他のエージェントの目的を知らなくても利他の行動を学ぶ強化学習フレームワークを提案する。この手法は内発的欲求(インセンティブ・キュリオシティ)を用いてリーダー・エージェントの将来の状態を推定・最大化し、外部報酬なしでマルチエージェント環境において教師ありベースラインと同等またはそれ以上の性能を達成する。
Can artificial agents learn to assist others in achieving their goals without knowing what those goals are? Generic reinforcement learning agents could be trained to behave altruistically towards others by rewarding them for altruistic behaviour, i.e., rewarding them for benefiting other agents in a given situation. Such an approach assumes that other agents' goals are known so that the altruistic agent can cooperate in achieving those goals. However, explicit knowledge of other agents' goals is often difficult to acquire. In the case of human agents, their goals and preferences may be difficult to express fully; they might be ambiguous or even contradictory. Thus, it is beneficial to develop agents that do not depend on external supervision and learn altruistic behaviour in a task-agnostic manner. We propose to act altruistically towards other agents by giving them more choice and allowing them to achieve their goals better. Some concrete examples include opening a door for others or safeguarding them to pursue their objectives without interference. We formalize this concept and propose an altruistic agent that learns to increase the choices another agent has by preferring to maximize the number of states that the other agent can reach in its future. We evaluate our approach in three different multi-agent environments where another agent's success depends on altruistic behaviour. Finally, we show that our unsupervised agents can perform comparably to agents explicitly trained to work cooperatively, in some cases even outperforming them.
研究の動機と目的
- 他のエージェントの目的を知らなくても、外部報酬を受け取らなくても利他の行動をとるエージェントを開発すること。
- エージェントの将来の選択肢(状態の到達可能性)を最大化することが、利他の一般的代理指標として機能するかを調査すること。
- 教師なしで内発的報酬に基づく学習が、マルチエージェント環境における教師あり協調学習を同等または上回る性能を達成できるかを評価すること。
- 将来の選択肢を最大化するという目的が、理論的裏付けはあるが、最適でない行動をとる可能性がある失敗モードを特定すること。
提案手法
- 利他のエージェントは、リーダー・エージェントの将来の状態の到達可能性に基づく内発的報酬信号を用いる。
- 内発的欲求(IC)は、時間経過に伴うリーダーの状態分布を予測するモデルを用いて推定され、利他のエージェントがリーダーの選択肢を維持または拡大するよう促される。
- この手法は、すべてのエージェントを観測できるが、観測されない利他のエージェントがリーダーの選択肢を最大化するマルチエージェント強化学習フレームワークに実装されている。
- 標準的な深層強化学習アルゴリズム(例:SAC)を用いて訓練され、外的報酬の形状付けは一切行われない。
- タスクに依存しない協調行動を評価するために、グリッドワールド、ロケモーション、タグの3つの環境が使用された。
- この手法は、ランダム、境界ペナルティ付き、教師ありベースライン(共有報酬付きの変種を含む)と比較された。
実験結果
リサーチクエスチョン
- RQ1エージェントは、他のエージェントの目的を知らず、外部報酬を受け取らなくても、利他の行動を学習できるか?
- RQ2他のエージェントの到達可能な将来の状態の数を最大化することは、多様な環境における利他の適切な代理指標として機能するか?
- RQ3教師なしの利他のエージェントの性能は、教師あり協調エージェントと比較してどうなるか?
- RQ4選択肢最大化目的の失敗モードは何か?また、ハイパーパrameterに依存するか?
主な発見
- タグ環境では、提案手法により1エピソードあたりリーダーが捕まる回数が2.87 ± 0.96回に減少し、教師ありベースライン(6.94 ± 1.13)を顕著に上回った。
- タグ環境において、無教師の利他のエージェントはランダム、ケージペナルティ付き、さらには教師ありエージェントよりも優れた性能を発揮し、内発的欲求に基づく報酬の有効性を示した。
- ロケモーション環境では、すべての無教師ベースラインを上回り、教師あり性能と同等またはそれを上回った。これは、タスクにわたる高いロバストネスを示している。
- グリッドワールドの実験では、利他のエージェントがドアを開け、リーダーがより多くの状態に到達できるようにした。これは、メカニズムの機能的妥当性を確認するものである。
- 選択肢最大化が、リーダーの目的と状態の多様性が一致しない場合に、最適でない行動を引き起こす失敗事例を同定した。これは、ハイパーパrameterの注意深い調整の必要性を示唆している。
- 結果から、内発的欲求に基づく選択肢最大化は、目的情報が入手できないマルチエージェント強化学習における利他の代替指標として実用的で、スケーラブルかつ効果的であると考えられる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。