[論文レビュー] Social diversity and social preferences in mixed-motive reinforcement learning
本稿は、混合動機のゲームにおける多様な社会的好みをモデル化するため、マルチエージェント強化学習に社会的価値指向(SVO)を導入する。自己中心的から利他の傾向まで多様なSVOを有するエージェントを設定することで、集団的パフォーマンスおよびポリシーの一般化という観点から、同質な集団よりも異質な集団が優れていることを示している。特に、平等性に敏感な指標において顕著である。
Recent research on reinforcement learning in pure-conflict and pure-common interest games has emphasized the importance of population heterogeneity. In contrast, studies of reinforcement learning in mixed-motive games have primarily leveraged homogeneous approaches. Given the defining characteristic of mixed-motive games--the imperfect correlation of incentives between group members--we study the effect of population heterogeneity on mixed-motive reinforcement learning. We draw on interdependence theory from social psychology and imbue reinforcement learning agents with Social Value Orientation (SVO), a flexible formalization of preferences over group outcome distributions. We subsequently explore the effects of diversity in SVO on populations of reinforcement learning agents in two mixed-motive Markov games. We demonstrate that heterogeneity in SVO generates meaningful and complex behavioral variation among agents similar to that suggested by interdependence theory. Empirical results in these mixed-motive dilemmas suggest agents trained in heterogeneous populations develop particularly generalized, high-performing policies relative to those trained in homogeneous populations.
研究の動機と目的
- 混合動機の環境におけるマルチエージェント強化学習における社会的好みの多様性の影響を調査すること。
- 純粋な対立や純粋な共通利益の設定とは異なり、混合動機のマコフゲームにおいて相手の異質性にあまり注目されていない問題に取り組むこと。
- 報酬配分に対する内発的動機の形式的表現としての社会的価値指向(SVO)を用いて、人間らしい社会的好みをモデル化すること。
- SVOの多様性が、同質な集団と比較して、より頑健で高パフォーマンスで一般化されたエージェントのポリシーを生み出すかどうかを評価すること。
- エージェントの動機を相互依存理論とSVOフレームワークに基づけて、マルチエージェントRLと社会心理学を橋渡しすること。
提案手法
- 自己と他者への報酬に対する好みのパrameterized表現としての社会的価値指向(SVO)を強化学習エージェントに付与した。
- SVOを2つの混合動機のマコフゲーム(HarvestPatchと、変更を加えた囚人のジレンマの変種)に適用した。
- SVOを内発的動機の一部として組み込んだマルチエージェント強化学習アルゴリズムを用いてエージェントを訓練した。
- 集団内のSVO分布を変化させ、同質な(例:全員が利他的)および異質な(例:自己中心的、利的、競争的が混在)トレーニング制度を構築した。
- 相互依存理論からの報酬変換プロセスを用いて、原始的な報酬を主観的な好みを反映した有効な報酬行列に変換した。
- 集団報酬および平等性に敏感な指標(例:報酬分配のジニ係数)を用いてパフォーマンスを評価した。
実験結果
リサーチクエスチョン
- RQ1混合動機のマコフゲームにおける社会的好み(SVO)の集団的異質性は、学習結果にどのように影響するか?
- RQ2内発的動機におけるSVOに基づく多様性は、同質なSVO集団と比較して、より高い集団的パフォーマンスをもたらすか?
- RQ3異質なSVO集団で訓練されたエージェントは、同質な環境で訓練されたエージェントと比較して、より一般化され、頑健なポリシーを発展させるか?
- RQ4SVOに基づく好みは、マルチエージェント相互作用において、相互依存理論の予測とどの程度一致するか?
- RQ5SVOの多様性は、両エージェントが同時に利的変換を採用する場合に生じる非効率性を緩和できるか?
主な発見
- 異質なSVO集団は、特に平等性に敏感な指標において、同質な利的集団よりも顕著に高い集団的リターンを達成した。
- 異質な集団で訓練されたエージェントは、多様な相手の行動に頑健に対応できるより一般化されたポリシーを発展させた。
- HarvestPatch環境では、SVOがより高いエージェントが、リンゴが未収穫の状態でも川を綺麗にする傾向が強く、利的協調が見られた。
- 同質な利的集団は、内発的または外発的動機に特化したエージェントを生み出し、結果として最適でない集団的成果をもたらした。
- 結果は、相互依存理論の予測と一致しており、両者が同時に利的変換を採用した場合、非効率な結果が生じることを示している。
- SVOの多様性により、対称的な利的行動に起因する非効率を回避でき、安定的で高パフォーマンスの慣習の出現を支援した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。