[論文レビュー] MORAL: Aligning AI with Human Norms through Multi-Objective Reinforced Active Learning
MORALは、敵対的逆強化学習と能動的好み学習を組み合わせた多目的強化学習フレームワークを提案する。このフレームワークは、専門家の示唆から人間の規範にAIエージェントを整合させる。ポリシーの最適化に使用するスカラライゼーション重みの分布を、ポリシー内経験を用いて学習することで、複数の報酬重みを列挙することなく、パレート最適なポリシーを効率的に特定する。複雑で対立する状況において、従来の手法を上回り、規範的行動を捉える能力に優れる。
Inferring reward functions from demonstrations and pairwise preferences are auspicious approaches for aligning Reinforcement Learning (RL) agents with human intentions. However, state-of-the art methods typically focus on learning a single reward model, thus rendering it difficult to trade off different reward functions from multiple experts. We propose Multi-Objective Reinforced Active Learning (MORAL), a novel method for combining diverse demonstrations of social norms into a Pareto-optimal policy. Through maintaining a distribution over scalarization weights, our approach is able to interactively tune a deep RL agent towards a variety of preferences, while eliminating the need for computing multiple policies. We empirically demonstrate the effectiveness of MORAL in two scenarios, which model a delivery and an emergency task that require an agent to act in the presence of normative conflicts. Overall, we consider our research a step towards multi-objective RL with learned rewards, bridging the gap between current reward learning and machine ethics literature.
研究の動機と目的
- 専門家の示唆から、複数の対立する人間の規範にAIエージェントを適合させる課題に対処すること。
- 単一報酬学習の限界を克服し、多目的フレームワーク内で多様な専門家の好みのトレードオフを可能にすること。
- 複数のポリシーを計算しないで、パレートフロンティアを近似する、インタラクティブでサンプル効率の良い方法を開発すること。
- 報酬学習と機械倫理のギャップを埋め、人間が参加する好みのクエリを通じて、規範的対立に適応可能なエージェントを実現すること。
- 配達や緊急時タスクなど、社会的規範の順守を要する状況において、この手法の有効性を示すこと。
提案手法
- MORALはまず、専門家の示唆からベクトル値報酬関数を推定するために、敵対的逆強化学習(AIRL)を用いる。
- 次に、専門家に対してポリシー内経験の軌道をペアワイズで比較する好みの選択を求める、インタラクティブな多目的強化学習ループに入る。
- 報酬成分の線形結合を表すスカラライゼーション重みの分布を維持し、ポリシー最適化をガイドする。
- ポリシー内経験を好みのクエリに使用することで、分離された探索ポリシーの必要性を回避し、サンプル複雑性を低減する。
- 全探索を経ずに、最適な重み分布を学習することで、直接的にパレート最適なポリシーを近似する。
- 深層強化学習と能動的学習を統合し、人間の好みに動的に適応しながら、ポリシーの一貫性を維持する。
実験結果
リサーチクエスチョン
- RQ1多目的強化学習フレームワークは、専門家の示唆から複数の人間の規範を効果的に学習し、トレードオフを実現できるか?
- RQ2能動的好み学習を逆強化学習と統合することで、多目的ポリシー学習におけるサンプル効率をどのように向上させられるか?
- RQ3異なる報酬重みに対して複数のポリシーを明示的に計算しないで、パレート最適なポリシーを近似できるか?
- RQ4配達や緊急時シナリオなどの規範的対立を含む環境において、この手法はどの程度一般化できるか?
- RQ5この手法は、一貫した専門家の行動から、暗黙の社会的規範をどの程度自動で推定できるか?
主な発見
- MORALは、規範的対立を含む2つのグリッドワールド環境において、パレート最適なポリシーを効果的に回復した。DRLHPを上回る性能を示した。
- ポリシー内経験を用いて能動的な好みのクエリを行うことで、高いサンプル効率を達成し、必要な専門家のインタラクション数を削減した。
- 専門家の示唆が一貫している場合、暗黙の社会的規範を効果的に捉え、クエリ選択の情報量の高さを示した。
- スカラライゼーション重みの分布により、再訓練やポリシー列挙なしに、微細なポリシー調整が可能になった。
- 多目的強化学習で一般的な報酬スケールの不一致を緩和し、安定性と収束性を向上させた。
- 実験では、MORALがインタラクティブな学習を通じて、多様な人間の好みに適応し、社会的規範に整合したエージェント行動を維持できることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。