[論文レビュー] PD-MORL: Preference-Driven Multi-Objective Reinforcement Learning Algorithm
この論文では、連続的制御タスクにおける全好み空間をカバーする1つのユニバーサルな方策ネットワークを学習する、好み駆動型多目的強化学習アルゴリズムPD-MORLを提案する。好みベクトルを入力に取り入れ、修正されたベルマン更新でコサイン類似度を用い、好み部分空間にわたる並列探索を可能にすることで、PD-MORLは、先行手法と比較して最大25%大きなハイパーボリュームを達成し、パrameter数を1桁小さくした。
Multi-objective reinforcement learning (MORL) approaches have emerged to tackle many real-world problems with multiple conflicting objectives by maximizing a joint objective function weighted by a preference vector. These approaches find fixed customized policies corresponding to preference vectors specified during training. However, the design constraints and objectives typically change dynamically in real-life scenarios. Furthermore, storing a policy for each potential preference is not scalable. Hence, obtaining a set of Pareto front solutions for the entire preference space in a given domain with a single training is critical. To this end, we propose a novel MORL algorithm that trains a single universal network to cover the entire preference space scalable to continuous robotic tasks. The proposed approach, Preference-Driven MORL (PD-MORL), utilizes the preferences as guidance to update the network parameters. It also employs a novel parallelization approach to increase sample efficiency. We show that PD-MORL achieves up to 25% larger hypervolume for challenging continuous control tasks and uses an order of magnitude fewer trainable parameters compared to prior approaches.
研究の動機と目的
- 目的や制約が頻繁に変化する多目的強化学習(MORL)におけるスケーラビリティと動的再構成の課題に対処すること。
- あらゆる可能な好みベクトルに一般化できる1つの方策を学習することで、再訓練の必要性を排除すること。
- 好み誘導型学習と並列探索を用いて、連続的制御タスクにおけるサンプル効率とパレートフロントカバレッジを向上させること。
- 多様なMORLベンチマークにおいて性能を維持または向上させつつ、モデルの複雑さを低減すること。
- 再訓練なしに推論時にリアルタイムで好みを指定できるスケーラブルで統合的なソリューションを提供すること。
提案手法
- アルゴリズムは、状態と好みベクトルの両方を入力とするニューラルネットワークを用い、1つの方策がすべての好みに一般化可能であるようにする。
- 好みベクトルとQ値ベクトルの間のコサイン類似度を用いることで、学習を誘導する好み駆動型ベルマン最適性作用素を導入する。
- 多次元補間器が、生の好みベクトルを正規化された解空間に射影することで、好みとパレート最適解を一致させる。
- 異なる好み部分空間におけるデータの不均衡を軽減するために、後向き経験再生(HER)を採用する。
- 好み空間を部分空間に分割し、並列な子プロセスが独立して遷移を収集することで、偏りのないかつ効率的な探索を保証する。
- オフポリシー手法と互換性があり、離散的行動にはMO-DDQN-HER、連続的制御タスクにはMO-TD3-HERとして実装されている。
実験結果
リサーチクエスチョン
- RQ1多目的強化学習において、1つのニューラルネットワーク方策が、連続的好み空間全体に一般化して学習可能かどうか。
- RQ2好みベクトルとQ値の間のコサイン類似度を組み込むことで、方策がパレートフロントにどれほど適応するようになるか。
- RQ3好み部分空間にわたる並列探索が、訓練におけるサンプル効率とバイアスの低減にどの程度寄与するか。
- RQ4PG-MORL や、主要な構成要素を欠いたPD-MORL と比較して、提案手法のハイパーボリュームとスパarsity指標はどの程度優れているか。
- RQ5好みの射影に多次元補間器を用いることで、真のパレートフロントとの整合性が向上するかどうか。
主な発見
- PD-MORLは、MO-HalfCheetah-v2 や MO-Hopper-v2 といった困難な連続的制御タスクにおいて、先行手法と比較して最大25%大きなハイパーボリュームを達成した。
- 既存の手法と比較して、トレーニング可能なパrameter数を1桁小さくしたにもかかわらず、性能を維持または向上させた。
- 損失関数における方向角項を削除すると、特にパレートフロントが密集する領域で性能が著しく低下し、スパarsityが増加し、ハイパーボリュームが減少した。
- 並列探索は不可欠である:これを無効化すると、すべてのベンチマークでハイパーボリュームが著しく低下し、スパarsityが増加した。
- アブレーションスタディの結果、コサイン類似度、HER、並列探索の組み合わせが優れた性能をもたらすために不可欠であることが確認され、これらの構成要素を欠いたバリアントよりもPD-MORLが優れた性能を示した。
- MO-Hopper-v2 では、同じ基準点を使用した場合、PD-MORLはハイパーボリューム1.88×10⁷を達成し、PG-MORL(2.02×10⁷)を上回り、スパarsity 0.3×10⁴という最低水準を示しており、パレートフロントの密集したカバレッジを実現した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。