[論文レビュー] Accommodating Picky Customers: Regret Bound and Exploration Complexity for Multi-Objective Reinforcement Learning
本稿は、敵対的選好が与えられるオンライン設定において、ほぼミニマックス最適なレグレットバウンド $\widetilde{\mathcal{O}}\bigl{(}\sqrt{\min\{d,S\}\cdot H^{2}SAK}\bigr{)}$ を達成するモデルベースのアルゴリズムを提案する。また、任意の選好ベクトルを $\epsilon$ の誤差で扱える最小限の軌道複雑度 $\widetilde{\mathcal{O}}\bigl{(}{\min\{d,S\}\cdot H^{3}SA}/{\epsilon^{2}}\bigr{)}$ を達成する選好フリー探索アルゴリズムを導入し、サンプル効率の良いMORLにおける未解決問題を解決する。
In this paper we consider multi-objective reinforcement learning where the objectives are balanced using preferences. In practice, the preferences are often given in an adversarial manner, e.g., customers can be picky in many applications. We formalize this problem as an episodic learning problem on a Markov decision process, where transitions are unknown and a reward function is the inner product of a preference vector with pre-specified multi-objective reward functions. We consider two settings. In the online setting, the agent receives a (adversarial) preference every episode and proposes policies to interact with the environment. We provide a model-based algorithm that achieves a nearly minimax optimal regret bound $\widetilde{\mathcal{O}}\bigl(\sqrt{\min\{d,S\}\cdot H^2 SAK}\bigr)$, where $d$ is the number of objectives, $S$ is the number of states, $A$ is the number of actions, $H$ is the length of the horizon, and $K$ is the number of episodes. Furthermore, we consider preference-free exploration, i.e., the agent first interacts with the environment without specifying any preference and then is able to accommodate arbitrary preference vector up to $ε$ error. Our proposed algorithm is provably efficient with a nearly optimal trajectory complexity $\widetilde{\mathcal{O}}\bigl({\min\{d,S\}\cdot H^3 SA}/{ε^2}\bigr)$. This result partly resolves an open problem raised by \citet{jin2020reward}.
研究の動機と目的
- 訓練中に選好が敵対的に提供される、あるいは利用できない状況における多目的強化学習(MORL)の課題に対処すること。
- 敵対的選好ベクトルを伴うオンラインMORLにおいて、ほぼミニマックス最適なレグレットを達成するモデルベースのアルゴリズムを開発すること。
- 任意の任意の選好ベクトルを $\epsilon$ の誤差で扱えるようにするための最小限の軌道複雑度で動作する選好フリー探索アルゴリズムを設計すること。
- Jinら(2020)が提起した未解決問題を解決し、選好フリー探索におけるほぼ最適な軌道複雑度境界を確立すること。
提案手法
- 未知の有限ホライズンMDPに、$d$ 個の目的関数、$S$ 個の状態、$A$ 個の行動、ホライズン$H$ を持ち、エピソード的学習タスクとして問題を定式化する。
- 敵対的選好下での探索と活用のバランスを図るために、遷移モデルおよび報酬モデルの信頼区間を維持するモデルベースのアルゴリズムを提案する。
- 将来の選好が分からない状況でデータ収集を行う選好フリー探索フェーズを導入し、ポリシー空間をカバーする構造化された探索戦略を用いる。
- 選好ベクトルと多目的報酬の内積を活用して重み付き累積報酬を最適化する、価値関数推定とポリシー改善の枠組みを採用する。
- 集中不等式と被覆論理を用いて推定誤差をバウンドし、レグレットと誤差に関する高確率保証を導出する。
- 独自の解析手法を適用し、アルゴリズムの軌道複雑度がほぼ最適であることを示し、先行研究におけるギャップを解消する。
実験結果
リサーチクエスチョン
- RQ1敵対的に選ばれた選好が与えられるオンライン多目的強化学習において、達成可能な最適なレグレットバウンドは何か?
- RQ2将来の任意の選好ベクトルを有界な誤差で効率的にサポートできる選好フリー探索アルゴリズムは設計可能か?
- RQ3多目的MDPにおける選好フリー探索の最適な軌道複雑度は何か?
- RQ4選好フリー設定において、サンプル複雑度は目的関数数 $d$、状態数 $S$、行動数 $A$、ホライズン $H$ に対してどのようにスケーリングするか?
主な発見
- 提案されたオンラインMORLアルゴリズムは、$\widetilde{\mathcal{O}}\bigl{(}\sqrt{\min\{d,S\}\cdot H^{2}SAK}\bigr{)}$ のレグレットバウンドを達成し、これはほぼミニマックス最適である。
- 情報理論的下界 $\Omega\bigl{(}\sqrt{\min\{d,S\}\cdot H^{2}SAK}\bigr{)}$ により、レグレットバウンドの最適性が対数要因を除いて確認される。
- 選好フリー探索アルゴリズムは、$\widetilde{\mathcal{O}}\bigl{(}{\min\{d,S\}\cdot H^{3}SA}/{\epsilon^{2}}\bigr{)}$ の軌道複雑度を達成し、これはほぼ最適である。
- この軌道複雑度の境界は、Jinら(2020)が提起したMORLにおける効率的選好フリー探索に関する未解決問題を解決する。
- 解析により、$\min\{d,S\}$ への依存性が多目的問題の本質的複雑性を捉えており、選好空間の有効次元を反映していることが明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。