[論文レビュー] A uniform Tauberian theorem in optimal control
本稿は、連続時間最適制御における一様タウバーリアン定理を確立し、$T \to \infty$ のとき有限区間価値関数 $V_T(x)$ の一様収束が、$\lambda \to 0$ のとき割引価値関数 $V_\lambda(x)$ の一様収束と同値であることを証明している。両者の極限は同一である。この結果は、エルゴード性の仮定なしに、古典的なハーディー=リトルウッドおよびフェラーのタウバーリアン定理を制御された力学系に拡張したものであり、離散時間近似と同値性の議論を用いている。
In an optimal control framework, we consider the value $V_T(x)$ of the problem starting from state $x$ with finite horizon $T$, as well as the value $V_λ(x)$ of the $λ$-discounted problem starting from $x$. We prove that uniform convergence (on the set of states) of the values $V_T(\cdot)$ as $T$ tends to infinity is equivalent to uniform convergence of the values $V_λ(\cdot)$ as $λ$ tends to 0, and that the limits are identical. An example is also provided to show that the result does not hold for pointwise convergence. This work is an extension, using similar techniques, of a related result in a discrete-time framework \cite{LehSys}.
研究の動機と目的
- 連続時間最適制御問題に対して、エルゴード性の仮定なしに一様タウバーリアン定理を確立すること。
- 有限区間価値関数の収束が一様であるかどうか、割引価値関数の収束と同値であるかという未解決問題を解消すること。
- 両者が一様収束する場合に、$V_T(x)$ と $V_\lambda(x)$ の極限が一致することを示すこと。
- レラーとソリン(2012年)の離散時間結果を連続時間の制御系に拡張すること。
提案手法
- 状態空間 $\widetilde{\Omega} = \Omega \times [0,1]$ とコスト関数 $\widetilde{g}(\omega,x) = x$ を持つ離散時間動的計画問題を構築する。
- 連続時間系の軌道を単位時間間隔ごとに符号化する多価移動マップ $\widetilde{\Gamma}$ を定義する。
- レラーとソリン(2012年)の離散時間一様タウバーリアン収束に関する主結果を、構築した離散系に適用する。
- 連続時間価値関数 $V_t(\omega)$ と離散時間価値関数 $v_n(\omega,x)$ の間に一様なバウンディングを確立し、$|V_t(\omega) - v_{\lfloor t \rfloor}(\omega,x)| \leq \frac{2}{\lfloor t \rfloor}$ を示す。
- 積分バウンディング $\lambda \int_0^\infty |(1-\lambda)^{\lfloor t \rfloor} - e^{-\lambda t}| dt \to 0$ を用いて、$\lambda \to 0$ のとき $|V_\lambda(\omega) - v_\lambda(\omega,x)|$ がゼロに一様収束することを証明する。
- 離 discrete 時間での収束の同値性を活用し、連続時間でも同様の同値性が成り立つことを導く。
実験結果
リサーチクエスチョン
- RQ1有限区間価値関数 $V_T(x)$ の $T \to \infty$ における一様収束が、$\lambda \to 0$ のとき割引価値関数 $V_\lambda(x)$ の一様収束を示唆するか?
- RQ2逆に、$V_\lambda(x)$ の一様収束が $V_T(x)$ の一様収束を示唆するか?
- RQ3両者が一様収束する場合、$V_T(x)$ と $V_\lambda(x)$ の極限は一致するか?
- RQ4古典的なハーディー=リトルウッドおよびフェラーのタウバーリアン定理は、エルゴード性のない制御された連続時間系に拡張可能か?
- RQ5非エルゴード的ダイナミクスに対しても、有限区間収束と割引収束の同値性は頑健か?
主な発見
- 有限区間価値関数 $V_T(\cdot)$ の $T \to \infty$ における一様収束は、$\lambda \to 0$ における $V_\lambda(\cdot)$ の一様収束と同値である。
- $V_T(\cdot)$ と $V_\lambda(\cdot)$ の極限は、両者が一様収束する場合に同一である。
- システムのエルゴード性や可制御性の仮定なしに、この同値性が成り立つ。
- $\lambda \to 0$ のとき、$\omega$ と $x$ に一様に $|V_\lambda(\omega) - v_\lambda(\omega,x)|$ がゼロに収束することを、$\lambda \int_0^\infty |(1-\lambda)^{\lfloor t \rfloor} - e^{-\lambda t}| dt \to 0$ のバウンディングにより保証できる。
- 本結果は、レラーとソリン(2012年)の離散時間一様タウバーリアン定理を連続時間最適制御に拡張したものである。
- 一様収束でない場合に同値性が成立しない例が提示されており、一様収束の必要性が強調されている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。