[論文レビュー] Elastic Decision Transformer
Elastic Decision Transformer (EDT) は、推論中に履歴長を動的に調整することで Decision Transformers を向上させ、トラジェクトリースティッチを可能にする。劣化したパスに対しては短い履歴を、最適なパスに対しては長い履歴を選び、序列生成を改善し、D4RL や Atari ベンチマークにおいて DT や Q-学習ベースの手法を上回る性能を発揮する。これは、劣化したデモンストレーションからより良いポリシーを学習可能にする。
This paper introduces Elastic Decision Transformer (EDT), a significant advancement over the existing Decision Transformer (DT) and its variants. Although DT purports to generate an optimal trajectory, empirical evidence suggests it struggles with trajectory stitching, a process involving the generation of an optimal or near-optimal trajectory from the best parts of a set of sub-optimal trajectories. The proposed EDT differentiates itself by facilitating trajectory stitching during action inference at test time, achieved by adjusting the history length maintained in DT. Further, the EDT optimizes the trajectory by retaining a longer history when the previous trajectory is optimal and a shorter one when it is sub-optimal, enabling it to "stitch" with a more optimal trajectory. Extensive experimentation demonstrates EDT's ability to bridge the performance gap between DT-based and Q Learning-based approaches. In particular, the EDT outperforms Q Learning-based methods in a multi-task regime on the D4RL locomotion benchmark and Atari games. Videos are available at: https://kristery.github.io/edt/
研究の動機と目的
- 劣化したデモンストレーションからのトラジェクトリースティッチに制限を抱える Decision Transformers の課題を解決すること。
- トラジェクトリの品質に基づいて履歴長を適応させることで、offline 強化学習におけるより良い意思決定を可能にすること。
- 可変長履歴入力を活用することで、マルチタスク offline RL の設定における性能を向上させること。
- 主なアーキテクチャの変更を必要とせず、計算効率の良い手法を開発すること。
提案手法
- EDT は期待値回帰を用いて、異なる履歴長における最大達成可能報酬を推定し、推論時に最適な履歴長を特定する。
- モデルは推定報酬を最大化する履歴長を選択することで、劣化したトラジェクトリに直面した際に文脈を「リセット」できる。
- 劣化したパスでは、悪い過去の行動の影響を減らすために短い履歴が使用され、探索の可能性が向上する。
- 最適なパスでは、行動予測の安定性と一貫性を維持するために長い履歴が保持される。
- 既存の Decision Transformer フレームワークとシームレスに統合され、計算オーバーヘッドは最小限に抑えられる。
- 劣化したパスに直面した際に、より好ましい将来のトラジェクトリに切り替えることで、トラジェクトリースティッチを可能にする。

実験結果
リサーチクエスチョン
- RQ1Decision Transformers における動的履歴長が、劣化したデモンストレーションからの有効なトラジェクトリースティッチを可能にするか?
- RQ2トラジェクトリの品質に基づいて履歴長を変化させることで、offline 強化学習におけるポリシー性能にどのような影響を与えるか?
- RQ3学習可能な履歴長メカニズムが、マルチタスク offline RL において固定長履歴アプローチを上回るか?
- RQ4提案手法が、Q-学習ベースおよび標準的な DT アプローチと比較して、D4RL や Atari といった標準ベンチマークで性能を向上させるか?
主な発見
- EDT はマルチタスク設定における D4RL ロケモーションベンチマークで Q-学習ベースの手法を上回り、優れたサンプル効率とポリシー品質を示した。
- Atari ゲームでは、EDT は offline RL 手法の中で最先端の性能を達成し、DT や Q-学習ベースラインを上回った。
- この手法はトラジェクトリースティッチを成功裏に実現し、劣化したトラジェクトリからより良いセグメントを組み合わせて、優れた全体のトラジェクトリを形成可能にした。
- EDT は価値関数推定に基づいて最適な履歴長を動的に選択することで、多様な環境において性能を向上させた。
- EDT がもたらす計算オーバーヘッドは最小限であり、既存の DT 変種との統合にとって実用的である。
- 実験的結果から、EDT は特に複雑でマルチタスクな offline RL の環境において、標準的な Decision Transformers の性能を顕著に向上させた。
![Figure 2 : An overview of our Elastic Decision Transformer architecture. $\tilde{R}$ is the prediction of the maximum return. We also show the environments we used in the experiments on the right. We adopt four tasks for D4RL [ 15 ] and $20$ tasks for Atari games.](https://ar5iv.labs.arxiv.org/html/2307.02484/assets/edt_architecture.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。