[论文解读] Addressing Optimism Bias in Sequence Modeling for Reinforcement Learning
本文提出了一种分离潜在轨迹变换器(SeParated Latent Trajectory Transformer, SPLT)方法,通过为动作和状态转移分别使用独立的离散潜在变量变分自编码器(VAE),在离线强化学习中解耦策略与世界动态建模。通过在多种可能的未来中进行稳健的、悲观的规划,SPLT 在随机自主驾驶环境中优于基于 Transformer 的基线方法,在 CARLA Leaderboard 上实现了最先进的性能,驾驶得分为 68.5±3.9,安全性和完成率接近自动驾驶仪水平。
Impressive results in natural language processing (NLP) based on the Transformer neural network architecture have inspired researchers to explore viewing offline reinforcement learning (RL) as a generic sequence modeling problem. Recent works based on this paradigm have achieved state-of-the-art results in several of the mostly deterministic offline Atari and D4RL benchmarks. However, because these methods jointly model the states and actions as a single sequencing problem, they struggle to disentangle the effects of the policy and world dynamics on the return. Thus, in adversarial or stochastic environments, these methods lead to overly optimistic behavior that can be dangerous in safety-critical systems like autonomous driving. In this work, we propose a method that addresses this optimism bias by explicitly disentangling the policy and world models, which allows us at test time to search for policies that are robust to multiple possible futures in the environment. We demonstrate our method's superior performance on a variety of autonomous driving tasks in simulation.
研究动机与目标
- 为解决基于 Transformer 的序列建模在离线强化学习中导致的乐观偏差问题,该问题在随机或对抗性环境中会导致行为过于乐观。
- 提升在自主驾驶等安全关键领域中的鲁棒性,这些领域中环境动态具有多模态性且可能不合作。
- 实现在测试时间对多样化未来轨迹进行搜索的规划,同时保持计算效率。
- 在复杂、随机的基准测试(如 CARLA Leaderboard)中,超越现有序列建模方法,特别是依赖联合状态-动作建模的方法。
- 证明解耦策略与动态建模可带来在真实世界仿真环境中更可靠、更安全的决策。
提出的方法
- 该方法训练两个独立的离散潜在变量变分自编码器(VAE):一个用于策略(动作序列),一个用于世界动态(状态转移)。
- 策略 VAE 学习在期望回报条件下的动作序列解耦表示,从而实现对高回报行为的搜索。
- 动态 VAE 将状态转移建模为动作和初始状态的函数,捕捉多模态和随机的结果。
- 在测试阶段,该方法对两个模型的潜在码进行联合搜索,以找到对多种可能环境响应均稳健的动作序列。
- 规划过程采用悲观搜索策略,最小化可能的未来状态,避免对合作或确定性结果产生过度自信。
- 该框架是端到端可微的,并利用 Transformer 的高容量建模能力,以捕捉轨迹中的长程依赖关系。
实验结果
研究问题
- RQ1在基于序列的离线强化学习中,解耦策略与动态建模是否能减少在随机环境中的乐观偏差?
- RQ2将策略与动态表示分离,对复杂、多模态的自主驾驶基准测试性能有何影响?
- RQ3与联合建模方法相比,解耦规划机制在非合作或对抗性环境中能在多大程度上提升鲁棒性?
- RQ4在真实驾驶模拟中,该方法是否在安全性和任务完成度上优于最先进的序列建模与离线强化学习基线?
- RQ5该方法能否泛化到现实世界类似的随机场景,其中环境行为并非完全合作?
主要发现
- SPLT 在 CARLA Leaderboard 上取得了 68.5±3.9 的驾驶得分,优于所有基于 Transformer 的基线方法,并接近特权自动驾驶仪的性能。
- 该方法实现了 94.6±7.7% 的路线完成率,显著优于行为克隆(BC)的 95.3±5.4% 和 DT(m) 的 96.2±5.4%,同时保持了较低的碰撞率(1.9±0.5 次/公里)和违规率(2.3±1.1 次/公里)。
- 与轨迹变换器(TT)相比,SPLT 在总分上高出 12.8 分,表明 TT 的朴素束搜索在非合作环境中存在乐观偏差。
- 该方法在 IQL 上实现了 100% 的路线完成率,但 SPLT 维持了更优的安全指标和泛化能力,表明其对分布偏移更具鲁棒性。
- SPLT 证明了解耦建模可实现有效的悲观规划,减少对合作环境结果的过度自信。
- 结果证实,分离策略与动态建模可带来在随机、安全关键环境(如自主驾驶)中更可靠、更安全的决策。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。