Skip to main content
QUICK REVIEW

[论文解读] Latent Space Reinforcement Learning for Steering Angle Prediction

Qadeer Khan, Torsten Schön|arXiv (Cornell University)|Feb 11, 2019
Autonomous Vehicle Technology and Safety参考文献 8被引用 7
一句话总结

该论文提出了一种模块化的深度强化学习框架,通过使用语义场景嵌入的潜在空间表示,将感知与控制解耦,从而从原始RGB图像中预测转向角度。该方法实现了无需人类示范的端到端自动驾驶策略学习,在高保真模拟器中成功导航,尽管在非对称转弯任务中存在奖励设计的挑战。

ABSTRACT

Model-free reinforcement learning has recently been shown to successfully learn navigation policies from raw sensor data. In this work, we address the problem of learning driving policies for an autonomous agent in a high-fidelity simulator. Building upon recent research that applies deep reinforcement learning to navigation problems, we present a modular deep reinforcement learning approach to predict the steering angle of the car from raw images. The first module extracts a low-dimensional latent semantic representation of the image. The control module trained with reinforcement learning takes the latent vector as input to predict the correct steering angle. The experimental results have showed that our method is capable of learning to maneuver the car without any human control signals.

研究动机与目标

  • 开发一种基于强化学习的自动驾驶策略,直接从原始摄像头输入运行,无需人工提供的转向标签。
  • 通过低维潜在表示将感知(语义分割)与控制(策略学习)解耦,以提高样本效率和鲁棒性。
  • 解决导航任务中稀疏且不连续的奖励信号挑战,特别是针对具有突然惩罚的左转操作。
  • 通过在语义标签而非原始像素数据上进行训练,使控制策略能够泛化于不同光照和天气条件。
  • 通过利用语义图中的空间冗余进行降维,降低控制策略的复杂度。

提出的方法

  • 训练一个编码器-解码器卷积网络,从原始RGB图像生成语义分割图,输出13个通道,分别代表不同的场景类别。
  • 使用编码器最后一层的潜在向量作为控制模块的输入,绕过直接使用语义标签或原始像素。
  • 感知模型通过加权分类交叉熵损失进行训练,类别权重与类别频率成反比,以处理类别不平衡问题。
  • 控制策略通过深度Q学习(DQN)训练,以潜在向量作为状态输入,采用自定义奖励函数,对偏离车道和碰撞行为进行惩罚。
  • 探索通过ε-贪婪策略管理,探索概率随时间递减,以平衡学习与利用。
  • 奖励函数对右转设计为连续变化(从+1平滑过渡到−5),但对左转则为不连续,导致训练不稳定。

实验结果

研究问题

  • RQ1深度强化学习智能体能否在无任何人类示范或专家示范的情况下,仅从原始RGB图像中学习到准确的转向角度?
  • RQ2使用学习得到的潜在语义表示如何提升样本效率并增强对天气和光照等环境变化的鲁棒性?
  • RQ3奖励函数的不连续性对深度Q学习在自动驾驶任务中收敛性和稳定性有何影响?
  • RQ4模块化架构(感知与控制分离)是否相比端到端视觉到控制模型,能实现更好的泛化能力与更易训练?
  • RQ5使用语义分割作为状态表示,在降低控制策略输入维度和复杂度方面有多有效?

主要发现

  • 模型成功学习在模拟环境中导航并执行右转,仅依赖奖励函数和原始图像输入,无需任何人工提供的转向角度。
  • 由于潜在表示抽象了视觉变化,仅依赖一致的语义标签,控制策略在不同天气条件下实现了泛化。
  • 奖励函数在左转时的不连续性——在撞击瞬间从+1跳变至−5——导致Q值估计不稳定,造成训练收敛缓慢或发散。
  • 使用潜在空间表示降低了控制网络输入的维度,实现了更高效的训练,并增强了对视觉噪声的鲁棒性。
  • 尽管学习成功,策略仍表现出急促的转向行为,原因在于动作空间仅为三个离散值,表明连续动作空间可提升平滑性。
  • 车辆在转弯后经常驶入相反车道,原因在于探索不均衡,尤其偏向与转向操作相关的状态。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。