Skip to main content
QUICK REVIEW

[论文解读] Automating Vehicles by Deep Reinforcement Learning using Task Separation with Hill Climbing

Mogens Graf Plessen|arXiv (Cornell University)|Nov 29, 2017
Reinforcement Learning in Robotics参考文献 49被引用 8
一句话总结

本文提出任务分离的爬山法(TSHC),一种无梯度、基于模型的深度强化学习算法,通过在独立的确定性任务上学习,使单一神经网络能够编码自动驾驶车辆的多种运动基元。该方法在稀疏奖励和虚拟速度约束下实现高精度控制,利用仅含66个参数的小型网络,在32分钟内完成离线训练,即可在在线推理中实现快速、可重复的控制,成功掌握181种不同的驾驶动作。

ABSTRACT

Within the context of autonomous driving a model-based reinforcement learning algorithm is proposed for the design of neural network-parameterized controllers. Classical model-based control methods, which include sampling- and lattice-based algorithms and model predictive control, suffer from the trade-off between model complexity and computational burden required for the online solution of expensive optimization or search problems at every short sampling time. To circumvent this trade-off, a 2-step procedure is motivated: first learning of a controller during offline training based on an arbitrarily complicated mathematical system model, before online fast feedforward evaluation of the trained controller. The contribution of this paper is the proposition of a simple gradient-free and model-based algorithm for deep reinforcement learning using task separation with hill climbing (TSHC). In particular, (i) simultaneous training on separate deterministic tasks with the purpose of encoding many motion primitives in a neural network, and (ii) the employment of maximally sparse rewards in combination with virtual velocity constraints (VVCs) in setpoint proximity are advocated.

研究动机与目标

  • 通过将离线训练与在线推理解耦,缓解基于模型的控制方法在自动驾驶车辆中的实时计算负担。
  • 克服采样法、格栅法和模型预测控制(MPC)方法在模型复杂度与计算可行性之间权衡的局限性。
  • 利用简单、无梯度的算法,在单一神经网络中实现运动基元的端到端学习,适用于高保真系统模型。
  • 在不依赖随机策略梯度或大量在线优化的前提下,实现高精度、可重复的控制性能。

提出的方法

  • 采用两步法训练神经网络控制器:在独立的确定性任务上进行离线学习,测试时通过快速前向推理完成推断。
  • 利用任务分离技术,在单一参数化控制器网络中编码多种运动基元(如转弯、倒车等)。
  • 采用最大稀疏奖励机制——仅当车辆在严格容差范围内到达目标时才给予密集奖励(例如,航向容差εψ = 1°,位置容差εd = 0.25 m)。
  • 在设定点附近应用虚拟速度约束(VVCs),以稳定学习过程并引导收敛至精确的目标状态。
  • 采用爬山优化策略,结合随机扰动(σpert ~ U[10,1000])与多次重启(Nrestarts = 10),在无梯度条件下探索参数空间。
  • 对状态特征(如相对位置、航向、速度)进行归一化处理,并采用小型MLP-[5,8,2]架构,以确保参数量少、训练速度快。

实验结果

研究问题

  • RQ1能否通过无梯度、基于模型的强化学习方法,高效训练单一神经网络控制器,以编码多种运动基元?
  • RQ2任务分离结合稀疏奖励与VVCs,如何提升自动驾驶车辆控制中的学习稳定性与精度?
  • RQ3在单一网络中编码大量任务与将任务划分为子集相比,网络规模、训练时间与性能之间的权衡如何?
  • RQ4在复杂动作(如180°转弯)中,极小、低参数量的网络在极低在线计算量下,能否实现高精度控制?

主要发现

  • TSHC算法成功训练了一个66参数的MLP-[5,8,2]网络,编码了181种不同的运动基元(180°转弯以1°为增量),在10次重启下总学习时间为31.1分钟。
  • 训练后的控制器实现了1°的航向精度(εψ = 1°),证明了无需依赖随机策略梯度即可实现高精度控制。
  • 该方法实现了可重复、确定性的控制性能——与依赖从分布中采样的随机策略梯度方法形成鲜明对比。
  • 在单一任务(如180°转弯)上训练时,所得轨迹更平滑,且前后切换次数更少,优于同时训练全部181个任务的情况。
  • 全任务与单任务训练的对比表明,当在单一网络中编码过多基元时,个别轨迹性能出现下降,表明任务划分具有优势。
  • 通过控制镜像机制,同一网络可通过对称性泛化至全部360°动作,无需额外训练即可将策略有效覆盖范围翻倍。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。