[论文解读] Transferring Autonomous Driving Knowledge on Simulated and Real Intersections
本文研究了在自主交叉路口导航中使用深度强化学习进行知识迁移的效果,表明在新类型的交叉路口上微调预训练的DQN,相较于随机初始化,能显著提升性能。此外,研究还表明模拟到现实的迁移是有效的,即在仿真环境中预训练可加速真实世界的学习并提升泛化能力。
We view intersection handling on autonomous vehicles as a reinforcement learning problem, and study its behavior in a transfer learning setting. We show that a network trained on one type of intersection generally is not able to generalize to other intersections. However, a network that is pre-trained on one intersection and fine-tuned on another performs better on the new task compared to training in isolation. This network also retains knowledge of the prior task, even though some forgetting occurs. Finally, we show that the benefits of fine-tuning hold when transferring simulated intersection handling knowledge to a real autonomous vehicle.
研究动机与目标
- 评估在一种交叉路口类型中学到的知识是否能泛化到其他类型。
- 探究在新交叉路口上微调预训练策略是否能提升学习效率和性能,相较于随机初始化。
- 评估反向迁移:在新任务上微调后,原始任务的知识是否仍被保留。
- 检验将仿真环境中训练的策略迁移到真实世界自主车辆的可行性。
- 确定迁移学习是否能降低样本复杂度,并提升真实世界部署中的鲁棒性。
提出的方法
- 将交叉路口处理建模为马尔可夫决策过程(MDP),包含状态、动作、奖励和转移动态。
- 使用深度Q网络(DQN)表示交叉路口导航中状态-动作对的Q值函数。
- 采用直接复制、微调和反向迁移协议,评估不同交叉路口类型之间的知识迁移效果。
- 通过在真实数据上进行预训练和微调,实现从仿真环境到真实世界自主车辆的迁移。
- 采用课程式训练设置,即策略先在仿真环境中训练,然后在真实车辆数据上进行微调。
- 通过训练集和测试集上的成功率评估性能,使用指标追踪学习速度和泛化能力。
实验结果
研究问题
- RQ1当直接迁移(直接复制)时,一个在一种交叉路口类型上训练的DQN在另一类型上的泛化能力如何?
- RQ2在新交叉路口类型上微调预训练DQN是否能带来比随机初始化更快的收敛速度和更好的最终性能?
- RQ3在新任务上微调后,对原始任务的知识保留程度如何(反向迁移)?
- RQ4能否在真实世界数据上有效微调在仿真环境中预训练的策略,以提升真实车辆的性能?
- RQ5与仅在真实数据上训练的策略相比,模拟到现实迁移策略在训练速度和泛化能力方面的表现如何?
主要发现
- 将DQN从一种交叉路口类型直接迁移到另一种类型,始终导致较低的成功率,表明泛化能力差。
- 在新交叉路口类型上微调预训练DQN,几乎在所有情况下均实现了更快的学习速度和更高的最终性能,优于随机初始化。
- 反向迁移表明,尽管在新任务上微调后原始任务的知识部分保留,其在源任务上的表现优于直接复制,但仍低于从零开始训练的网络。
- 模拟到现实的迁移显著加速了训练:与仅在真实数据上训练的网络相比,模拟预训练网络在迭代次数减半的情况下达到了90%的成功率。
- 尽管收敛更快,但仅在真实数据上训练和模拟到现实微调的网络均表现出过拟合,测试性能在约80%的成功率处趋于稳定。
- 从真实数据到仿真的迁移效果较差,微调后的真实策略无法泛化到仿真环境,可能是因为在有限的真实数据上过拟合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。