Skip to main content
QUICK REVIEW

[论文解读] Analyzing Knowledge Transfer in Deep Q-Networks for Autonomously Handling Multiple Intersections

David Isele, Akansel Cosgun|arXiv (Cornell University)|May 2, 2017
Adversarial Robustness in Machine Learning参考文献 21被引用 12
一句话总结

本文研究了深度Q网络(DQNs)在交叉路口自主驾驶中的知识迁移,评估了直接迁移、微调、反向迁移和终身学习在五种交叉路口类型中的表现。研究发现,微调在提升新任务性能的同时保留了部分旧任务知识,但终身训练导致灾难性遗忘,凸显了在自主系统持续强化学习中长期记忆机制的必要性。

ABSTRACT

We analyze how the knowledge to autonomously handle one type of intersection, represented as a Deep Q-Network, translates to other types of intersections (tasks). We view intersection handling as a deep reinforcement learning problem, which approximates the state action Q function as a deep neural network. Using a traffic simulator, we show that directly copying a network trained for one type of intersection to another type of intersection decreases the success rate. We also show that when a network that is pre-trained on Task A and then is fine-tuned on a Task B, the resulting network not only performs better on the Task B than an network exclusively trained on Task A, but also retained knowledge on the Task A. Finally, we examine a lifelong learning setting, where we train a single network on five different types of intersections sequentially and show that the resulting network exhibited catastrophic forgetting of knowledge on previous tasks. This result suggests a need for a long-term memory component to preserve knowledge.

研究动机与目标

  • 评估在一种交叉路口类型上训练的DQN所获得的知识在其他交叉路口类型中的迁移效果。
  • 研究在新交叉路口类型上对预训练DQN进行微调是否能提升学习效率和性能,相较于随机初始化。
  • 评估反向迁移:在新任务上微调后,原始任务的知识是否得以保留。
  • 考察单一DQN按顺序在多个交叉路口类型上持续训练的终身学习场景,并识别如灾难性遗忘等挑战。

提出的方法

  • 将交叉路口处理建模为深度强化学习问题,使用深度Q网络(DQNs)近似Q值函数。
  • 在包含五种不同交叉路口类型的交通仿真环境中训练DQNs:单车道右转、左转和直行,以及多车道左转2型和挑战型配置。
  • 通过直接复制实现迁移:将一个预训练DQN从一个任务转移到另一个任务,不进行进一步训练。
  • 应用微调:使用源任务的预训练权重初始化DQN,并在目标任务上继续训练。
  • 通过在原始源任务上重新评估微调后的网络来测量反向迁移,以评估知识保留程度。
  • 通过按顺序在所有五个交叉路口类型上持续训练单一DQN来开展终身学习,监控早期任务上的性能退化。

实验结果

研究问题

  • RQ1当直接复制从一种交叉路口类型训练的DQN到另一种类型时,其泛化能力如何?
  • RQ2与随机初始化相比,使用源任务预训练权重初始化的DQN在目标任务上进行微调是否能提升性能?
  • RQ3在新任务上微调后,源任务的知识保留程度如何(反向迁移)?
  • RQ4在终身学习设置中,对多个交叉路口类型按顺序训练的影响是什么,特别是关于灾难性遗忘的问题?

主要发现

  • 将DQN从一种交叉路口类型直接迁移到另一类型,其成功率始终低于在匹配任务上训练的结果,且无一例在不同任务上表现更优。
  • 使用源任务预训练权重初始化的DQN在目标任务上进行微调,显著提升了性能,既加快了收敛速度(跳跃启动),又在渐近性能上优于随机初始化。
  • 微调后,网络仍保留了可测量的源任务知识,表现为在源任务上的表现优于直接从目标任务复制的模型,其中状态空间重叠较低的任务(如右转与Left2任务)保留程度最大。
  • 在终身学习中,按顺序在五个交叉路口类型上训练导致灾难性遗忘,早期任务的性能在训练后期任务后显著下降,尤其在训练右转任务时,对多车道任务产生了负面影响。
  • 单车道任务(左转、右转、直行)表现出性能亲和性,而多车道任务(Left2、挑战)形成独立组,当在挑战任务之后训练Left2任务时性能提升,但在右转任务之后训练则性能下降。
  • 总体而言,终身学习场景中灾难性遗忘的负面影响超过了迁移带来的益处,表明在持续学习设置中需要机制来保护长期知识。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。