[论文解读] Learning to Steer by Mimicking Features from Heterogeneous Auxiliary Networks
本文提出了一种名为异构辅助网络特征模仿的新型训练方法,通过蒸馏来自预训练、即插即用的网络(如用于语义分割的PSPNet、用于光流估计的FlowNet2)的多层特征,在无需目标数据集任务特定标注的情况下,提升了端到端转向角预测性能。该方法在Udacity和Comma.ai基准测试中达到最先进水平,相较于先前方法,平均绝对误差分别降低了12.8%和52.1%。
The training of many existing end-to-end steering angle prediction models heavily relies on steering angles as the supervisory signal. Without learning from much richer contexts, these methods are susceptible to the presence of sharp road curves, challenging traffic conditions, strong shadows, and severe lighting changes. In this paper, we considerably improve the accuracy and robustness of predictions through heterogeneous auxiliary networks feature mimicking, a new and effective training method that provides us with much richer contextual signals apart from steering direction. Specifically, we train our steering angle predictive model by distilling multi-layer knowledge from multiple heterogeneous auxiliary networks that perform related but different tasks, e.g., image segmentation or optical flow estimation. As opposed to multi-task learning, our method does not require expensive annotations of related tasks on the target set. This is made possible by applying contemporary off-the-shelf networks on the target set and mimicking their features in different layers after transformation. The auxiliary networks are discarded after training without affecting the runtime efficiency of our model. Our approach achieves a new state-of-the-art on Udacity and Comma.ai, outperforming the previous best by a large margin of 12.8% and 52.1%, respectively. Encouraging results are also shown on Berkeley Deep Drive (BDD) dataset.
研究动机与目标
- 解决仅依赖转向角监督的端到端转向角预测模型中上下文理解能力有限的问题。
- 提升在复杂驾驶场景(如急弯、强阴影、光照变化)下的鲁棒性。
- 开发一种利用辅助网络中丰富上下文信号的训练方法,且无需在目标数据集上进行昂贵的标注。
- 通过在多个层次上模仿来自多个异构网络的特征,使主模型学习多样化的场景结构和运动线索。
- 在不增加推理成本的前提下,实现在基准数据集上的最先进性能。
提出的方法
- 该方法通过模仿来自多个异构辅助网络(PSPNet用于语义分割,FlowNet2用于光流估计)在相同输入图像上的深层特征,训练主转向网络(FM-Net)。
- 特征模仿应用于辅助网络的多个层次(低、中、高),主网络被训练以匹配这些层次的激活模式。
- 辅助网络仅在训练阶段使用,并在推理阶段丢弃,确保无运行时开销。
- 该方法基于知识蒸馏原理,但将其应用于异构网络和多个特征层,而不仅限于最终的logits层。
- 主网络通过多级特征匹配损失进行优化,该损失最小化每一层预测特征图与目标特征图之间的L2距离。
- 通过直接在目标域数据上应用辅助网络,而非依赖在不同数据集上预训练,避免了领域偏移问题。
实验结果
研究问题
- RQ1仅通过模仿异构辅助网络的特征,是否能超越仅依赖转向角监督的端到端转向角预测性能?
- RQ2从执行不同任务的网络(如语义分割和光流估计)中进行多层特征蒸馏,是否能提供比单任务监督更鲁棒、更准确的预测?
- RQ3与未微调的、在相关任务(如图像分割)上预训练的传统方法相比,特征模仿的性能如何?
- RQ4来自辅助网络的低、中、高层特征对最终预测准确率的相对贡献是什么?
- RQ5结合来自多个辅助网络的特征模仿,是否能优于仅使用单一网络?
主要发现
- 所提方法在Udacity基准上达到新的最先进水平,相较于排行榜上最佳条目'komanda',平均绝对误差降低了12.8%。
- 在Comma.ai基准上,该方法相较于先前最佳方法,平均绝对误差降低了52.1%。
- 同时使用PSPNet和FlowNet2作为辅助网络,并结合多级模仿(低、中、高),性能最佳,表明场景结构和运动线索具有互补优势。
- 模仿高层特征带来的增益最大,但低层特征模仿的贡献也高于中层特征模仿。
- 特征模仿显著优于在Cityscapes上采用朴素预训练策略的结果,表明在目标数据上直接进行特征匹配比基于领域偏移的预训练更有效。
- 消融实验确认,辅助网络仅在训练阶段需要,不影响推理效率,从而保持了实时部署的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。