Skip to main content
QUICK REVIEW

[论文解读] Incorporating Human Domain Knowledge into Large Scale Cost Function Learning

Markus Wulfmeier, Dushyant Rao|arXiv (Cornell University)|Dec 13, 2016
Autonomous Vehicle Technology and Safety参考文献 11被引用 9
一句话总结

本文提出一种方法,通过在最大熵深度逆强化学习(MaxEnt D-IRL)微调之前,先在人工设计的成本函数上预训练一个深度神经网络,从而提升大规模运动规划中成本函数学习的性能。通过将人类领域知识作为先验注入,该模型在鲁棒性、障碍物边界清晰度以及对罕见场景(如楼梯、斜坡和涵洞)的泛化能力方面表现更优,优于仅从示范数据训练的模型。

ABSTRACT

Recent advances have shown the capability of Fully Convolutional Neural Networks (FCN) to model cost functions for motion planning in the context of learning driving preferences purely based on demonstration data from human drivers. While pure learning from demonstrations in the framework of Inverse Reinforcement Learning (IRL) is a promising approach, we can benefit from well informed human priors and incorporate them into the learning process. Our work achieves this by pretraining a model to regress to a manual cost function and refining it based on Maximum Entropy Deep Inverse Reinforcement Learning. When injecting prior knowledge as pretraining for the network, we achieve higher robustness, more visually distinct obstacle boundaries, and the ability to capture instances of obstacles that elude models that purely learn from demonstration data. Furthermore, by exploiting these human priors, the resulting model can more accurately handle corner cases that are scarcely seen in the demonstration data, such as stairs, slopes, and underpasses.

研究动机与目标

  • 解决在训练数据稀疏或无法代表罕见场景时,深度逆强化学习在运动规划中泛化能力差的问题。
  • 提升模型在环境未遍历或代表性不足区域的鲁棒性与特征表示能力。
  • 将专家人类领域知识融入深度学习模型以进行成本函数学习,减少对大量示范数据的依赖。
  • 实现对斜坡、楼梯、涵洞和护栏等难点场景的更好处理,这些场景仅靠示范数据难以学习。
  • 证明在人工成本函数上预训练可显著提升预测与分类任务的性能,优于随机初始化。

提出的方法

  • 使用人工设计的成本图作为先验,预训练一个全卷积神经网络(FCN),以回归该成本图并初始化网络权重。
  • 在专家示范轨迹上使用最大熵深度逆强化学习(MaxEnt D-IRL)对预训练模型进行微调。
  • 在整个网络中使用Sigmoid激活函数,以稳定训练并归一化输出至[0,1]区间,便于路径规划中的阈值处理。
  • 在微调阶段应用早停策略,以提升泛化能力并减少过拟合。
  • 利用人工成本图提供的密集监督,增强远离示范轨迹区域的特征表示。
  • 在预训练阶段注入领域特定知识(如障碍物扩展规则和高度范围阈值),引导网络学习物理上合理的成本函数。

实验结果

研究问题

  • RQ1在人工设计的成本函数上预训练深度神经网络,是否能提升运动规划中逆强化学习的泛化能力?
  • RQ2将人类领域知识融入模型,是否能增强其处理罕见或极端场景(如楼梯和涵洞)的能力?
  • RQ3与随机初始化相比,预训练是否能带来更鲁棒且视觉上更清晰的障碍物边界?
  • RQ4预训练在多大程度上减少了学习准确成本函数对大量示范数据的依赖?
  • RQ5结合人工先验与深度IRL的方法,是否在可通行地形分类准确率上优于纯示范数据驱动的学习方法?

主要发现

  • 与随机初始化相比,在人工成本函数上预训练显著提升了可通行地形的分类性能。
  • 采用人类先验预训练的模型生成了更清晰、更鲁棒的障碍物边界,减少了成本图中的伪影与噪声。
  • 该方法成功捕捉并正确分类了斜坡(可通行)和楼梯(不可通行)等复杂场景,而仅依赖示范数据训练的模型常出现误分类。
  • 由于初始特征表示更丰富,预训练模型在未遍历区域(尤其是远离示范轨迹的区域)具有更好的泛化能力。
  • 微调阶段的早停策略减少了训练时间并提升了泛化性能,尤其在预训练之后效果更明显。
  • 该方法能够准确建模复杂特征(如涵洞和护栏),这些特征在纯学习模型中常因高度范围或点云密度问题而被误分类。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。