[论文解读] Navigation by Imitation in a Pedestrian-Rich Environment
本文提出了一种从干预中学习的 DAgger 算法,使机器人能够通过在导航过程中从专家干预中学习,在行人密集的环境中实现自主导航。通过集成错误回溯功能和深度卷积神经网络,该系统可直接将原始图像映射到控制指令,无需显式建模行人行为,即可在多样化的真实场景中实现稳健的泛化,且性能在迭代学习过程中持续提升。
Deep neural networks trained on demonstrations of human actions give robot the ability to perform self-driving on the road. However, navigation in a pedestrian-rich environment, such as a campus setup, is still challenging---one needs to take frequent interventions to the robot and take control over the robot from early steps leading to a mistake. An arduous burden is, hence, placed on the learning framework design and data acquisition. In this paper, we propose a new learning-from-intervention Dataset Aggregation (DAgger) algorithm to overcome the limitations brought by applying imitation learning to navigation in the pedestrian-rich environment. Our new learning algorithm implements an error backtrack function that is able to effectively learn from expert interventions. Combining our new learning algorithm with deep convolutional neural networks and a hierarchically-nested policy-selection mechanism, we show that our robot is able to map pixels direct to control commands and navigate successfully in real world without explicitly modeling the pedestrian behaviors or the world model.
研究动机与目标
- 为解决在大学校园等复杂行人密集环境中训练机器人安全导航的挑战,传统行为模仿学习因分布偏移而失效。
- 通过在部署过程中实现实时、交互式学习,减少对大量预采集演示数据的依赖。
- 开发一种可扩展且高效的模仿学习框架,通过从人类纠正中迭代聚合数据,提升策略泛化能力。
- 实现从原始 RGB 图像到控制指令的端到端导航,无需显式建模世界或行人行为。
- 在物理机器人平台上,在多样化且此前未见过的真实环境中,展示稳健的实时性能。
提出的方法
- 提出一种新颖的从干预中学习的 DAgger 算法,通过引入错误回溯功能,在机器人出错时从专家干预中学习。
- 采用分层策略选择机制,根据环境上下文和观测状态动态选择控制策略。
- 使用深度卷积神经网络(如 ResNet)将原始像素输入直接映射到转向和速度控制指令。
- 实现固定长度的数据队列,用于存储最近的状态和预测动作,仅在专家干预发生时更新。
- 在 Jetson TX2 上以 10 FPS 实现实时推理,将网络输出转换为 PWM 信号以驱动执行机构。
- 通过迭代方式聚合新的干预数据,随着策略性能提升,数据采集量逐渐减少。
实验结果
研究问题
- RQ1机器人能否通过从专家干预中学习,而非仅依赖预采集的演示数据,实现在行人密集环境中的导航?
- RQ2与标准行为克隆或传统 DAgger 相比,从干预中学习的 DAgger 算法在策略泛化方面有何改进?
- RQ3视觉-based 端到端策略在不显式建模行人动力学的情况下,能在多大程度上将原始图像映射到控制指令?
- RQ4专家干预的频率如何随时间变化,这反映了策略改进的何种趋势?
- RQ5训练后的策略能否泛化到训练数据中未包含的先前未见过的环境和场景?
主要发现
- 随着从干预中学习的 DAgger 过程的迭代进行,成功导航尝试的次数持续增加,表明在所有场景中策略泛化能力均得到提升。
- 路径跟随和行人跟随任务的无干预时间(TWI)在迭代过程中显著增加,表明自主运行时间更长。
- 每个场景的训练数据集大小在五轮迭代后趋于收敛,表明随着策略性能提升,数据采集的收益递减。
- 系统在 Jetson TX2 上实现了 10 FPS 的实时推理,支持在真实环境中实现稳定且响应迅速的控制。
- 机器人成功导航了四个此前未见过的校园区域,证明其泛化能力超越了训练数据范围。
- 该框架实现了通过极少且有针对性的专家纠正进行有效学习,显著降低了数据采集负担,同时保持了高性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。