Skip to main content
QUICK REVIEW

[论文解读] A Lifelong Learning Approach to Mobile Robot Navigation

Bo Liu, Xuesu Xiao|arXiv (Cornell University)|Jul 28, 2020
Robotic Path Planning Algorithms参考文献 35被引用 8
一句话总结

本文提出持续导航学习(LLfN),一种自监督框架,使移动机器人能够在单一环境中通过经验持续提升导航性能,同时保留对先前遇到环境的技能。该方法利用基于启发式评分函数识别出的次优行为训练互补策略,在不发生灾难性遗忘的情况下实现持续学习,并在计算资源有限的实体机器人上完全实现,其性能优于顺序训练方法,且在效率上与独立模型相当。

ABSTRACT

This paper presents a self-improving lifelong learning framework for a mobile robot navigating in different environments. Classical static navigation methods require environment-specific in-situ system adjustment, e.g. from human experts, or may repeat their mistakes regardless of how many times they have navigated in the same environment. Having the potential to improve with experience, learning-based navigation is highly dependent on access to training resources, e.g. sufficient memory and fast computation, and is prone to forgetting previously learned capability, especially when facing different environments. In this work, we propose Lifelong Learning for Navigation (LLfN) which (1) improves a mobile robot's navigation behavior purely based on its own experience, and (2) retains the robot's capability to navigate in previous environments after learning in new ones. LLfN is implemented and tested entirely onboard a physical robot with a limited memory and computation budget.

研究动机与目标

  • 解决传统静态导航系统无法通过经验改进或适应新环境的局限性。
  • 克服在不同环境间切换时基于学习的导航系统出现的灾难性遗忘问题。
  • 开发一种自监督的、持续学习的框架,通过机器人生成的经验提升导航性能,无需人类示范或外部计算支持。
  • 在真实时间约束下,仅使用机器人机载CPU和内存,在实体机器人上实现并验证该框架,资源受限(内存和处理能力有限)。

提出的方法

  • 该框架以不随经验改进的静态采样基于模型预测控制策略(DWA)初始化。
  • 基于运动持续时间与障碍物接近程度,利用启发式评分函数识别次优动作。
  • 通过过去经验的缓冲区在线训练互补策略,优先处理类似场景中表现良好的动作。
  • 学习过程为自监督:不使用人类示范或奖励塑形;相反,机器人从自身错误中学习。
  • 通过经验回放和选择性微调,确保对先前环境的性能保留,实现后向迁移。
  • 整个系统仅使用机器人机载CPU和内存在实体机器人上部署,每环境训练时间少于两分钟。

实验结果

研究问题

  • RQ1移动机器人能否在无外部干预或外部奖励的情况下,随时间自我提升导航性能?
  • RQ2当学习型导航系统按顺序暴露于多个不同环境时,能否避免灾难性遗忘?
  • RQ3在计算资源有限的条件下,机器人在多大程度上能利用自身经验实时优化导航策略?
  • RQ4与顺序训练方法和按环境单独训练的独立模型相比,持续学习框架的性能如何?

主要发现

  • 在环境1中,LLfN的平均导航时间达到28.32 ± 1.85秒,优于顺序训练模型(39.11 ± 6.45秒),并与独立模型(30.17 ± 0.97秒)相当。
  • 在环境2中,LLfN将平均时间降低至19.98 ± 1.07秒,显著优于顺序训练模型(49.41 ± 13.94秒),并与独立模型(23.41 ± 0.66秒)相当。
  • 在环境3中,LLfN实现21.80 ± 1.51秒的平均时间,与独立模型(21.12 ± 1.17秒)相近,且远优于顺序训练模型(21.12 ± 1.17秒)。
  • LLfN展现出强大的后向迁移能力,在环境1和2中的表现优于独立模型,表明其从多样化经验中获得了更好的泛化能力。
  • 所有环境中均实现零碰撞和极少的恢复行为(0/0),且在环境1中标准差最低。
  • 尽管仅使用机载计算,LLfN在每环境训练时间少于两分钟,证实其在资源受限硬件上的实时可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。