Skip to main content
QUICK REVIEW

[论文解读] Offline Reinforcement Learning for Visual Navigation

Dhruv Shah, Arjun Bhorkar|arXiv (Cornell University)|Dec 16, 2022
Reinforcement Learning in Robotics被引用 6
一句话总结

ReViND 是一种用于视觉导航的离线强化学习系统,结合了目标条件化的离线 Q 学习与拓扑图规划,可在仅使用预先收集的数据集、无需在线微调或额外数据收集的情况下,实现对远距离目标的现实世界机器人导航,并优化用户指定的奖励函数(如保持在草地上或避开阴影)。

ABSTRACT

Reinforcement learning can enable robots to navigate to distant goals while optimizing user-specified reward functions, including preferences for following lanes, staying on paved paths, or avoiding freshly mowed grass. However, online learning from trial-and-error for real-world robots is logistically challenging, and methods that instead can utilize existing datasets of robotic navigation data could be significantly more scalable and enable broader generalization. In this paper, we present ReViND, the first offline RL system for robotic navigation that can leverage previously collected data to optimize user-specified reward functions in the real-world. We evaluate our system for off-road navigation without any additional data collection or fine-tuning, and show that it can navigate to distant goals using only offline training from this dataset, and exhibit behaviors that qualitatively differ based on the user-specified reward function.

研究动机与目标

  • 开发一种可扩展的、面向现实世界的机器人导航系统,利用现有离线数据集而非昂贵的在线数据收集。
  • 仅通过离线强化学习和预标注的奖励函数,实现对远距离目标(数百米)的长时程导航。
  • 通过修改用户指定的奖励函数,支持多样化的导航行为,例如偏好草地路径或阳光路线。
  • 通过将规划与离线强化学习结合,克服反应式策略和模仿学习的局限,实现更好的泛化能力和奖励感知行为。

提出的方法

  • 使用隐式 Q 学习(IQL)直接从原始视觉观测和离线轨迹数据中训练目标条件化的策略,结合用户指定的奖励标签。
  • 构建一个拓扑图,其中节点为视觉观测,边由学习到的价值函数定义,使用 −Vπ 作为距离度量。
  • 在拓扑表示上执行图搜索,以找到在长时程内最大化指定奖励函数的最小成本路径。
  • 将低层次策略执行(来自 IQL)与高层次规划(图搜索)相结合,实现局部导航精度与全局奖励优化的统一。
  • 利用一个公开的 30 小时数据集进行预训练,奖励函数通过事后标注编码,实现在新环境中的部署。
  • 在真实世界环境中部署系统,无需任何在线策略数据收集或微调,完全依赖离线数据和奖励重加权。

实验结果

研究问题

  • RQ1能否在仅使用现有数据集的情况下,有效将离线强化学习应用于现实世界环境中的长时程视觉导航?
  • RQ2系统能否结合离线强化学习与拓扑规划,基于用户指定的奖励函数实现多样化的导航行为?
  • RQ3与模仿学习和在线强化学习基线相比,该系统在目标到达成功率和奖励最大化方面的表现如何?
  • RQ4在不进行微调的情况下,该系统在视觉上相似但此前未见过的环境中泛化能力如何?

主要发现

  • ReViND 仅通过离线训练且无需在线数据收集,成功在新颖的、视觉上相似的环境中导航至超过 100 米外的目标。
  • 系统根据奖励函数表现出定性上不同的行为,例如偏好草地地形或避开刚修剪过的草地,证明了有效的奖励泛化能力。
  • 在长时程任务中,ReViND 显著优于模仿学习(BC、fBC)和无模型强化学习(IQL),尤其在超过 15–20 米后,平坦策略因“直线冲向目标”和碰撞而失效。
  • 基于图的规划显著提升了性能,且离线强化学习(ReViND)在奖励最大化方面始终优于基于过滤的方法(fBC-graph)。
  • 定量评估显示,ReViND 在平均效用方面优于基线,且脱离率更低,在多种奖励目标下均表现出一致的成功率。
  • 该系统的表现严重依赖于多样化且带奖励标注的数据;若数据集中不存在相关行为(如仅包含道路数据则无法学习非道路行驶行为),则无法学习此类行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。