Skip to main content
QUICK REVIEW

[论文解读] End-to-end Active Object Tracking and Its Real-world Deployment via Reinforcement Learning

Wenhan Luo, Peng Sun|arXiv (Cornell University)|Aug 10, 2018
Video Surveillance and Tracking Methods参考文献 60被引用 6
一句话总结

本文提出一种基于深度强化学习的端到端主动目标跟踪系统,其中ConvNet-LSTM智能体直接从模拟器中的原始视频帧预测摄像头控制动作。该方法在未见过的目标轨迹、外观和背景上实现了鲁棒的跟踪泛化,并成功实现了从仿真到真实世界部署的迁移,仅需在TurtleBot机器人上进行极少的真实世界调优。

ABSTRACT

We study active object tracking, where a tracker takes visual observations (i.e., frame sequences) as input and produces the corresponding camera control signals as output (e.g., move forward, turn left, etc.). Conventional methods tackle tracking and camera control tasks separately, and the resulting system is difficult to tune jointly. These methods also require significant human efforts for image labeling and expensive trial-and-error system tuning in the real world. To address these issues, we propose, in this paper, an end-to-end solution via deep reinforcement learning. A ConvNet-LSTM function approximator is adopted for the direct frame-to-action prediction. We further propose an environment augmentation technique and a customized reward function, which are crucial for successful training. The tracker trained in simulators (ViZDoom and Unreal Engine) demonstrates good generalization behaviors in the case of unseen object moving paths, unseen object appearances, unseen backgrounds, and distracting objects. The system is robust and can restore tracking after occasional lost of the target being tracked. We also find that the tracking ability, obtained solely from simulators, can potentially transfer to real-world scenarios. We demonstrate successful examples of such transfer, via experiments over the VOT dataset and the deployment of a real-world robot using the proposed active tracker trained in simulation.

研究动机与目标

  • 为解决传统被动跟踪器将跟踪与摄像头控制分离所带来的局限性,后者需要手动调优并经历大量真实世界的试错过程。
  • 通过在仿真环境中训练端到端智能体,减少人工标注和系统调优的工作量。
  • 实现主动跟踪在未见过的目标轨迹、外观、背景和干扰物上的鲁棒泛化。
  • 通过先进的环境增强和合适的动作空间设计,弥合仿真与现实之间的差距,以实现真实世界机器人的部署。
  • 在物理TurtleBot上成功部署仅在仿真环境中训练的跟踪器。

提出的方法

  • 采用ConvNet-LSTM架构,将原始视频帧直接映射为摄像头控制动作(例如:前进、左转),实现端到端学习。
  • 使用A3C强化学习算法,结合自定义的密集奖励函数训练智能体,以鼓励目标在图像中心定位和保持一致的大小。
  • 通过在模拟器中动态改变目标外观、背景、轨迹和干扰物,实施环境增强,以提升泛化能力。
  • 精心设计动作空间——离散或连续——以更好地匹配真实世界机器人的运动学特性,提升仿真到现实的迁移效果。
  • 通过自定义API和插件增强虚拟环境,以在训练期间模拟多样的真实世界条件。
  • 在仿真环境和真实世界机器人部署中均对系统进行评估,通过VOT数据集片段和物理机器人实验验证了迁移效果。

实验结果

研究问题

  • RQ1仅在仿真环境中训练的端到端主动跟踪策略,能否泛化到未见过的目标运动轨迹和外观?
  • RQ2使用自定义奖励函数的强化学习,在存在干扰物和背景变化的情况下,能否实现鲁棒的跟踪?
  • RQ3在无需真实世界微调的情况下,仿真环境中训练的策略在多大程度上能成功迁移到真实世界机器人控制?
  • RQ4环境增强在提升主动跟踪器的泛化能力和鲁棒性方面起到何种作用?
  • RQ5动作空间选择(离散 vs. 连续)如何影响跟踪性能和真实世界部署的成功率?

主要发现

  • 该跟踪器能有效泛化到未见过的目标轨迹、外观、背景和干扰物,在目标短暂丢失后仍能维持稳定跟踪。
  • 在室内离散动作设置下,系统成功率达到0.90;在室外连续动作设置下,成功率为0.70,表明在多种环境下均表现出色。
  • 该跟踪器成功从仿真环境迁移到真实世界TurtleBot部署,在室内和室外环境中均实现了稳定的主动跟踪。
  • 智能体学会将目标保持在图像中心并维持一致的目标大小,表明其做出了有效的运动感知控制决策。
  • 在室外环境中,使用连续动作空间可提升性能,成功率达到0.70,高于室内离散设置下的0.90。
  • 定性结果表明,跟踪器避免了简单的“停止”动作,而是根据目标运动方向进行跟随,表明LSTM编码器已学习到运动预测能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。