[论文解读] Learning to Track Dynamic Targets in Partially Known Environments
本文提出了一种统一的深度强化学习策略——主动追踪目标网络(ATTON),用于在部分已知环境中进行主动目标追踪。通过将问题建模为一个马尔可夫决策过程(MDP),并采用基于互信息的信息论奖励,ATTON 学习联合执行可视内追踪、导航与探索——即使在初始信念和目标动态存在不确定性的情况下,也能在追踪敏捷、异常或建模不佳的目标时,优于传统基于搜索的方法。
We solve active target tracking, one of the essential tasks in autonomous systems, using a deep reinforcement learning (RL) approach. In this problem, an autonomous agent is tasked with acquiring information about targets of interests using its onboard sensors. The classical challenges in this problem are system model dependence and the difficulty of computing information-theoretic cost functions for a long planning horizon. RL provides solutions for these challenges as the length of its effective planning horizon does not affect the computational complexity, and it drops the strong dependency of an algorithm on system models. In particular, we introduce Active Tracking Target Network (ATTN), a unified RL policy that is capable of solving major sub-tasks of active target tracking -- in-sight tracking, navigation, and exploration. The policy shows robust behavior for tracking agile and anomalous targets with a partially known target model. Additionally, the same policy is able to navigate in obstacle environments to reach distant targets as well as explore the environment when targets are positioned in unexpected locations.
研究动机与目标
- 解决传统主动目标追踪方法严重依赖精确系统模型、且在长规划时域内计算复杂度高的局限性。
- 克服因目标模型或初始信念不准确而导致的短视规划与性能下降问题。
- 在目标可能不可预测移动或初始定位错误的部分已知环境中,实现鲁棒的目标追踪。
- 开发一种单一、统一的强化学习策略,同时处理可视内追踪、障碍物间导航与未知目标位置的探索。
- 通过学习一种可泛化至不确定目标动态与不完善先验知识的策略,降低对精确系统模型的依赖。
提出的方法
- 将主动目标追踪建模为一个马尔可夫决策过程(MDP),以目标状态与测量历史之间未来互信息的折扣和作为奖励函数。
- 使用信念状态(通过扩展卡尔曼滤波维护)作为强化学习状态的一部分,以表示目标位置与动态的不确定性。
- 利用本体感觉传感器视图和访问频率图作为输入图像,以实现不同训练环境之间的泛化。
- 端到端训练一个深度 Q-网络策略,使用深度强化学习,其中状态包含智能体位置、信念状态和视觉观测。
- 整合地图信息与访问频率图,以鼓励探索未扫描区域并实现高效导航。
- 采用一种鼓励信息增益的奖励函数,促进长时域、非短视行为,且不依赖显式的规划时域。
实验结果
研究问题
- RQ1一个单一的深度强化学习策略能否以统一方式有效处理主动目标追踪中的可视内追踪、导航与探索?
- RQ2当智能体的信念模型与真实目标动态不一致时,所提出的强化学习策略表现如何?
- RQ3在初始信念不准确及目标运动具有随机性的情况下,该策略能否学习到鲁棒的行为?
- RQ4在追踪成功率与效率方面,该统一策略是否优于传统基于搜索的规划方法?
- RQ5信念状态与访问频率图的使用在部分已知环境中在多大程度上提升了探索与导航性能?
主要发现
- ATTON 策略在追踪敏捷与异常目标方面显著优于基线的基于搜索的规划方法,尤其当信念更新中使用的模型与真实模型不一致时表现更优。
- 该策略成功穿越障碍物密集的环境抵达远距离目标,展示了无需依赖精确先验知识的鲁棒路径规划能力。
- 当对目标位置的初始信念不准确时,该策略能学习探索未知区域并发现目标,而基线方法则完全失败。
- 由于其非短视的信息论目标,该策略在多种场景下(包括随机目标运动与部分可观测性)均保持强大性能。
- 访问频率图与本体感觉观测的使用使策略能够泛化至不同环境,并避免对特定布局的过拟合。
- 该方法无需显式探索奖励即可实现有效探索,因为信息论奖励自然鼓励访问未探索区域以减少不确定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。