Skip to main content
QUICK REVIEW

[论文解读] Scene Memory Transformer for Embodied Agents in Long-Horizon Tasks

Kuan Fang, Alexander Toshev|arXiv (Cornell University)|Mar 9, 2019
Multimodal Machine Learning Applications参考文献 51被引用 17
一句话总结

本文提出场景记忆Transformer(SMT),一种基于记忆的强化学习策略,通过在一组嵌入的过往观测上使用自注意力机制,建模视觉导航中的长时程依赖关系。SMT通过可扩展的、注意力驱动的记忆访问机制,在不进行固定大小状态压缩的前提下,优于反应式策略和基于RNN的策略,在漫游、覆盖和搜索任务中表现更优。

ABSTRACT

Many robotic applications require the agent to perform long-horizon tasks in partially observable environments. In such applications, decision making at any step can depend on observations received far in the past. Hence, being able to properly memorize and utilize the long-term history is crucial. In this work, we propose a novel memory-based policy, named Scene Memory Transformer (SMT). The proposed policy embeds and adds each observation to a memory and uses the attention mechanism to exploit spatio-temporal dependencies. This model is generic and can be efficiently trained with reinforcement learning over long episodes. On a range of visual navigation tasks, SMT demonstrates superior performance to existing reactive and memory-based policies by a margin.

研究动机与目标

  • 解决在部分可观测、未见过的环境中长期决策的挑战,其中过往观测对当前行为具有关键影响。
  • 克服RNN和固定结构记忆模型在捕捉长期时空依赖关系方面的局限性。
  • 设计一种灵活且可扩展的记忆机制,保留单个观测嵌入,并通过注意力机制延迟聚合。
  • 证明注意力机制在长时程导航任务中替代RNN用于策略网络的有效性。

提出的方法

  • 将每个观测(图像、深度图、位姿、动作)作为独立嵌入存储在场景记忆中,记忆大小随任务长度线性增长。
  • 使用基于Transformer的策略网络,对场景记忆应用多头自注意力机制,基于当前观测计算动作。
  • 当记忆大小超过阈值时,应用记忆分解技术,将二次方计算复杂度降低至线性。
  • 使用经验回放和目标网络的深度Q学习(DQN)端到端训练SMT策略。
  • 整合多模态输入:RGB图像、深度图、智能体位姿和先前动作,生成观测嵌入。
  • 使用视觉Transformer编码器处理视觉输入,在记忆存储前提取丰富的时空特征。

实验结果

研究问题

  • RQ1基于注意力的记忆机制是否能在长时程视觉导航任务中优于基于RNN的策略和反应式策略?
  • RQ2场景记忆的大小如何影响不同导航任务中的性能表现?
  • RQ3哪些观测模态(如深度图、RGB图像、位姿、动作)对SMT性能最为关键?
  • RQ4与循环或基于地图的记忆机制相比,基于Transformer的注意力机制在多大程度上提升了长期依赖建模能力?
  • RQ5在大规模记忆场景下,记忆分解能否在降低计算成本的同时保持性能?

主要发现

  • SMT在所有三项任务(漫游、覆盖和搜索)中显著优于反应式策略和基于LSTM的基线模型,成功率达到一致提升,轨迹效率更高。
  • 性能随记忆容量增大而提升——尤其在覆盖和搜索任务中表现明显,证明SMT能够有效利用长时程记忆。
  • 深度图、位姿和上一动作是最重要的模态;移除这些模态会导致性能显著下降(例如在搜索任务中奖励点数下降15–20分)。
  • 视觉编码器贡献显著,在最复杂的搜索任务中使性能提升23.7分,凸显其在特征抽象中的关键作用。
  • 记忆分解将计算复杂度从二次方降低至线性,使大规模记忆使用成为可能,且无性能损失。
  • 定性分析表明,SMT生成的轨迹更紧凑、更直接,碰撞更少,探索更高效,尤其在跨房间切换和目标定位行为中优于基线模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。