Skip to main content
QUICK REVIEW

[论文解读] Guided Feature Transformation (GFT): A Neural Language Grounding Module for Embodied Agents

Haonan Yu, Xiaochen Lian|arXiv (Cornell University)|May 22, 2018
Multimodal Machine Learning Applications参考文献 38被引用 18
一句话总结

本文提出Guided Feature Transformation(GFT),一种神经语言定位模块,将句子嵌入作为可学习的变换矩阵,动态调整视觉特征以适应具身智能体。GFT在2D和3D环境中的语言引导导航任务中显著优于当前最先进方法,2D环境下最高达成85.2%的成功率,3D环境下达到84.6%,展现出在部分可观测性和复杂推理需求下的优越泛化能力与鲁棒性。

ABSTRACT

Recently there has been a rising interest in training agents, embodied in virtual environments, to perform language-directed tasks by deep reinforcement learning. In this paper, we propose a simple but effective neural language grounding module for embodied agents that can be trained end to end from scratch taking raw pixels, unstructured linguistic commands, and sparse rewards as the inputs. We model the language grounding process as a language-guided transformation of visual features, where latent sentence embeddings are used as the transformation matrices. In several language-directed navigation tasks that feature challenging partial observability and require simple reasoning, our module significantly outperforms the state of the art. We also release XWorld3D, an easy-to-customize 3D environment that can potentially be modified to evaluate a variety of embodied agents.

研究动机与目标

  • 开发一种通用的、可端到端训练的语言定位模块,适用于具身智能体,直接处理原始像素和非结构化语言指令。
  • 解决在部分可观测、稀疏奖励环境中语言定位的挑战,使智能体能够将语言指令与视觉特征关联。
  • 设计一种方法,无需改变网络架构或超参数,即可在需要空间推理和物体识别的多样化导航任务中实现泛化。
  • 通过可微分且表达能力强的变换机制,实现高效的视觉-语言交互,其表达能力与性能均超越现有方法。

提出的方法

  • GFT将语言定位建模为一系列特征变换,其中潜在的句子嵌入被重塑为变换矩阵,应用于视觉特征图。
  • 方法首先使用CNN将视觉特征提取为张量 C ∈ ℝ^{D×N},随后通过一系列变换 C^{[j]} = g(T_j [C^{[j-1]}; 1^T]),其中 T_j 由句子嵌入生成。
  • 每个变换矩阵 T_j 均由输入句子的可学习嵌入生成,实现上下文相关的特征调制。
  • 最终变换后的特征图 C* 作为下游策略网络在强化学习框架中的定位表示。
  • 整个模块完全可微分,并通过强化学习实现端到端训练,采用ParallelA2C算法。
  • 该方法泛化了现有方法:其可包含门控网络与卷积交互作为特例,并通过动态可学习变换矩阵实现扩展。

实验结果

研究问题

  • RQ1是否一种将句子嵌入视为变换矩阵的神经语言定位模块,能在语言引导导航任务中超越现有方法?
  • RQ2GFT在具有不同部分可观测性与视觉杂乱程度的2D和3D环境中,泛化能力如何?
  • RQ3与单次或共享变换相比,使用多个具有独立矩阵的变换步骤有何影响?
  • RQ4在需要空间推理、物体识别与语义对立的任务中,尤其在稀疏奖励设置下,GFT表现如何?

主要发现

  • 在2D导航任务中,GFT-1取得65.0%的成功率,显著优于最佳基线方法(FiLM为58.8%),并创下新的SOTA纪录。
  • 在3D导航任务中,GFT-2达到84.6%的成功率,在最具挑战性的nav_dir任务上,相较次优方法(FiLM)平均提升15%。
  • GFT-2的训练收敛速度优于FiLM,表明其优化动力学更优,策略信用分配更有效。
  • 该模型在无需调整网络架构或超参数的情况下,成功泛化至2D与3D环境,展现出强大的鲁棒性与迁移能力。
  • 对学习到的变换矩阵的可视化显示,GFT能有效捕捉空间关系与物体属性等语义关联。
  • 尽管参数量与计算成本更高,但GFT的性能增益使其复杂性在复杂、类真实世界导航场景中具有充分合理性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。