Skip to main content
QUICK REVIEW

[论文解读] Causal Navigation by Continuous-time Neural Networks

Charles Vorbach, Ramin Hasani|arXiv (Cornell University)|Jun 15, 2021
Domain Adaptation and Few-Shot Learning参考文献 85被引用 25
一句话总结

本文提出具因果结构的连续时间神经网络(liquid time-constant networks)用于从视觉输入中学习无人机导航的因果表示,在闭环任务中显示出比传统RNN更强的鲁棒性。

ABSTRACT

Imitation learning enables high-fidelity, vision-based learning of policies within rich, photorealistic environments. However, such techniques often rely on traditional discrete-time neural models and face difficulties in generalizing to domain shifts by failing to account for the causal relationships between the agent and the environment. In this paper, we propose a theoretical and experimental framework for learning causal representations using continuous-time neural networks, specifically over their discrete-time counterparts. We evaluate our method in the context of visual-control learning of drones over a series of complex tasks, ranging from short- and long-term navigation, to chasing static and dynamic objects through photorealistic environments. Our results demonstrate that causal continuous-time deep models can perform robust navigation tasks, where advanced recurrent models fail. These models learn complex causal control representations directly from raw visual inputs and scale to solve a variety of tasks using imitation learning.

研究动机与目标

  • 推动在基于视觉的控制中,学习在领域转移下仍能泛化的因果表示。
  • 提出具有因果结构的连续时间神经网络(LTCs)作为建模干预的框架。
  • 通过高维视觉无人机导航任务证明基于 LTC 的模型能够捕捉因果依赖。
  • 在被动和主动(闭环)设置中,将基于 LTC 的模型与传统的离散时间和连续时间基线进行比较。

提出的方法

  • 通过将 LTC 动力学与动态因果模型(DCMs)联系起来,在连续时间神经网络中制定因果结构。
  • 使用双线性(受 DCM 启发)近似的 Neural ODEs 来构建具有可解释干预的 liquid time-constant networks(LTCs)。
  • 认为标准 Neural ODEs 不具因果性,而 LTCs 通过学习的参数使内部和外部干预成为可能。
  • 通过梯度-based 方法(对偶法或 BPTT)训练 LTCs,利用 LTC 解的唯一性来获得因果映射。
  • 在高真实感的无人机导航任务的端到端模仿学习中评估学习到的 LTC 基策略。

实验结果

研究问题

  • RQ1具因果结构的连续时间神经网络(LTCs)是否能够从高维视觉输入中学习干预和因果映射?
  • RQ2在逼真环境中传统模型失败的情况下,基于 LTC 的模型是否能够提供鲁棒且可解释的闭环导航?
  • RQ3在遮挡和环境扰动下,LTCs 与 ODE-RNN、LSTM 和 CT-GRU 在静态和动态目标追踪中的表现有何差异?

主要发现

  • 基于 LTC 的模型(Neural Circuit Policies)可以直接从原始视觉中学习对目标的因果注意力并随时间保持,而其他模型则做不到。
  • 在闭环测试中,基于 LTC 的模型在静态目标、移动目标追逐和基于标记的徒步任务等方面的成功率均高于 LSTM、ODE-RNN 和 CT-GRU 基线。
  • NCPs 相较于非因果模型对环境扰动(如雨、雾)表现出更强的鲁棒性。
  • 离散化的 CNN 在遮挡下无法利用时间依赖性,而基于 LTC 的模型则在具有挑战性视觉场景中维持性能。
  • 理论结果表明 LTCs 提供唯一解和显式干预系数,使得在前向和反向传播中实现动态因果建模成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。