Skip to main content
QUICK REVIEW

[论文解读] Neural Hybrid Automata: Learning Dynamics with Multiple Modes and Stochastic Transitions

Michael Poli, Stefano Massaroli|arXiv (Cornell University)|Jun 8, 2021
Reinforcement Learning in Robotics参考文献 44被引用 7
一句话总结

本文提出神经混合自动机(NHA),一种数据驱动框架,用于学习未知模式数量和随机转换的随机混合系统。通过结合神经微分方程、归一化流和自监督学习,NHA 在无需预先了解系统结构的情况下,推断多模式动态和事件触发的转换,在机器人集群任务中实现了 99.8% 的目标准确率,完成端到端控制。

ABSTRACT

Effective control and prediction of dynamical systems often require appropriate handling of continuous-time and discrete, event-triggered processes. Stochastic hybrid systems (SHSs), common across engineering domains, provide a formalism for dynamical systems subject to discrete, possibly stochastic, state jumps and multi-modal continuous-time flows. Despite the versatility and importance of SHSs across applications, a general procedure for the explicit learning of both discrete events and multi-mode continuous dynamics remains an open problem. This work introduces Neural Hybrid Automata (NHAs), a recipe for learning SHS dynamics without a priori knowledge on the number of modes and inter-modal transition dynamics. NHAs provide a systematic inference method based on normalizing flows, neural differential equations and self-supervision. We showcase NHAs on several tasks, including mode recovery and flow learning in systems with stochastic transitions, and end-to-end learning of hierarchical robot controllers.

研究动机与目标

  • 开发一种通用方法,从数据中学习随机混合系统(SHSs),而无需事先了解系统模式的数量或转换动态。
  • 解决混合系统学习中连续流与离散事件相互纠缠的挑战,特别是在随机和多模态设置下。
  • 通过从演示数据中联合学习规划与控制策略,实现分层机器人控制器的端到端训练。
  • 提供一种系统化的推理框架,整合神经 ODE、归一化流和自监督学习,用于 SHS 建模。

提出的方法

  • NHA 使用三个核心组件建模 SHS:用于特定模式连续动态的神经微分方程(NDE),用于追踪系统模式的离散隐状态,以及用于预测随机转换时间的事件模块。
  • 事件模块使用来自参数化 TPP(时间点过程)的强度函数,通过反变换采样和指数变体对随机转换进行建模。
  • 归一化流用于建模隐状态分布,并实现对模式转换和系统演化的可微分推理。
  • 通过基于机器人位置和资源图选择目标的策略规划器应用自监督,实现控制策略的端到端训练。
  • 使用具有自适应步长和根查找的混合 ODE 积分算法生成数据集,支持多种事件类型和模式转换。
  • 该框架通过将强度函数嵌入事件检测机制,支持确定性和随机事件处理。

实验结果

研究问题

  • RQ1神经架构能否在不知道模式数量的情况下,学习混合系统中的多模式连续动态和随机转换?
  • RQ2NHA 从观测轨迹中恢复隐藏系统模式并重建底层动态的能力如何?
  • RQ3NHA 在复杂动态环境中,能在多大程度上实现分层机器人控制器的端到端学习?
  • RQ4NHA 能否泛化到未见过的地图布局,并在机器人集群任务中保持高控制准确率?

主要发现

  • NHA 在未知模式数量的情况下,成功恢复系统模式并学习具有随机转换的多模式连续动态。
  • 在机器人集群控制任务中,NHA 在已知地图布局下对 100 台机器人实现了 99.8% ± 0.8% 的平均目标准确率。
  • 在新的、未见过的地图布局上,模型泛化效果良好,对 100 台机器人实现了 98.5% ± 1.95% 的平均目标准确率。
  • 训练过程在 4000 个训练周期后收敛,平均奖励和控制损失均趋于稳定,表明学习过程稳健。
  • 具有自适应步长和根查找的混合积分算法,能够准确模拟复杂事件序列和模式切换。
  • 该框架在分层控制中表现出强大的泛化能力,其中规划器与底层控制器通过自监督联合训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。