[论文解读] Neural Hybrid Automata: Learning Dynamics with Multiple Modes and Stochastic Transitions
本文提出神经混合自动机(NHA),一种数据驱动框架,用于学习未知模式数量和随机转换的随机混合系统。通过结合神经微分方程、归一化流和自监督学习,NHA 在无需预先了解系统结构的情况下,推断多模式动态和事件触发的转换,在机器人集群任务中实现了 99.8% 的目标准确率,完成端到端控制。
Effective control and prediction of dynamical systems often require appropriate handling of continuous-time and discrete, event-triggered processes. Stochastic hybrid systems (SHSs), common across engineering domains, provide a formalism for dynamical systems subject to discrete, possibly stochastic, state jumps and multi-modal continuous-time flows. Despite the versatility and importance of SHSs across applications, a general procedure for the explicit learning of both discrete events and multi-mode continuous dynamics remains an open problem. This work introduces Neural Hybrid Automata (NHAs), a recipe for learning SHS dynamics without a priori knowledge on the number of modes and inter-modal transition dynamics. NHAs provide a systematic inference method based on normalizing flows, neural differential equations and self-supervision. We showcase NHAs on several tasks, including mode recovery and flow learning in systems with stochastic transitions, and end-to-end learning of hierarchical robot controllers.
研究动机与目标
- 开发一种通用方法,从数据中学习随机混合系统(SHSs),而无需事先了解系统模式的数量或转换动态。
- 解决混合系统学习中连续流与离散事件相互纠缠的挑战,特别是在随机和多模态设置下。
- 通过从演示数据中联合学习规划与控制策略,实现分层机器人控制器的端到端训练。
- 提供一种系统化的推理框架,整合神经 ODE、归一化流和自监督学习,用于 SHS 建模。
提出的方法
- NHA 使用三个核心组件建模 SHS:用于特定模式连续动态的神经微分方程(NDE),用于追踪系统模式的离散隐状态,以及用于预测随机转换时间的事件模块。
- 事件模块使用来自参数化 TPP(时间点过程)的强度函数,通过反变换采样和指数变体对随机转换进行建模。
- 归一化流用于建模隐状态分布,并实现对模式转换和系统演化的可微分推理。
- 通过基于机器人位置和资源图选择目标的策略规划器应用自监督,实现控制策略的端到端训练。
- 使用具有自适应步长和根查找的混合 ODE 积分算法生成数据集,支持多种事件类型和模式转换。
- 该框架通过将强度函数嵌入事件检测机制,支持确定性和随机事件处理。
实验结果
研究问题
- RQ1神经架构能否在不知道模式数量的情况下,学习混合系统中的多模式连续动态和随机转换?
- RQ2NHA 从观测轨迹中恢复隐藏系统模式并重建底层动态的能力如何?
- RQ3NHA 在复杂动态环境中,能在多大程度上实现分层机器人控制器的端到端学习?
- RQ4NHA 能否泛化到未见过的地图布局,并在机器人集群任务中保持高控制准确率?
主要发现
- NHA 在未知模式数量的情况下,成功恢复系统模式并学习具有随机转换的多模式连续动态。
- 在机器人集群控制任务中,NHA 在已知地图布局下对 100 台机器人实现了 99.8% ± 0.8% 的平均目标准确率。
- 在新的、未见过的地图布局上,模型泛化效果良好,对 100 台机器人实现了 98.5% ± 1.95% 的平均目标准确率。
- 训练过程在 4000 个训练周期后收敛,平均奖励和控制损失均趋于稳定,表明学习过程稳健。
- 具有自适应步长和根查找的混合积分算法,能够准确模拟复杂事件序列和模式切换。
- 该框架在分层控制中表现出强大的泛化能力,其中规划器与底层控制器通过自监督联合训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。