Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Hybrid Automata: Learning Dynamics with Multiple Modes and Stochastic Transitions

Michael Poli, Stefano Massaroli|arXiv (Cornell University)|2021. 06. 08.
Reinforcement Learning in Robotics참고 문헌 44인용 수 7
한 줄 요약

이 논문은 모드 수와 확률적 전이가 알려져 있지 않은 확률적 하이브리드 시스템을 데이터 기반으로 학습할 수 있는 데이터 기반 프레임워크인 신경 하이브리드 오토마타(Neural Hybrid Automata, NHA)를 소개한다. 신경 미분방정식, 정규화 흐름, 자기지도 학습을 결합함으로써 NHA는 시스템 구조에 대한 사전 지식 없이 다중 모드 동역학과 이벤트 유발 전이를 추론하며, 로봇 군집에서 99.8%의 목표 정확도를 달성한 정확한 모드 복원과 종단 간 제어를 실현한다.

ABSTRACT

Effective control and prediction of dynamical systems often require appropriate handling of continuous-time and discrete, event-triggered processes. Stochastic hybrid systems (SHSs), common across engineering domains, provide a formalism for dynamical systems subject to discrete, possibly stochastic, state jumps and multi-modal continuous-time flows. Despite the versatility and importance of SHSs across applications, a general procedure for the explicit learning of both discrete events and multi-mode continuous dynamics remains an open problem. This work introduces Neural Hybrid Automata (NHAs), a recipe for learning SHS dynamics without a priori knowledge on the number of modes and inter-modal transition dynamics. NHAs provide a systematic inference method based on normalizing flows, neural differential equations and self-supervision. We showcase NHAs on several tasks, including mode recovery and flow learning in systems with stochastic transitions, and end-to-end learning of hierarchical robot controllers.

연구 동기 및 목표

  • 시스템 모드 수나 전이 동역학에 대한 사전 지식 없이도 데이터로부터 확률적 하이브리드 시스템(SHSs)을 학습할 수 있는 일반 목적의 방법을 개발하는 것.
  • 특히 확률적이고 다중 모드 설정에서 연속 흐름과 이산적 사건이 얽혀 있는 하이브리드 시스템 학습의 과제를 해결하는 것.
  • 시범 데이터로부터 계획 및 제어 정책을 함께 학습함으로써 계층적 로봇 컨트롤러의 종단 간 훈련을 가능하게 하는 것.
  • 신경 미분방정식, 정규화 흐름, 자기지도 학습을 통합한 체계적인 추론 프레임워크를 제공하여 SHS 모델링을 가능하게 하는 것.

제안 방법

  • NHAs는 세 가지 핵심 구성 요소를 사용하여 SHS를 모델링한다: 모드별 연속 동역학을 위한 신경 미분방정식(NDE), 시스템 모드를 추적하기 위한 이산 잠재 상태, 그리고 확률적 전이 시간을 예측하기 위한 이벤트 모듈.
  • 이벤트 모듈은 매개변수화된 시간적 점과정(TPPs)에서 유도된 강도 함수를 사용하며, 확률적 전이는 역변환 샘플링과 지수 분포 변수를 통해 모델링된다.
  • 정규화 흐름은 잠재 상태 분포를 모델링하고 모드 전이 및 시스템 진화에 대한 미분 가능 추론을 가능하게 한다.
  • 자기지도 학습은 로봇 위치와 자원 지도를 기반으로 목표를 선택하는 정책 플래너를 통해 적용되며, 제어 정책의 종단 간 훈련을 가능하게 한다.
  • 데이터셋 생성을 위해 적응형 스텝 크기와 루트 찾기 기반의 하이브리드 ODE 통합 알고리즘을 사용하여 다중 이벤트 유형과 모드 전이를 지원한다.
  • 강도 함수를 이벤트 탐지 메커니즘에 통합함으로써 결정론적 및 확률적 이벤트 처리를 모두 지원한다.

실험 결과

연구 질문

  • RQ1신경 아키텍처는 모드 수에 대한 사전 지식 없이도 하이브리드 시스템에서 다중 모드 연속 동역학과 확률적 전이를 학습할 수 있는가?
  • RQ2NHAs는 관측된 궤적에서 숨겨진 시스템 모드를 얼마나 잘 복원하고 기저 동역학을 재구성할 수 있는가?
  • RQ3NHAs는 복잡하고 동적인 환경에서 계층적 로봇 컨트롤러의 종단 간 학습을 어느 정도 가능하게 하는가?
  • RQ4NHAs는 새로운 지도 레이아웃에 일반화되어 로봇 군집 작업에서 높은 제어 정확도를 유지할 수 있는가?

주요 결과

  • NHAs는 모드 수가 알려져 있지 않은 경우에도 시스템 모드를 성공적으로 복원하고, 확률적 전이가 있는 시스템에서 다중 모드 연속 동역학을 학습한다.
  • 로봇 군집 제어 작업에서, NHAs는 100台의 로봇을 대상으로 알려진 지도 레이아웃에서 평균 99.8% ± 0.8%의 목표 정확도를 달성했다.
  • 새로운, 알려지지 않은 지도 레이아웃에서는 모델이 효과적으로 일반화되었으며, 100대의 로봇을 대상으로 평균 98.5% ± 1.95%의 목표 정확도를 달성했다.
  • 훈련 과정은 4000 에피소드 후 수렴하였으며, 평균 보상과 제어 손실 모두 안정화되어 강력한 학습을 나타냈다.
  • 적응형 스텝 크기와 루트 찾기를 갖춘 하이브리드 통합 알고리즘이 복잡한 이벤트 시퀀스와 모드 전환의 정확한 시뮬레이션을 가능하게 하였다.
  • 플래너와 저수준 컨트롤러가 자기지도 학습을 통해 함께 훈련됨에 따라, 계층적 제어에서 강력한 일반화 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.