[논문 리뷰] DOB-Net: Actively Rejecting Unknown Excessive Time-Varying Disturbances
DOB-Net는 순환 신경망 기반의 교란 관측기와 제어기를 통합한 강화학습 프레임워크로, 로봇 시스템 내에서 알려지지 않은 시간에 따라 변하는 과도한 교란을 능동적으로 제거한다. RNN의 은닉 상태를 통해 과거 및 향후 교란을 인코딩함으로써 액추에이터 제약 조건 하에서도 최적의 제어를 가능하게 하며, 시뮬레이션 및 실제 실험에서 수집한 수중 교란 자료를 바탕으로 기존 피드백 제어기와 고전적 강화학습 알고리즘을 크게 능가한다.
This paper presents an observer-integrated Reinforcement Learning (RL) approach, called Disturbance OBserver Network (DOB-Net), for robots operating in environments where disturbances are unknown and time-varying, and may frequently exceed robot control capabilities. The DOB-Net integrates a disturbance dynamics observer network and a controller network. Originated from conventional DOB mechanisms, the observer is built and enhanced via Recurrent Neural Networks (RNNs), encoding estimation of past values and prediction of future values of unknown disturbances in RNN hidden state. Such encoding allows the controller generate optimal control signals to actively reject disturbances, under the constraints of robot control capabilities. The observer and the controller are jointly learned within policy optimization by advantage actor critic. Numerical simulations on position regulation tasks have demonstrated that the proposed DOB-Net significantly outperforms a conventional feedback controller and classical RL algorithms.
연구 동기 및 목표
- 제어 능력을 초월하는 알려지지 않은 과도한 시간에 따라 변하는 교란 상황에서 로봇 제어의 과제를 해결하기 위해.
- 정확한 시스템 모델에 의존하고 시간 상관관계 및 제어 제약 조건을 忽시하는 전통적 교란 관측기 기반 제어(DOBC)의 한계를 극복하기 위해.
- 교란 추정 및 제어 정책을 공동 최적화하는 통합 학습 프레임워크를 개발하여 내성적 저항성과 성능을 향상시키기 위해.
- RNN를 통한 예측적 교란 인코딩을 통한 능동적 교란 제거를 가능하게 하여 급격히 변화하는 교란에 대한 적응성을 향상시키기 위해.
- 수중 탱크에서 AUV로부터 수집한 데이터를 기반으로 시뮬레이션된 교란과 실제 세계의 교란 둘 다에서 방법을 검증하기 위해.
제안 방법
- DOB-Net는 이점 운동가치 기반 정책 최적화를 통해 엔드 투 엔드로 훈련되는 교란 동역학 관측 네트워크와 제어 네트워크를 조합한다.
- 관측 네트워크는 순환 신경망(RNN)을 사용하여 과거 교란 값들을 인코딩하고 은닉 상태에서 향후 교란을 예측함으로써 전통적인 DOB 메커니즘을 모방하고 향상시킨다.
- RNN 기반 관측기는 정확한 시스템 모델이 필요로 하지 않으며, 모델 불확실성에 대한 저항성을 향상시킨다.
- 제어 신호는 현재 로봇 상태와 RNN에 통합된 교란 예측을 입력으로 사용하는 제어 네트워크에 의해 생성된다.
- 관측기와 제어기의 공동 학습은 교란 동역학의 최적화된 표현을 가능하게 하여 수작업 설계된 특징에 의존하는 것을 피한다.
- 훈련은 여러 정현파로 구성된 시뮬레이션된 교란을 사용하며, 테스트는 AUV의 IMU에서 수집한 시뮬레이션 및 실제 세계의 교란 둘 다에서 수행된다.
실험 결과
연구 질문
- RQ1RNN 강화 관측 네트워크는 과도하고 시간에 따라 변하는 교란을 겪는 로봇의 교란 추정 및 예측을 향상시킬 수 있는가?
- RQ2강화학습을 통한 관측기와 제어기의 공동 학습은 고전적 피드백 또는 독립형 강화학습 방법보다 더 나은 교란 제거 성능을 달성할 수 있는가?
- RQ3훈련 중에 볼 수 없었던 실제 세계의 복잡하고 다양한 교란에 대해 DOB-Net은 어떤 성능을 보이는가?
- RQ4교란이 액추에이터 능력을 초월할 경우 제어 제약 조건 하에서도 성능이 유지되는가?
- RQ5제한된 훈련 데이터로도 더 넓은 진폭 범위를 가진 예상치 못한 교란 패턴에 일반화할 수 있는가?
주요 결과
- 대규모 시뮬레이션된 교란 하에서 DOB-Net은 목표 지점으로부터 중앙값 거리 0.493m를 기록했으며, 기존 제어기와 고전적 강화학습 대비 수렴 영역이 크게 좁아졌다.
- 대규모 시뮬레이션된 교란에 대해 DOB-Net과 최적 궤적 간 중앙값 거리 비율은 186.65%로, 이론적 최적에 매우 가까운 성능을 나타냈다.
- 수집된 실제 세계의 교란에 대해 DOB-Net의 중앙값 거리는 최적의 264.88%였으며, 실제 데이터의 더 높은 복잡성과 다양성으로 인해 성능 격차가 발생했다.
- 실제 데이터에서 격차가 있었음에도 불구하고, DOB-Net은 RISE 및 DOBC를 포함한 모든 베이스라인을 능가하여 실제 환경에서의 실용적 효과성을 입증했다.
- 더 큰 교란 진폭은 최적 제어 패tern이 더 유사해지게 하여 RL이 near-optimal 정책을 학습하기 쉽게 만들었으며, 이는 상대적 성능 향상에 기여했다.
- RNN이 은닉 상태에서 시간 동적 특성을 인코딩할 수 있어 모델 불확실성과 급격히 변화하는 교란에 대한 저항성이 입증되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.