Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Safe Multi-Agent Control with Decentralized Neural Barrier Certificates

Zengyi Qin, Kaiqing Zhang|arXiv (Cornell University)|2021. 01. 14.
Advanced Control Systems Optimization참고 문헌 36인용 수 48
한 줄 요약

논문은 분산형의 공동 학습 프레임워크를 제시하며, 다중 에이전트 제어 정책을 신경망 제어 장벽 증명(CBFs)으로 학습하여 안전성과 확장성을 많은 에이전트에 걸쳐 보장한다.

ABSTRACT

We study the multi-agent safe control problem where agents should avoid collisions to static obstacles and collisions with each other while reaching their goals. Our core idea is to learn the multi-agent control policy jointly with learning the control barrier functions as safety certificates. We propose a novel joint-learning framework that can be implemented in a decentralized fashion, with generalization guarantees for certain function classes. Such a decentralized framework can adapt to an arbitrarily large number of agents. Building upon this framework, we further improve the scalability by incorporating neural network architectures that are invariant to the quantity and permutation of neighboring agents. In addition, we propose a new spontaneous policy refinement method to further enforce the certificate condition during testing. We provide extensive experiments to demonstrate that our method significantly outperforms other leading multi-agent control approaches in terms of maintaining safety and completing original tasks. Our approach also shows exceptional generalization capability in that the control policy can be trained with 8 agents in one scenario, while being used on other scenarios with up to 1024 agents in complex multi-agent environments and dynamics.

연구 동기 및 목표

  • 형식적 안전 보장을 갖춘 대규모 다중 에이전트 시스템에서 안전한 제어를 촉진한다.
  • 제어 정책과 안전 증명(CBF)을 공동으로 학습하는 분산 프레임워크를 개발한다.
  • 로컬 관찰과 불변 네트워크 설계를 통해 임의의 수의 에이전트로 확장성을 달성한다.
  • 보이지 않은 환경 및 에이전트 수에 대한 일반화를 보여준다.
  • 훈련 효율성과 테스트 안전성을 향상시키는 기술을 제공한다.

제안 방법

  • 로컬 상태와 관측에 의존하는 분산 CBF를 정의한다.
  • 여유 마진 gamma를 갖는 데이터를 통해 정책 π_i와 장벽 함수 h_i를 공동으로 학습한다.
  • 세 가지 CBF 조건과 목표 도달 항을 강제하는 손실을 사용한다.
  • 이웃 수의 가변성에 대응하기 위해 양 불변(수량-순서 불변) 신경 인코더를 채택한다.
  • 온-폴리시 데이터와 반복적 데이터 수집으로 학습/테스트 분포를 맞춘다.
  • CBF 조건이 위반될 때 행동을 조정하기 위해 자발적인 온라인 정책 정제를 도입한다.

실험 결과

연구 질문

  • RQ1분산형 제어 장벽 함수가 중앙 제어자 없이 다중 에이전트 환경에서 안전을 보장할 수 있는가?
  • RQ2가변적인 이웃 에이전트의 수와 순서를 다루기 위해 신경망을 어떻게 설계할 수 있는가?
  • RQ3정책과 CBF의 공동 학습이 보이지 않는 시나리오와 더 큰 에이전트 수에 일반화되는가?
  • RQ4학습된 증명 외에 온라인 정제가 테스트 중 안전성을 향상시키는가?
  • RQ5안전성을 보장하면서 목표 지향적 행동을 달성하기 위한 실용적 학습 전략은 무엇인가?

주요 결과

  • 분산형 CBF를 갖춘 공동 학습 프레임워크가 분산 조건이 만족될 때 안전 보장을 제공한다.
  • 양 불변 인코더를 사용하면 이웃 수가 가변적이고 에이전트 수가 임의로 늘어나도 방법이 확장된다.
  • 8 에이전트로 학습된 정책이 복잡한 환경에서 최대 1024 에이전트의 시나리오로 일반화된다.
  • 본 방법은 2D 및 3D 작업에서 안전성과 작업 완성도 측면에서 선두적인 학습 기반 및 계획 기반 접근법을 능가한다.
  • CBF 조건을 적극적으로 강제해 테스트 중 안전성을 추가로 개선하는 자발적 온라인 정책 정제가 있다.
  • 훈련 조건을 넘어서는 환경과 에이전트 수에서 강한 일반화를 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.