Skip to main content
QUICK REVIEW

[논문 리뷰] Model-free Learning with Heterogeneous Dynamical Systems: A Federated LQR Approach

Han Wang, Leonardo F. Toso|arXiv (Cornell University)|2023. 08. 22.
Privacy-Preserving Technologies in DataComputer Science인용 수 3
한 줄 요약

이 논문은 이질적인 선형 시간 불변(LTI) 시스템을 위한 분산형, 모델 기반 미만의 강화학습 알고리즘인 FedLQR을 제안한다. 이 알고리즘은 서로 다른 동적 특성을 지닌 다수의 에이전트가 정책 기반 방법을 통해 원자료를 공유하지 않고도 공통의 안정화 정책을 공동으로 학습할 수 있도록 한다. 주요 기여는 이론적으로 FedLQR이 모든 에이전트에서 반복적 안정성을 보장하고, 낮은 이질성 범위에서는 에이전트 수에 비례하는 샘플 복잡도 감소를 달성하여 각 에이전트의 최적 정책으로의 수렴 속도를 가속화한다는 점이다.

ABSTRACT

We study a model-free federated linear quadratic regulator (LQR) problem where M agents with unknown, distinct yet similar dynamics collaboratively learn an optimal policy to minimize an average quadratic cost while keeping their data private. To exploit the similarity of the agents' dynamics, we propose to use federated learning (FL) to allow the agents to periodically communicate with a central server to train policies by leveraging a larger dataset from all the agents. With this setup, we seek to understand the following questions: (i) Is the learned common policy stabilizing for all agents? (ii) How close is the learned common policy to each agent's own optimal policy? (iii) Can each agent learn its own optimal policy faster by leveraging data from all agents? To answer these questions, we propose a federated and model-free algorithm named FedLQR. Our analysis overcomes numerous technical challenges, such as heterogeneity in the agents' dynamics, multiple local updates, and stability concerns. We show that FedLQR produces a common policy that, at each iteration, is stabilizing for all agents. We provide bounds on the distance between the common policy and each agent's local optimal policy. Furthermore, we prove that when learning each agent's optimal policy, FedLQR achieves a sample complexity reduction proportional to the number of agents M in a low-heterogeneity regime, compared to the single-agent setting.

연구 동기 및 목표

  • 제어 시스템에 대한 모델 기반 미만 강화학습에서의 높은 샘플 복잡도 문제를 해결하기 위해.
  • 원자료를 공유하지 않고도 서로 다른 동적 특성을 지닌 다수의 에이전트 간에 공동 정책 학습을 가능하게 하기 위해.
  • 다양한 동적 특성에도 불구하고 학습된 공통 정책가 모든 에이전트에 대해 안정화됨을 보장하기 위해.
  • 공통 정책와 각 에이전트의 개별 최적 정책 사이의 성능 격차를 정량화하기 위해.
  • 분산 협업을 통해 개별 최적 정책을 학습할 때의 샘플 복잡도 감소를 분석하기 위해.

제안 방법

  • 중앙 서버에서 M개의 에이전트로부터 정책 기반 기울기를 수렴시켜 분산 학습을 수행하며, 원자료를 공유하지 않고도 공동 학습이 가능하다.
  • 모델 기반 기반 기울기 방법을 사용하여 궤적 샘플링을 통해 기울기를 추정하고, 분산을 줄이기 위해 스무딩을 적용한다.
  • 정책 업데이트를 안정화 제어기 집합 내에 제약하여 반복적 안정성을 확보함으로써 매 반복에서 모든 에이전트가 안정된 상태를 유지하도록 한다.
  • 이론적 분석은 리아푸노프 유사 추론과 농도 불등식을 활용하여 추정 오차와 이질성 영향을 경계한다.
  • 이질성은 시스템 행렬의 변형으로 모델링되며, 공통 정책가 각 에이전트의 최적 정책에서 벗어나지 않는 범위를 유도한다.
  • 낮은 이질성 조건 하에서 수렴이 증명되며, 근사 최적 성능를 달성하기 위한 명시적 샘플 복잡도 경계가 유도된다.

실험 결과

연구 질문

  • RQ1분산 학습을 통해 학습된 공통 정책가 이질적인 동적 특성을 지닌 모든 에이전트에 대해 안정화되는가?
  • RQ2비용 함수 격차 측면에서 공통 정책가 각 에이전트의 개별 최적 정책과 얼마나 가까운가?
  • RQ3에이전트가 연합 내 다른 에이전트의 데이터를 활용함으로써 자신의 최적 정책으로의 수렴 속도를 빠르게 할 수 있는가?
  • RQ4시스템의 이질성이 분산 정책의 성능 및 안정성에 어떤 영향을 미치는가?
  • RQ5개별 에이전트가 분산 협업을 통해 학습할 때의 샘플 복잡도 감소는 어느 정도 달성 가능한가?

주요 결과

  • FedLQR은 이질적인 동적 특성 조건 하에서도 모든 반복에서 공통 정책가 모든 에이전트에 대해 안정화됨을 보장한다.
  • 공통 정책와 각 에이전트의 최적 정책 사이의 거리는 반복 횟수에 따라 지수적으로 감소하는 항으로 경계된다.
  • 낮은 이질성 범위에서는 단일 에이전트 학습 대비 FedLQR이 각 에이전트의 최적 정책 학습에 대해 에이전트 수 M에 비례하는 비율로 샘플 복잡도를 감소시킨다.
  • FedLQR의 수렴 속도는 최적 공분산 행렬의 조건수와 제어 비용 행렬의 최소 고유값에 의해 결정된다.
  • 궤적 길이, 스무딩 반경, 샘플 크기를 적절히 선택함으로써 추정 오차와 이질성 오차를 제어할 수 있으며, 이로 인해 높은 확률로 근사 최적 성능를 달성할 수 있다.
  • 이론적 분석은 이질성이 유한하게 제한되어 있을 경우, 분산 학습이 모델 기반 미만 LQR에 안전하게 적용될 수 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.