Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-agent Dynamic Algorithm Configuration

Ke Xue, Jiacheng Xu|arXiv (Cornell University)|2022. 10. 13.
Advanced Multi-Objective Optimization Algorithms인용 수 7
한 줄 요약

이 논문은 복잡한 최적화 알고리즘에서 다수의 이질적인 하이퍼파rameter를 동적으로 조정하는 데 협업하는 다중 에이전트 강화학습 프레임워크인 다중에이전트 동적 알고리즘 구성(MA-DAC)을 제안한다. 각 하이퍼파ram터 유형을 맥락 기반 다중에이전트 MDP의 별개의 에이전트로 모델링함으로써, MA-DAC는 MOEA/D에서 히ュ리스틱 규칙, 다중 손실 기반 밴드잇, 단일에이전트 RL보다 뛰어난 성능과 문제 유형 간 일반화 능력을 입증한다.

ABSTRACT

Automated algorithm configuration relieves users from tedious, trial-and-error tuning tasks. A popular algorithm configuration tuning paradigm is dynamic algorithm configuration (DAC), in which an agent learns dynamic configuration policies across instances by reinforcement learning (RL). However, in many complex algorithms, there may exist different types of configuration hyperparameters, and such heterogeneity may bring difficulties for classic DAC which uses a single-agent RL policy. In this paper, we aim to address this issue and propose multi-agent DAC (MA-DAC), with one agent working for one type of configuration hyperparameter. MA-DAC formulates the dynamic configuration of a complex algorithm with multiple types of hyperparameters as a contextual multi-agent Markov decision process and solves it by a cooperative multi-agent RL (MARL) algorithm. To instantiate, we apply MA-DAC to a well-known optimization algorithm for multi-objective optimization problems. Experimental results show the effectiveness of MA-DAC in not only achieving superior performance compared with other configuration tuning approaches based on heuristic rules, multi-armed bandits, and single-agent RL, but also being capable of generalizing to different problem classes. Furthermore, we release the environments in this paper as a benchmark for testing MARL algorithms, with the hope of facilitating the application of MARL.

연구 동기 및 목표

  • 단일에이전트 동적 알고리즘 구성(DAC)이 어려움을 겪는, 복잡한 알고리즘에서 다수의 이질적인 하이퍼파aram터를 동적으로 조정하는 문제를 해결하기 위해.
  • 공동 하이퍼파aram터 튜닝 문제를 협업적 맥락 기반 다중에이전트 마르코프 결정 과정(MMDP)으로 공식화하기 위해.
  • 다양한 하이퍼파aram터 유형을 지원하는 확장 가능하고 일반화 가능한 동적 알고리즘 구성 솔루션을 개발하기 위해.
  • 실제 다중목표 최적화 알고리즘(MOEA/D)에서 제안된 방법의 효과성과 일반화 능력을 입증하기 위해.
  • MOEA/D 구성 기반의 다중에이전트 강화학습(MARL)을 위한 새로운 벤치마크 환경을 공개하기 위해.

제안 방법

  • 다양한 하이퍼파aram터 유형을 가진 알고리즘의 동적 구성 문제를 맥락 기반 다중에이전트 MDP(MMDP)로 모델링하며, 각 에이전트는 하나의 하이퍼파aram터 유형을 제어한다.
  • 공동 작동하는 MARL 알고리즘—특히 값 분해 네트워크(VDN)—를 사용하여 공유 팀 보상 최대화를 위한 공동 정책을 학습한다.
  • 알고리즘 실행 진행 상황과 성능 이력(예: 목표 값 변화)을 기반으로 상태 표현을 정의한다.
  • 각 에이전트의 액션 공간을 특정 하이퍼파aram터의 이산적 또는 연속적 설정(예: 가중치, 이웃 수, 연산자 유형)에 대응하도록 설계한다.
  • 알고리즘 성능에 기반한 희박 보상 또는 형태화된 보상으로, 딥 강화학습을 통해 다중에이전트 정책을 엔드 투 엔드로 훈련한다.
  • MOEA/D에 프레임워크를 적용하여 네 가지 별개의 하이퍼파aram터 유형을 조정한다: 가중치 벡터, 이웃 수, 복제 연산자 유형, 연산자별 파라미터.

실험 결과

연구 질문

  • RQ1다중에이전트 강화학습 접근법은 복잡한 알고리즘에서 다수의 이질적인 하이퍼파aram터 유형을 효과적이고 협업적으로 튜닝할 수 있는가?
  • RQ2MA-DAC는 다중목표 최적화에서 다양한 문제 인스턴스와 목표 수에 걸쳐 일반화되는가?
  • RQ3히ュ리스틱 규칙, 다중 손실 기반 밴드잇, 단일에이전트 RL 기준선 대비 MA-DAC의 성능은 어떻게 되는가?
  • RQ4각 개별 하이퍼파aram터 유형이 전체 알고리즘 성능에 기여하는 정도는 어떠한가?
  • RQ5제안된 프레임워크는 다중에이전트 강화학습 알고리즘 평가를 위한 재사용 가능한 벤치마크로 활용될 수 있는가?

주요 결과

  • MA-DAC는 다중목표 최적화 문제에서 수렴 속도와 최종 해 품질 측면에서 히ュ리스틱 규칙 기반 방법, 다중 손실 기반 밴드잇, 단일에이전트 RL 기준선보다 뚜렷이 뛰어난 성능을 보였다.
  • 학습된 MA-DAC 정책은 동일한 목표 수이지만 다른 인스턴스의 내부 클래스와 목표 수가 다른 외부 클래스 간에 효과적으로 일반화되어 강력한 전이 능력을 보였다.
  • 제거 실험 결과, 최적 성능를 위해 네 가지 하이퍼파aram터 유형(가중치, 이웃 수, 연산자 유형, 연산자 파라미터)을 모두 튜닝하는 것이 필수적임을 확인했다.
  • 정적 및 단일에이전트 동적 구성 접근법 대비 MA-DAC는 더 뛰어난 수렴 성능과 히퍼볼륨 향상 성능을 달성했다.
  • 저자들은 MOEA/D 구성 환경을 다중에이전트 강화학습(MARL)을 위한 벤치마크로 공개하여 협업적 다중에이전트 학습 분야의 연구를 지원했다.
  • 프레임워크는 하이퍼파aram터 유형의 이질성과 진화적 탐색의 확률적 특성을 효과적으로 처리하여 실세계 알고리즘 구성에 적합함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.