[논문 리뷰] PD-MORL: Preference-Driven Multi-Objective Reinforcement Learning Algorithm
이 논문은 연속 제어 작업에서 전체 선호 공간을 커버하는 단일 유니버설 정책 네트워크를 훈련시키는 선호 기반 다목적 강화학습 알고리즘인 PD-MORL을 제안한다. 선호 벡터를 입력으로 삼고, 수정된 벨만 업데이트에서余弦 유사도를 사용하며, 선호 하위공간 간 병렬 탐색을 가능하게 함으로써 PD-MORL은 이전 방법 대비 최대 25% 더 큰 하이퍼볼륨을 달성하고, 파arameter 수를 한 수준 더 줄였다.
Multi-objective reinforcement learning (MORL) approaches have emerged to tackle many real-world problems with multiple conflicting objectives by maximizing a joint objective function weighted by a preference vector. These approaches find fixed customized policies corresponding to preference vectors specified during training. However, the design constraints and objectives typically change dynamically in real-life scenarios. Furthermore, storing a policy for each potential preference is not scalable. Hence, obtaining a set of Pareto front solutions for the entire preference space in a given domain with a single training is critical. To this end, we propose a novel MORL algorithm that trains a single universal network to cover the entire preference space scalable to continuous robotic tasks. The proposed approach, Preference-Driven MORL (PD-MORL), utilizes the preferences as guidance to update the network parameters. It also employs a novel parallelization approach to increase sample efficiency. We show that PD-MORL achieves up to 25% larger hypervolume for challenging continuous control tasks and uses an order of magnitude fewer trainable parameters compared to prior approaches.
연구 동기 및 목표
- 목표와 제약 조건이 자주 변화하는 다목적 강화학습(MORL)에서의 확장성 및 동적 재구성 문제를 해결하기 위해.
- 모든 가능한 선호 벡터를 포괄하는 단일 정책을 학습시켜 재훈련이 필요 없도록 하기 위해.
- 선호 유도 훈련과 병렬 탐색을 통해 연속 제어 작업에서 샘플 효율성과 파레토 최적 해 커버리지 향상시키기 위해.
- 다양한 MORL 벤치마크에서 성능을 유지하거나 향상시키면서 모델 복잡성 감소시키기 위해.
- 재훈련 없이 추론 시에 실시간으로 선호 설정을 지원하는 확장 가능하고 통합된 솔루션 제공하기 위해.
제안 방법
- 신경망이 상태와 선호 벡터를 모두 입력으로 받아, 단일 정책이 모든 선호에 일반화되도록 한다.
- 선호 벡터와 Q-값 벡터 간의 여론 유사도를 사용하여 학습을 유도하는 선호 기반 벨만 최적성 연산자를 도입한다.
- 다차원 보간기(인터폴레이터)는 원시 선호 벡터를 정규화된 해 공간으로 투영하여 선호를 파레토 최적 해와 일치시킨다.
- 다양한 선호 하위공간 간 데이터 불균형 문제를 완화하기 위해 뒤늦은 경험 재현(HER)을 적용한다.
- 선호 공간을 하위공간으로 분할하고, 병렬 자식 프로세스들이 독립적으로 전이 데이터를 수집함으로써 편향 없고 효율적인 탐색을 보장한다.
- 비정책 알고리즘과 호환되며, 이산 동작에 대해서는 MO-DDQN-HER로, 연속 제어 작업에 대해서는 MO-TD3-HER로 구현된다.
실험 결과
연구 질문
- RQ1다목적 강화학습에서 전체 연속 선호 공간에 걸쳐 일반화할 수 있는 단일 신경망 정책을 훈련시킬 수 있는가?
- RQ2선호 벡터와 Q-값 간의 여론 유사도를 통합할 경우, 정책가 파레토 최적 해에 더 잘 일치하는가?
- RQ3선호 하위공간 간 병렬 탐색이 훈련의 샘플 효율성 향상과 편향 감소에 어느 정도 기여하는가?
- RQ4PG-MORL 및 핵심 구성 요소가 없는 PD-MORL과 비교해 복수의 기준(하이퍼볼륨, 희소성)에서 제안된 방법은 어떻게 성능을 냈는가?
- RQ5선호 투영을 위한 다차원 보간기를 사용할 경우, 진정한 파레토 최적 해와의 일치도가 향상되는가?
주요 결과
- PD-MORL은 도전적인 연속 제어 작업(예: MO-HalfCheetah-v2, MO-Hopper-v2)에서 이전 방법 대비 최대 25% 더 큰 하이퍼볼륨을 달성한다.
- 기존 접근 방식 대비 훈련 가능한 파arameter 수를 한 수준 줄였지만 성능을 유지하거나 향상시켰다.
- 손실 함수에서 방향 각도 항을 제거하면 성능이 크게 악화되며, 특히 밀도 높은 파레토 최적 해 영역에서 희소성 증가와 하이퍼볼륨 감소가 관찰된다.
- 병렬 탐색은 필수적이다: 이를 비활성화할 경우 모든 벤치마크에서 하이퍼볼륨이 급격히 감소하고 희소성이 증가한다.
- 제거 실험 결과, 여론 유사도, HER, 병렬 탐색의 조합이 뛰어난 성능을 내기 위해 필수적임을 확인하였으며, 이러한 구성 요소가 빠진 변종보다 PD-MORL이 뛰어난 성능을 보였다.
- MO-Hopper-v2에서 PD-MORL은 동일한 기준점 사용 시 PG-MORL(2.02×10⁷)을 초월하는 하이퍼볼륨 1.88×10⁷을 달성하였고, 희소성 0.3×10⁴를 기록하여 밀도 높고 넓은 파레토 최적 해 커버리지가 이루어짐을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.