[논문 리뷰] Dynamic Weights in Multi-Objective Deep Reinforcement Learning
이 논문은 가중치 조건화 네트워크(CN)가 가중치 조건부 다목표 Q-값을 출력하고, 다이나믹 가중치 MORL의 비정상성(non-stationarity)을 처리하기 위한 Diverse Experience Replay(DER)를 제시합니다. Minecart와 DST에서 가중치 변화 시나리오하에서 CN과 DER이 적응된 baselines보다 더 우수한 성능을 보임.
Many real-world decision problems are characterized by multiple conflicting objectives which must be balanced based on their relative importance. In the dynamic weights setting the relative importance changes over time and specialized algorithms that deal with such change, such as a tabular Reinforcement Learning (RL) algorithm by Natarajan and Tadepalli (2005), are required. However, this earlier work is not feasible for RL settings that necessitate the use of function approximators. We generalize across weight changes and high-dimensional inputs by proposing a multi-objective Q-network whose outputs are conditioned on the relative importance of objectives and we introduce Diverse Experience Replay (DER) to counter the inherent non-stationarity of the Dynamic Weights setting. We perform an extensive experimental evaluation and compare our methods to adapted algorithms from Deep Multi-Task/Multi-Objective Reinforcement Learning and show that our proposed network in combination with DER dominates these adapted algorithms across weight change scenarios and problem domains.
연구 동기 및 목표
- 목표 중요도가 시간이 지남에 따라 변화하는 다이나믹 가중치 설정을 다룬다.
- 가중치 벡터와 고차원 입력에 일반화되는 확장 가능한 심층 MORL 접근법을 개발한다.
- 비정상적인 가중치 시나리오에서 샘플 효율성을 개선하고 재생 버퍼 편향을 완화한다.
- 가중치 변화에 신속하게 적응하고 다양한 체제에서 최적 정책으로 수렴하는지 보여준다.
제안 방법
- 가중치 벡터에 조건화된 다목표 Q-값 벡터를 출력하는 조건화 네트워크(CN)를 도입한다.
- 활성 가중치와 과거의 무작위로 샘플링된 가중치를 경험당 하나씩 사용하는 업데이트 규칙으로 현재 학습과 정책 보존의 균형을 맞추며 CN을 학습시킨다.
- 다양성을 기반으로 한 기억화와 궤적 시그니처를 통해 다양한 가중치 벡터에 대해 정보가 풍부한 궤적을 유지하기 위한 Diverse Experience Replay(DER)를 제안한다.
- 연속 상태 공간, 확률적 전이, 지연 보상이 있는 Minecart 벤치마크를 사용하여 가중치 변화 시나리오를 평가한다.
- CN을 UVFA, Multi-Network(MN), 기본 MO, ablated CN 변형(CN-ACTIVE, CN-UVFA)과 비교하고 희박한 가중치 변화 규칙과 일반 가중치 변화 규칙에서 평가한다.
- 선택적으로 DER 여부와 함께 표준 경험 재생(SER)을 평가하고 우선순위 재생을 포함한다.
실험 결과
연구 질문
- RQ1가중치 조건부 심층 Q-네트워크가 다이나믹 MORL에서 변화하는 가중치 벡터에 대해 일반화할 수 있는가?
- RQ2DER이 샘플 효율성을 개선하고 가중치 변화 시나리오에서 버퍼 편향을 완화하는가?
- RQ3CN이 희박한 versus 일반적인 가중치 변화 설정에서 조정된 baselines(UVFA, MN, MO)와 비교해 어떻게 되는가?
- RQ4CN은 급격한 가중치 변화에 대해 강건하며 변화가 잦을 때 최적 정책으로 수렴할 수 있는가?
주요 결과
- CN은 가중치 변화 시나리오와 문제 도메인 전반에서 조정된 알고리즘을 능가한다.
- DER은 재생 버퍼에서 다양하고 정보가 풍부한 궤적을 유지함으로써 모든 테스트된 알고리즘의 성능을 향상시킨다.
- CN은 희박하고 급격한 가중치 변화에 빠르게 적응하고 규칙적인 가중치 변화에서 좋은 정책으로 수렴한다.
- MN은 정확한 Q-값으로 수렴하는 데 오랜 학습 시간이 필요하여 온라인 다이나믹 가중치에서 실용적 이점을 제한한다.
- CN-ACTIVE는 과거 정책을 보존하는 메커니즘이 없어 종종 성능이 떨어지는 반면, DER 없이 CN-UVFA는 넓은 가중치 샘플 학습으로 인해 어려움을 겪는다.
- Minecart와 DST 벤치마크 전반에서 CN+DER은 기준선에 비해 최저 혹은 거의 최저의 regret 성능을 달성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.