[논문 리뷰] Adversarial Deep Reinforcement Learning in Portfolio Management
논문은 중국 주식 데이터에서 포트폴리오 관리에 대해 DDPG, PPO, PG를 비교하고, 학습 효율성과 성능을 개선하기 위해 적대적 학습(adversarial training)을 도입하며, 정책 기울기(PG)가 종종 다른 방법들보다 우수하다고 보임(적대적 강화로 향상).
In this paper, we implement three state-of-art continuous reinforcement learning algorithms, Deep Deterministic Policy Gradient (DDPG), Proximal Policy Optimization (PPO) and Policy Gradient (PG)in portfolio management. All of them are widely-used in game playing and robot control. What's more, PPO has appealing theoretical propeties which is hopefully potential in portfolio management. We present the performances of them under different settings, including different learning rates, objective functions, feature combinations, in order to provide insights for parameters tuning, features selection and data preparation. We also conduct intensive experiments in China Stock market and show that PG is more desirable in financial market than DDPG and PPO, although both of them are more advanced. What's more, we propose a so called Adversarial Training method and show that it can greatly improve the training efficiency and significantly promote average daily return and sharpe ratio in back test. Based on this new modification, our experiments results show that our agent based on Policy Gradient can outperform UCRP.
연구 동기 및 목표
- 거래 비용과 유한한 기간 하에서 포트폴리오 관리에 딥 강화 학습을 적용하는 동기를 제시한다.
- 다양한 하이퍼파라미터, 데이터 전처리, 특징 세트를 대상으로 세 가지 연속 RL 알고리즘(DDPG, PPO, PG)을 체계적으로 평가한다.
- 금융 맥락에서 학습 효율성과 위험 민감도를 개선하기 위한 Adversarial Training을 제안한다.
- 정책 성능에 대한 데이터 정규화, 네트워크 구조, 특징 조합의 영향을 탐구한다.
제안 방법
- 거래 비용과 로그-부의 보상으로 마르코프 의사결정 과정으로 포트폴리오 관리를 모델링한다.
- 신경망 함수 근사를 이용하여 DDPG, PPO, 표준 정책 기울기(PG)를 구현하고 비교한다.
- 시장 가격에 노이즈를 추가하고 정책 기울기를 적응시켜 적대적 학습(Adversarial Training)을 도입한다.
- 공유 매개변수를 가진 다중 자산 처리를 위한 Identical Independent Evaluators (IIE) 네트워크 아키텍처를 사용한다.
- 중국 주식시장 데이터, 포트폴리오당 5개 자산, 기간 간 데이터 정규화를 사용하여 실험한다.
- 학습률, 특징 조합, 위험조정 목표 고려사항을 평가한다.
실험 결과
연구 질문
- RQ1거래 비용 하에서 중국 주식 포트폴리오에서 어떤 연속 강화학습 알고리즘(DDPG, PPO, PG)이 최상의 성능을 보이나?
- RQ2학습률, 네트워크 깊이 등의 하이퍼파라미터, 특징 선택, 데이터 전처리가 이 알고리즘들 간 정책 성능에 어떠한 영향을 주는가?
- RQ3적대적 학습이 백테스팅에서 학습 효율성과 금융 성과(예: 평균 일일 수익률 및 샤프 비율)를 개선하는가?
- RQ4Identical Independent Evaluators 아키텍처와 특징 조합이 확장성과 학습 안정성에 미치는 영향은 무엇인가?
- RQ5이 reinforcement learning 접근법들이 현실적 시장 마찰 하에서 전통적 벤치마크를 능가할 수 있는가?
주요 결과
- 정책 기울기(PG)가 분석된 금융 시장에서 DDPG와 PPO보다 더 바람직한 경향이 있다.
- 적대적 학습은 학습 효율성을 크게 개선하고 백테스팅에서 평균 일일 수익률과 샤프 비율을 증가시킨다.
- 특징 선택은 중요하다; 종가와 고가를 결합하는 조합이 실험에서 더 나은 성능을 보여준다.
- 학습률은 비평가 손실과 안정성에 영향을 미치며, 행위자 학습률은 학습 동역학과 비평가 일반화에 영향을 준다.
- 데이터 정규화와 IIE 네트워크 구조는 다중 자산에 걸친 학습의 확장성을 지지한다.
- 적대적 수정을 가진 PG는 연구 설정에서 UCRP와 같은 벤치마크를 능가할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.