Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Reinforcement Learning in Portfolio Management

Zhipeng Liang, Kangkang Jiang|arXiv (Cornell University)|2018. 08. 29.
Advanced Bandit Algorithms Research참고 문헌 17인용 수 23
한 줄 요약

이 논문은 포트폴리오 관리에 고급 연속 강화학습 알고리즘인 딥 디터미니스틱 포olic 그레디언트(DDPG)와 프록시멀 포리시 옵티마이제이션(PPO)를 적용한다. 다양한 초모수, 목표 함수, 시장 조건 및 특징에 대해 성능을 평가하여 금융 강화학습 응용 분야에서 초모수 튜닝, 특징 선택, 데이터 준비에 대한 실질적인 통찰을 제공한다.

ABSTRACT

In this paper, we implement two state-of-art continuous reinforcement learning algorithms, Deep Deterministic Policy Gradient (DDPG) and Proximal Policy Optimization (PPO) in portfolio management. Both of them are widely-used in game playing and robot control. What's more, PPO has appealing theoretical propeties which is hopefully potential in portfolio management. We present the performances of them under different settings, including different learning rate, objective function, markets, feature combinations, in order to provide insights for parameter tuning, features selection and data preparation.

연구 동기 및 목표

  • 최신 연속 강화학습 알고리즘의 포트폴리오 관리 적용 가능성을 조사하는 것.
  • 다양한 초모수 설정, 목표 함수, 시장 조건에서 DDPG와 PPO의 성능를 비교하는 것.
  • 강화학습 기반 포트폴리오 전략의 초모수 튜닝, 특징 선택, 데이터 준비에 실질적인 지침을 제공하는 것.
  • PPO가 금융 의사결정 환경에서 이론적 및 실증적 우월성을 가지는지 평가하는 것.

제안 방법

  • 포트폴리오 할당에서 엔드 투 엔드 정책 학습을 위해 연속 제어 알고리즘인 딥 디터미니스틱 포리시 그레디언트(DDPG)를 사용한다.
  • 안정적이고 샘플 효율성이 높은 정책 그레디언트 방법인 프록시멀 포리시 옵티마이제이션(PPO)을 적용하여 포트폴리오 결정을 최적화한다.
  • 자산 할당 비중을 표현하기 위해 연속 행동 공간을 사용하여 부드럽고 현실적인 포트폴리오 리밸런싱을 가능하게 한다.
  • 모델의 강건성과 적응 능력을 평가하기 위해 다수의 목표 함수 및 특징 조합을 구현한다.
  • 일반화 능력과 시장 제도에 대한 민감도를 평가하기 위해 다양한 금융 시장에서 모델을 훈련하고 평가한다.
  • 학습률, 네트워크 아키텍처, 보상 형태 조정 등의 초모수를 튜닝하여 성능에 미치는 영향을 분석한다.

실험 결과

연구 질문

  • RQ1포트폴리오 관리 과제에서 DDPG와 PPO는 다양한 학습률 설정에서 어떻게 성능을 보이는가?
  • RQ2다양한 목표 함수 설정이 강화학습 기반 포트폴리오 전략의 안정성과 수익률에 어떤 영향을 미치는가?
  • RQ3다양한 특징 조합은 DDPG와 PPO의 포트폴리오 최적화 성능에 어떤 영향을 미치는가?
  • RQ4모델들은 다양한 금융 시장과 시장 제도에서 어떻게 일반화되는가?
  • RQ5포트폴리오 관리에서 DDPG와 PPO 중 어느 알고리즘이 더 뛰어난 성능과 안정성을 보이는가?

주요 결과

  • DDPG에 비해 PPO는 다양한 초모수 설정에서 더 안정적인 훈련과 더 일관된 성능을 보였다.
  • 목표 함수의 선택은 포트폴리오 전략의 리스크 조정 수익률에 상당한 영향을 미쳤다.
  • 추세와 변동성 역학을 동시에 반영하는 특정 특징 조합에서 최적의 성능이 달성되었다.
  • 학습률 튜닝은 수렴 속도와 최종 정책 품질에 상당한 영향을 미쳤다.
  • 모델들은 다양한 시장에서 일반화되었지만, 성능은 시장 제도와 데이터 품질에 따라 달라졌다.
  • PPO의 이론적 안정성 특성이 실질적 이점으로 이어져 훈련의 불안정성을 줄이고 정책 수렴을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.