Skip to main content
QUICK REVIEW

[논문 리뷰] A Deep Reinforcement Learning Framework for the Financial Portfolio Management Problem

Zhengyao Jiang, Dixing Xu|arXiv (Cornell University)|2017. 06. 30.
Blockchain Technology Applications and Security인용 수 229
한 줄 요약

본 논문은 온라인 학습과 명시적 보상을 갖춘 다자산 포트폴리오 관리용 모델 프리 딥 강화 학습 프레임워크(EIIE)를 제시하고, CNN, RNN, LSTM 구현을 활용한 암호화폐 백테스트에서 최상위 성능을 보임을 보인다.

ABSTRACT

Financial portfolio management is the process of constant redistribution of a fund into different financial products. This paper presents a financial-model-free Reinforcement Learning framework to provide a deep machine learning solution to the portfolio management problem. The framework consists of the Ensemble of Identical Independent Evaluators (EIIE) topology, a Portfolio-Vector Memory (PVM), an Online Stochastic Batch Learning (OSBL) scheme, and a fully exploiting and explicit reward function. This framework is realized in three instants in this work with a Convolutional Neural Network (CNN), a basic Recurrent Neural Network (RNN), and a Long Short-Term Memory (LSTM). They are, along with a number of recently reviewed or published portfolio-selection strategies, examined in three back-test experiments with a trading period of 30 minutes in a cryptocurrency market. Cryptocurrencies are electronic and decentralized alternatives to government-issued money, with Bitcoin as the best-known example of a cryptocurrency. All three instances of the framework monopolize the top three positions in all experiments, outdistancing other compared trading algorithms. Although with a high commission rate of 0.25% in the backtests, the framework is able to achieve at least 4-fold returns in 50 days.

연구 동기 및 목표

  • 가격 예측을 피하는 포트폴리오 관리 문제에 대한 모델 프리 RL 솔루션을 제공한다.
  • 거래 비용과 과거 포트폴리오 정보를 학습 프레임워크에 포함시킨다.
  • 다중 자산과 시장 간 온라인 학습을 처리할 수 있는 확장 가능한 아키텍처(EIIE)를 개발한다.
  • 암호화폐 데이터의 백테스트에서 기존 전략과 프레임워크를 비교 평가한다.

제안 방법

  • 에셋 평가에 대한 소프트맥스(softmax)를 통해 포트폴리오 가중치를 산출하는 Ensemble of Identical Independent Evaluators (EIIE) 토폴로지를 제안한다.
  • 거래 비용 인식을 위한 이전 기간 가중치를 저장하는 Portfolio-Vector Memory (PVM)를 도입한다.
  • 사전 거래와 온라인 설정에서 EIIE를 학습하기 위해 Online Stochastic Batch Learning (OSBL)을 사용한다.
  • 그라디언트 상승을 이끌기 위한 명시적 목표 보상을 주기적 로그 수익률의 평균으로 정의한다.
  • EIIE 코어로 CNN, 기본 RNN, LSTM의 세 가지 모델 변형을 실험한다.
  • 12자산 포트폴리오를 위해 거래량 상위 11개의 비현금 자산(현금 포함)을 선발하고, 종가, 최고가, 최저가를 포함하는 가격 텐서 X_t를 통해 입력을 정규화한다.
  • 자산 식별 누출을 피하고 일반화를 보존하기 위해 NAN을 평평한 가격 움직임으로 채워 누락 데이터를 처리한다.

실험 결과

연구 질문

  • RQ1다중 자산 설정에서 EIIE 토폴로지를 갖춘 모델 프리 딥 RL 프레임워크가 전통적인 포트폴리오 전략을 능가할 수 있는가?
  • RQ2거래 잔여 요인 mu_t를 통한 거래 비용 포함이 학습 및 성능에 어떤 영향을 미치는가?
  • RQ3평가자 출력의 소프트맥스를 통한 연속 행동 정책이 포트폴리오 관리에서 이산적 행동에 비해 이점을 제공하는가?
  • RQ4암호화폐와 같은 매우 변동성이 높고 개방적이며 연속적인 시장에 적용되었을 때 프레임워크는 강건한가?

주요 결과

  • EIIE는 세 백테스트 실험에서 상위 3개 포지션을 독점하며 다른 전략들보다 성과가 좋다.
  • 백테스트의 거래 기간이 30분인 경우, 커미션이 0.25%임에도 불구하고 50일 동안 최소 4배의 수익을 달성한다.
  • 세 가지 네트워크 변형(CNN, 기본 RNN, LSTM)을 평가했고 모두 경쟁력이 있으며, 앙상블 프레임워크가 우수한 성능을 제공한다.
  • 선정된 자산과 명시적 거래 비용 모델링으로 암호화폐 거래소(Poloniex)에서 프레임워크를 평가했으며 제안된 RL 설정 하에서 높은 수익성을 보인다.
  • 보상 함수는 명시적이며 주기적 로그 수익률의 평균에 기반하여 EIIE가 시간에 따라 부를 최적화하도록 유도한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.