Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Log-Optimal Strategy with Reinforcement Learning

Yifeng Guo, Xingyu Fu|arXiv (Cornell University)|2018. 05. 01.
Advanced Bandit Algorithms Research참고 문헌 13인용 수 5
한 줄 요약

이 논문은 복잡한 CDF 추정을 피하기 위해 일반 로그 최적 전략(GLOS)을 이차 테일러 전개를 통해 근사화하는 강건한 로그 최적 전략(RLOS)을 제안한다. 이는 계산 효율성과 강건성을 향상시킨다. 또한 RLOS는 딥 강화학습(RLOSRL)과 통합되어 CSI300 구성주식에서의 여러 백테스트에서 기준 전략을 능가하며, 뛰어난 수익성과 안정성을 보여준다.

ABSTRACT

We proposed a new Portfolio Management method termed as Robust Log-Optimal Strategy (RLOS), which ameliorates the General Log-Optimal Strategy (GLOS) by approximating the traditional objective function with quadratic Taylor expansion. It avoids GLOS's complex CDF estimation process,hence resists the "Butterfly Effect" caused by estimation error. Besides,RLOS retains GLOS's profitability and the optimization problem involved in RLOS is computationally far more practical compared to GLOS. Further, we combine RLOS with Reinforcement Learning (RL) and propose the so-called Robust Log-Optimal Strategy with Reinforcement Learning (RLOSRL), where the RL agent receives the analyzed results from RLOS and observes the trading environment to make comprehensive investment decisions. The RLOSRL's performance is compared to some traditional strategies on several back tests, where we randomly choose a selection of constituent stocks of the CSI300 index as assets under management and the test results validate its profitability and stability.

연구 동기 및 목표

  • 복잡한 CDF 추정으로 인한 일반 로그 최적 전략(GLOS)의 계산 불가능성과 추정 오차에 대한 민감성 문제를 해결하기 위해.
  • 수익성과 장기적 열등성 유지하면서도 계산 효율성과 강건성이 뛰어난 GLOS의 대안을 개발하기 위해.
  • RLOS를 강화학습과 통합하여 시장 피드백에서 학습하는 동적이고 적응적인 포트폴리오 관리 시스템을 구축하기 위해.
  • 기존 전략인 Follow-the-Winner, Follow-the-Loser, Naïve-Average와의 비교를 통해 RLOS 및 RLOSRL의 성능과 안정성을 실증적으로 검증하기 위해.
  • 비정상적인 동적을 보이는 실세계 시장 데이터에 대해 집합 전략의 적용 가능성을 탐색하기 위해.

제안 방법

  • RLOS는 최적 포트폴리오 가중치 근처에서 이차 테일러 전개를 사용하여 GLOS 목적 함수를 근사화함으로써 직접적인 CDF 추정이 필요 없도록 한다.
  • 이 방법은 계산 복잡도를 크게 감소시키고 추정 오차에 대한 민감성을 줄이면서도 핵심적인 로그 최적 수익률 최대화 목표를 유지한다.
  • RLOSRL은 시장 데이터를 처리하기 위해 컨volutional 신경망(CNN)을 갖춘 딥 Q-네트워크를 사용하고, RLOS 출력을 입력으로 받아 거래 결정을 안내하는 보상 기반 강화학습 에이전트를 활용한다.
  • 경험 재생을 사용하여 최근 시장 데이터에 우선순위를 두는 포isson 분포를 활용한 샘플링을 통해 비정상적인 금융 환경에 대한 적응성을 향상시킨다.
  • 정책 네트워크 최적화를 위해 로그 수익률 최대화, 성과 부족에 대한 페널티, L2 정규화(가중치 감쇠)를 조합한 손실 함수를 사용한다.
  • 학습률 감쇠, 모멘터움, 정규화와 같은 하이퍼파ram터는 역사적 CSI300 데이터를 기반으로 한 경험적 검증을 통해 조정된다.

실험 결과

연구 질문

  • RQ1GLOS 목적 함수의 강건한 근사화가 수익성 손실 없이 계산 복잡도와 추정 민감도를 감소시킬 수 있는가?
  • RQ2RLOS를 강화학습과 통합함으로써 동적이고 노이즈가 많은 금융 시장에서 포트폴리오 성능이 어떻게 향상되는가?
  • RQ3RLOSRL은 Follow-the-Winner, Follow-the-Loser, Naïve-Average와 같은 전통적 전략에 비해 자산 증가와 안정성 측면에서 어느 정도 뛰어나게 성과를 내는가?
  • RQ4비정상적인 금융 시계열에 대해 포isson 분포를 활용한 경험 재생이 강화학습 에이전트 성능 향상에 얼마나 효과적인가?
  • RQ5RLOSRL 프레임워크는 다른 자산 클래스나 고주기 거래 환경으로 일반화될 수 있는가?

주요 결과

  • 모든 백테스트(500, 1000, 1500 거래일)에서 RLOS는 Naïve-Average, Follow-the-Winner, Follow-the-Loser를 일관되게 능가했다.
  • 모든 백테스트에서 RLOSRL은 RLOS보다 더 높은 누적 자산을 달성하여 강화학습이 의사결정에 추가 가치를 제공함을 입증했다.
  • 장기적으로 RLOSRL의 성능은 안정적이고 수익성이 있었으며, 시장 역학에 대한 강력한 적응 능력을 보였다.
  • 경험 재생에 포isson 분포 샘플링을 사용함으로써 모델 수렴성과 최근 시장 조건에 대한 반응성이 향상되었다.
  • RLOS와 RL의 통합은 단독 RLOS에 비해 뛰어난 자산 축적을 통해 의사결정 품질 향상이 뚜렷하게 나타났다.
  • 직접적인 CDF 추정을 피함으로써 추정 오차에 대한 강건성이 확보되어 '버터플라이 효과'의 위험도 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.