Skip to main content
QUICK REVIEW

[논문 리뷰] A Modularized and Scalable Multi-Agent Reinforcement Learning-based System for Financial Portfolio Management.

Zhenhan Huang, Fumihide Tanaka|arXiv (Cornell University)|2021. 02. 06.
Stock Market Forecasting Methods참고 문헌 13인용 수 4
한 줄 요약

이 논문은 자산별 신호 생성을 위한 이질적인 업데이트를 갖는 진화형 에이전트 모듈(EAMs)과 포트폴리오 재균형을 위한 전략적 에이전트 모듈(SAMs)을 포함하는 모듈형, 확장 가능한 다중 에이전트 강화학습 시스템인 MSPM을 제안한다. MSPM은 8년간의 미국 주식 데이터에서 벤치마크를 초월하며, 확장성 있고 재사용 가능한, 정보가 풍부한 아키텍처와 신주에 대한 전이 학습을 통해 뛰어난 수익 축적 성능을 보여준다.

ABSTRACT

Financial Portfolio Management is one of the most applicable problems in Reinforcement Learning (RL) by its sequential decision-making nature. Existing RL-based approaches, while inspiring, often lack scalability, reusability, or profundity of intake information to accommodate the ever-changing capital markets. In this paper, we design and develop MSPM, a novel Multi-agent Reinforcement learning-based system with a modularized and scalable architecture for portfolio management. MSPM involves two asynchronously updated units: Evolving Agent Module (EAM) and Strategic Agent Module (SAM). A self-sustained EAM produces signal-comprised information for a specific asset using heterogeneous data inputs, and each EAM possesses its reusability to have connections to multiple SAMs. A SAM is responsible for the assets reallocation of a portfolio using profound information from the EAMs connected. With the elaborate architecture and the multi-step condensation of the volatile market information, MSPM aims to provide a customizable, stable, and dedicated solution to portfolio management that existing approaches do not. We also tackle data-shortage issue of newly-listed stocks by transfer learning, and validate the necessity of EAM. Experiments on 8-year U.S. stock markets data prove the effectiveness of MSPM in profits accumulation by its outperformance over existing benchmarks.

연구 동기 및 목표

  • 기존의 RL 기반 포트폴리오 관리 시스템의 확장성 및 재사용성 한계를 해결한다.
  • 모듈형 아키텍처를 통해 포트폴리오 결정에 깊이 있고 이질적인 데이터 통합을 가능하게 한다.
  • 신호 생성과 전략적 할당을 분리함으로써 동적인 자본 시장에 대응하는 안정적이고 커스터마이징 가능한 솔루션을 제공한다.
  • 신주에 대한 데이터 부족 문제를 전이 학습을 통해 완화한다.
  • 진화형 에이전트 모듈(EAM)이 포트폴리오 성능 향상에 기여하는지의 필요성과 효과성을 검증한다.

제안 방법

  • 이상적으로 업데이트되는 두 가지 구성요소인 진화형 에이전트 모듈(EAMs)과 전략적 에이전트 모듈(SAMs)을 갖는 모듈형 아키텍처를 설계한다.
  • 이질적인 데이터 입력을 사용하여 자산별 신호를 생성하는 EAMs를 구현함으로써 여러 SAMs 간의 재사용성을 보장한다.
  • 연결된 EAMs로부터 종합된 고수준 정보를 기반으로 SAMs가 포트폴리오 재균형을 수행한다.
  • 다단계 정보 압축을 적용하여 시장 변동성의 영향을 결정 과정에 최소화한다.
  • 신주에 대한 데이터 부족 문제를 해결하기 위해 EAMs에 전이 학습을 통합한다.
  • 확장 가능하고 분리된 설계를 통해 EAMs와 SAMs의 독립적 훈련 및 구현을 가능하게 한다.

실험 결과

연구 질문

  • RQ1기존의 단일 구조의 RL 접근 방식에 비해, 모듈형 다중 에이전트 RL 아키텍처는 금융 포트폴리오 관리에서 확장성과 재사용성 향상에 기여하는가?
  • RQ2EAM-SAM 분리 설계는 동적인 시장에서 성능 안정성과 정보 깊이를 얼마나 향상시키는가?
  • RQ3EAM 프레임워크 내에서 전이 학습은 신주에 대한 데이터 부족 문제를 얼마나 효과적으로 완화하는가?
  • RQ4제안된 시스템은 장기적인 시장 사이클 동안 누적 수익 축적 측면에서 기존의 RL 기반 벤치마크를 초월하는가?
  • RQ5EAM 모듈은 전체 포트폴리오 성능에 어떤 기여를 하는가? 그리고 그 포함이 반드시 필요한가?

주요 결과

  • MSPM은 8년간의 미국 주식 시장 데이터에서 기존의 벤치마크보다 뛰어난 수익 축적 성능을 달성한다.
  • 모듈형 설계 덕분에 EAMs는 여러 SAMs 간에 재사용 가능해져 시스템의 확장성과 유지보수성 향상에 기여한다.
  • EAMs와 SAMs 간의 이방향 업데이트 메커니즘이 훈련 안정성과 결정의 강건성을 향상시킨다.
  • 전이 학습은 사전 훈련된 EAMs를 활용하여 신주에 대한 성능 저하를 효과적으로 줄인다.
  • 제거 실험 결과, EAMs의 제거로 인해 성능이 심각하게 저하됨을 확인하여 EAMs의 필요성을 입증한다.
  • 변동성이 큰 시장 신호의 다단계 압축이 더 안정적이고 정보 기반의 포트폴리오 재균형에 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.