Skip to main content
QUICK REVIEW

[논문 리뷰] A Framework for Empowering Reinforcement Learning Agents with Causal Analysis: Enhancing Automated Cryptocurrency Trading

Rasoul Amirzadeh, Dhananjay Thiruvady|arXiv (Cornell University)|2023. 10. 14.
Blockchain Technology Applications and SecurityComputer Science인용 수 3
한 줄 요약

이 논문은 베이지안 네트워크를 통한 인과적 특성 선택과 동적 베이지안 네트워크로부터 유도된 확률적 가격 신호를 통합하여 자동 암호화폐 거래를 향상시키는 강화학습 프레임워크인 CausalReinforceNet을 제안한다. 이 프레임워크는 변동성이 높은 알트코인 시장에서 의사결정을 개선하며, PPO 및 DDPG 에이전트 모두가 구매 및 보유 전략을 능가하여 바이낸스 코인과 이더리움에서 높은 수익률을 기록하면서도 포지션 규모 제한을 통한 보수적인 리스크 관리 전략을 유지한다.

ABSTRACT

Despite advances in artificial intelligence-enhanced trading methods, developing a profitable automated trading system remains challenging in the rapidly evolving cryptocurrency market. This research focuses on developing a reinforcement learning (RL) framework to tackle the complexities of trading five prominent altcoins: Binance Coin, Ethereum, Litecoin, Ripple, and Tether. To this end, we present the CausalReinforceNet~(CRN) framework, which integrates both Bayesian and dynamic Bayesian network techniques to empower the RL agent in trade decision-making. We develop two agents using the framework based on distinct RL algorithms to analyse performance compared to the Buy-and-Hold benchmark strategy and a baseline RL model. The results indicate that our framework surpasses both models in profitability, highlighting CRN's consistent superiority, although the level of effectiveness varies across different cryptocurrencies.

연구 동기 및 목표

  • 고변동성 암호화폐 시장, 특히 알트코인에 대해 수익성 있고 자동화된 거래 시스템을 개발하는 데 도전하는 것.
  • 베이지안 네트워크를 사용한 인과적 특성 식별을 통합하여 강화학습 에이전트의 상태 표현을 향상시키는 것.
  • 동적 베이지안 네트워크로부터 유도된 확률적 가격 방향 신호를 통합하여 RL 의사결정을 향상시키는 것.
  • 포지션 규모 제한을 통해 노출을 최소화하여 극단적인 시장 변동성에 대비하는 리스크 인식 거래 시스템을 설계하는 것.
  • CausalReinforceNet 프레임워크 내에서 두 가지 다른 RL 알고리즘(PPO 및 DDPG)의 성능을 여러 알트코인에 걸쳐 평가하는 것.

제안 방법

  • CausalReinforceNet은 알트코인의 가격 움직임에 영향을 주는 인과적 특성을 식별하기 위해 베이지안 네트워크를 사용하며, 이는 RL 에이전트의 상태 공간을 구성한다.
  • 동적 베이지안 네트워크는 구매/매도 신호를 생성하여 RL 에이전트의 행동 선택을 안내하며, 이는 시장 신호 해석 능력을 향상시킨다.
  • 이 프레임워크는 RL 에이전트가 거래 행동(매수, 매도, 홀드)과 포지션 규모를 동시에 선택할 수 있도록 하여 리스크 제어를 의사결정 과정에 통합한다.
  • 프록시얼 정책 최적화(PPO)와 딥 디터미니스틱 정책 기반 강화학습(DDPG)을 사용하여 두 에이전트를 훈련시켜 알고리즘 성능을 비교한다.
  • 보수적인 거래 전략은 포지션 규모를 제한하여 변동성 높은 시장에서 초기 자본을 보호한다.
  • 특성 공학은 각 알트코인에 맞게 맞춤화되며, 바이낸스 코인, 이더리움, 리플리코인, 테더 등 서로 다른 시장 행동을 반영한다.
Figure 1 : RL Classic Cycle – The agent-environment interaction cycle is a continuous loop where an agent interacts with its environment in discrete time steps. At each time step, the agent observes the current state of the environment and selects an action based on its policy. After taking action,
Figure 1 : RL Classic Cycle – The agent-environment interaction cycle is a continuous loop where an agent interacts with its environment in discrete time steps. At each time step, the agent observes the current state of the environment and selects an action based on its policy. After taking action,

실험 결과

연구 질문

  • RQ1베이지안 네트워크를 통한 인과적 특성 선택 통합이 자동 암호화폐 거래에서 강화학습 에이전트의 성능을 얼마나 향상시키는가?
  • RQ2동적 베이지안 네트워크 예측이 변동성이 높은 알트코인 시장에서 RL 에이전트의 의사결정 정확도에 얼마나 기여하는가?
  • RQ3CausalReinforceNet 프레임워크 내에서 PPO와 DDPG라는 서로 다른 강화학습 알고리즘이 여러 알트코인에 걸쳐 어떻게 성능을 내는가?
  • RQ4보수적인 포지션 규모 설정이 고변동성 암호화폐 거래에서 리스크를 완화하면서도 수익성을 유지하는 데 어떤 역할을 하는가?
  • RQ5동일한 DBN 예측에도 불구하고 테더에서는 에이전트가 서로 다른 행동을 보이는 이유는 무엇이며, 이는 자산 특화된 시장 역학을 어떻게 드러내는가?

주요 결과

  • PPO 및 DDPG 에이전트 모두가 다섯 종류의 알트코인 전반에서 구매 및 보유 전략을 능가하여, 이 프레임워크가 수익성 있는 거래 전략을 생성하는 데 효과적임을 입증한다.
  • 에이전트들은 바이낸스 코인과 이더리움에서 뚜렷한 수익률을 기록하였으며, 두 알고리즘 모두 평균 ROI가 양수였다.
  • DDPG 에이전트는 높은 DBN 기반 매수 신호가 있음에도 불구하고 보수적인 전략을 취하여 더 많은 홀드 행동을 수행하였으며, 이는 불확실한 조건에서의 경계심을 반영한다.
  • 테더의 경우, DBN 예측에 따르면 가격 하락 가능성이 59.87%였지만 DDPG 에이전트는 53.45%의 매수 행동을 취하여, 이는 이 안정화 코인에 특화된 반대매수 또는 리스크 온 전략임을 시사한다.
  • 리플의 경우, 한 에이전트는 수익을 내고 다른 에이전트는 손실을 기록하여, RL 에이전트가 자산 특화된 동적 요소에 매우 민감하게 반응함을 보여준다.
  • 홀드 행동이 가장 빈번한 전략이었으며, 이는 시장의 불확실성과 명확한 신호 부족으로 인해 에이전트가 많은 기간 동안 거래를 피했다는 것을 의미한다.
Figure 2 : CausalReinforceNet Architecture – The framework comprises four essential elements. The first category encompasses input features containing market data, technical indicators, financial assets, and social media. The second element consists of a BN module, which is responsible for the featu
Figure 2 : CausalReinforceNet Architecture – The framework comprises four essential elements. The first category encompasses input features containing market data, technical indicators, financial assets, and social media. The second element consists of a BN module, which is responsible for the featu

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.