[논문 리뷰] A Framework for Empowering Reinforcement Learning Agents with Causal Analysis: Enhancing Automated Cryptocurrency Trading
이 논문은 베이지안 네트워크를 통한 인과적 특성 선택과 동적 베이지안 네트워크로부터 유도된 확률적 가격 신호를 통합하여 자동 암호화폐 거래를 향상시키는 강화학습 프레임워크인 CausalReinforceNet을 제안한다. 이 프레임워크는 변동성이 높은 알트코인 시장에서 의사결정을 개선하며, PPO 및 DDPG 에이전트 모두가 구매 및 보유 전략을 능가하여 바이낸스 코인과 이더리움에서 높은 수익률을 기록하면서도 포지션 규모 제한을 통한 보수적인 리스크 관리 전략을 유지한다.
Despite advances in artificial intelligence-enhanced trading methods, developing a profitable automated trading system remains challenging in the rapidly evolving cryptocurrency market. This research focuses on developing a reinforcement learning (RL) framework to tackle the complexities of trading five prominent altcoins: Binance Coin, Ethereum, Litecoin, Ripple, and Tether. To this end, we present the CausalReinforceNet~(CRN) framework, which integrates both Bayesian and dynamic Bayesian network techniques to empower the RL agent in trade decision-making. We develop two agents using the framework based on distinct RL algorithms to analyse performance compared to the Buy-and-Hold benchmark strategy and a baseline RL model. The results indicate that our framework surpasses both models in profitability, highlighting CRN's consistent superiority, although the level of effectiveness varies across different cryptocurrencies.
연구 동기 및 목표
- 고변동성 암호화폐 시장, 특히 알트코인에 대해 수익성 있고 자동화된 거래 시스템을 개발하는 데 도전하는 것.
- 베이지안 네트워크를 사용한 인과적 특성 식별을 통합하여 강화학습 에이전트의 상태 표현을 향상시키는 것.
- 동적 베이지안 네트워크로부터 유도된 확률적 가격 방향 신호를 통합하여 RL 의사결정을 향상시키는 것.
- 포지션 규모 제한을 통해 노출을 최소화하여 극단적인 시장 변동성에 대비하는 리스크 인식 거래 시스템을 설계하는 것.
- CausalReinforceNet 프레임워크 내에서 두 가지 다른 RL 알고리즘(PPO 및 DDPG)의 성능을 여러 알트코인에 걸쳐 평가하는 것.
제안 방법
- CausalReinforceNet은 알트코인의 가격 움직임에 영향을 주는 인과적 특성을 식별하기 위해 베이지안 네트워크를 사용하며, 이는 RL 에이전트의 상태 공간을 구성한다.
- 동적 베이지안 네트워크는 구매/매도 신호를 생성하여 RL 에이전트의 행동 선택을 안내하며, 이는 시장 신호 해석 능력을 향상시킨다.
- 이 프레임워크는 RL 에이전트가 거래 행동(매수, 매도, 홀드)과 포지션 규모를 동시에 선택할 수 있도록 하여 리스크 제어를 의사결정 과정에 통합한다.
- 프록시얼 정책 최적화(PPO)와 딥 디터미니스틱 정책 기반 강화학습(DDPG)을 사용하여 두 에이전트를 훈련시켜 알고리즘 성능을 비교한다.
- 보수적인 거래 전략은 포지션 규모를 제한하여 변동성 높은 시장에서 초기 자본을 보호한다.
- 특성 공학은 각 알트코인에 맞게 맞춤화되며, 바이낸스 코인, 이더리움, 리플리코인, 테더 등 서로 다른 시장 행동을 반영한다.

실험 결과
연구 질문
- RQ1베이지안 네트워크를 통한 인과적 특성 선택 통합이 자동 암호화폐 거래에서 강화학습 에이전트의 성능을 얼마나 향상시키는가?
- RQ2동적 베이지안 네트워크 예측이 변동성이 높은 알트코인 시장에서 RL 에이전트의 의사결정 정확도에 얼마나 기여하는가?
- RQ3CausalReinforceNet 프레임워크 내에서 PPO와 DDPG라는 서로 다른 강화학습 알고리즘이 여러 알트코인에 걸쳐 어떻게 성능을 내는가?
- RQ4보수적인 포지션 규모 설정이 고변동성 암호화폐 거래에서 리스크를 완화하면서도 수익성을 유지하는 데 어떤 역할을 하는가?
- RQ5동일한 DBN 예측에도 불구하고 테더에서는 에이전트가 서로 다른 행동을 보이는 이유는 무엇이며, 이는 자산 특화된 시장 역학을 어떻게 드러내는가?
주요 결과
- PPO 및 DDPG 에이전트 모두가 다섯 종류의 알트코인 전반에서 구매 및 보유 전략을 능가하여, 이 프레임워크가 수익성 있는 거래 전략을 생성하는 데 효과적임을 입증한다.
- 에이전트들은 바이낸스 코인과 이더리움에서 뚜렷한 수익률을 기록하였으며, 두 알고리즘 모두 평균 ROI가 양수였다.
- DDPG 에이전트는 높은 DBN 기반 매수 신호가 있음에도 불구하고 보수적인 전략을 취하여 더 많은 홀드 행동을 수행하였으며, 이는 불확실한 조건에서의 경계심을 반영한다.
- 테더의 경우, DBN 예측에 따르면 가격 하락 가능성이 59.87%였지만 DDPG 에이전트는 53.45%의 매수 행동을 취하여, 이는 이 안정화 코인에 특화된 반대매수 또는 리스크 온 전략임을 시사한다.
- 리플의 경우, 한 에이전트는 수익을 내고 다른 에이전트는 손실을 기록하여, RL 에이전트가 자산 특화된 동적 요소에 매우 민감하게 반응함을 보여준다.
- 홀드 행동이 가장 빈번한 전략이었으며, 이는 시장의 불확실성과 명확한 신호 부족으로 인해 에이전트가 많은 기간 동안 거래를 피했다는 것을 의미한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.