Skip to main content
QUICK REVIEW

[논문 리뷰] When Blockchain Meets AI: Optimal Mining Strategy Achieved By Machine Learning

Taotao Wang, Soung Chang Liew|arXiv (Cornell University)|2019. 11. 29.
Blockchain Technology Applications and Security참고 문헌 29인용 수 17
한 줄 요약

이 논문은 블록체인 네트워크 파ameters에 대한 사전 지식이 없이도 동적으로 최적의 마이닝 행동을 학습할 수 있는 강화학습(RL) 기반 마이닝 전략을 제안한다. 마이닝 문제를 비선형 마르코프 결정 과정(MDP)으로 공식화하고, 새로운 다차원 강화학습 알고리즘을 설계함으로써, 시간에 따라 변하는 네트워크 조건에서도 근사 최적의 마이닝 보상에 도달할 수 있으며, 파ameters가 동적으로 변화할 경우 모델 기반 전략보다 뛰어난 성능을 보인다.

ABSTRACT

This work applies reinforcement learning (RL) from the AI machine learning field to derive an optimal Bitcoin-like blockchain mining strategy without knowing the details of the blockchain network model. Previously, the most profitable mining strategy was believed to be honest mining encoded in the default blockchain protocol. It was shown later that it is possible to gain more mining rewards by deviating from honest mining. In particular, the mining problem can be formulated as a Markov Decision Process (MDP) which can be solved to give the optimal mining strategy. However, solving the mining MDP requires knowing the values of various parameters that characterize the blockchain network model. In real blockchain networks, these parameter values are not easy to obtain and may change over time. This hinders the use of the MDP model-based solution. In this work, we employ RL to dynamically learn a mining strategy with performance approaching that of the optimal mining strategy by observing and interacting with the network. Since the mining MDP problem has a non-linear objective function (rather than linear functions of standard MDP problems), we design a new multi-dimensional RL algorithm to solve the problem. Experimental results indicate that, without knowing the parameter values of the mining MDP model, our multi-dimensional RL mining algorithm can still achieve the optimal performance over time-varying blockchain networks.

연구 동기 및 목표

  • 마이닝 파워 비율(α)과 네트워크 지연(γ)과 같은 핵심 파라미터가 알려지지 않았거나 시간에 따라 변하는 동적 블록체인 네트워크에서 최적의 마이닝 전략을 도출하는 데 도전하는 것.
  • 블록체인 MDP 파라미터를 완전히 알고 있어야만 최적의 정책을 계산할 수 있는 모델 기반 접근법의 한계를 극복하는 것.
  • 재학습이 필요하거나 정적 모델에 의존하지 않고도 변화하는 네트워크 조건에 적응할 수 있는 학습 기반 마이닝 전략을 개발하는 것.
  • 비선형이고 복잡한 기반 MDP 모델이 존재하더라도 RL이 이론적 최적에 가까운 마이닝 성능을 달성할 수 있음을 보여주는 것.
  • 향후 연구에서 딥 강화학습과 향상된 MDP 모델을 탐색함으로써 실용적이고 적응 가능한 마이닝 시스템의 기반을 마련하는 것.

제안 방법

  • 마이닝 파워, 블록 전파 동역학, 네트워크 지연을 반영한 큰 상태-행동 공간을 가진 비선형 마르코프 결정 과정(MDP)으로 마이닝 문제를 모델링한다.
  • 기존 강화학습 방법이 직접 해결할 수 없는 마이닝 MDP의 비선형 목표 함수를 처리할 수 있도록 새로운 다차원 강화학습 알고리즘을 설계한다.
  • 강화학습 에이전트는 블록체인 환경과의 시도-오류 상호작용을 통해 학습하며, 시간에 따라 누적 마이닝 보상에 기반해 정책을 업데이트한다.
  • 학습 중 탐색과 이용의 균형을 이루기 위해 온도 파rameter $ T_{ ho} $를 사용하는 ε-그리디 탐색 전략을 사용한다.
  • 다양한 $ \rho $, $ \rho $, 및 $ \rho $ 조건을 가진 시뮬레이션 환경을 사용하여 에이전트의 마이닝 수익을 최적 및 사적인 마이닝 벤치마크와 비교해 성능을 평가한다.
  • 정적 및 시간에 따라 변하는 네트워크 파라미터를 포함한 다양한 시나리오에서 검증하여 적응성과 수렴 성능을 평가한다.

실험 결과

연구 질문

  • RQ1강화학습은 마이닝 파워 비율(α)과 네트워크 지연(γ)과 같은 블록체인 네트워크 파라미터에 대한 사전 지식 없이도 최적의 마이닝 전략을 학습할 수 있는가?
  • RQ2네트워크 파라미터가 시간에 따라 변화할 경우, RL 기반 마이닝 전략의 성능은 모델 기반 최적 정책과 어떻게 비교되는가?
  • RQ3RL 에이전트는 실시간으로 변화하는 블록체인 환경에 적응하여 높은 마이닝 보상을 유지할 수 있는가?
  • RQ4탐색 온도 $ T_{ ho} $는 RL 마이닝 정책의 수렴 속도와 최종 성능에 어떤 영향을 미치는가?
  • RQ5다양한 네트워크 조건에서 RL 기반 전략은 사적인 마이닝과 최적 정책 벤치마크에 비해 어떻게 성능을 발휘하는가?

주요 결과

  • RL 기반 마이닝 전략은 기반 블록체인 MDP 파라미터를 알지 못하더라도 근사 최적 수준의 마이닝 수익으로 수렴함을 확인하였다.
  • α와 γ가 시간에 따라 변화하는 환경에서, RL 에이전트는 정적 MDP 모델에서 유도된 고정 최적 정책보다 뛰어난 적응성을 보이며 성능을 뛰어넘었다.
  • α = 0.45일 때, 수렴 그래프(그림 12–14)에서 이론적 최적에 가까운 마이닝 수익을 달성하였다.
  • 다양한 $ T_{ ho} $ 값에서도 강력한 성능 유지를 보였으며, 높은 $ T_{ ho} $에서 더 빠른 수렴이 관찰되어 효과적인 탐색이 이루어졌음을 시사한다.
  • 환경 파라미터가 변화할 경우(예: (0.35,1)에서 (0.35,0.5)로), RL 전략은 적응하여 높은 보상을 유지하는 반면, 사전 계산된 최적 정책은 상당히 성능 저하를 보였다.
  • 이 방법은 강건성과 확장성을 입증하였으며, $ \alpha = 0.35, \gamma = 1 $에 대한 최적 정책은 $ l^{(a)} \leq 8 $ 및 $ l^{(h)} \leq 8 $ 범위에서 표 II에 정리되어 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.