Skip to main content
QUICK REVIEW

[논문 리뷰] Better Computer Go Player with Neural Network and Long-term Prediction

Yuandong Tian, Yan Zhu|arXiv (Cornell University)|2015. 11. 19.
Artificial Intelligence in Games참고 문헌 14인용 수 14
한 줄 요약

이 논문은 단일 이동 예측을 넘어서 향후 여러 이동을 예측함으로써 성능을 크게 향상시키는 딥 컨volution 네트워크(DCNN) 기반의 가로 플레이어인 Darkforest를 소개한다. 장기 예측을 통해 기울기 신호를 풍부하게 하여, 이 모델은 KGS 가로 서버에서 안정적인 3단 수준을 달성했으며, 몬테카를로 트리 탐색(MCTS)과 조합할 경우 5단 수준에 도달한다. 이는 Zen과 CrazyStone와 같은 최고 수준의 가로 인공지능과 동등한 성능이다.

ABSTRACT

Competing with top human players in the ancient game of Go has been a long-term goal of artificial intelligence. Go's high branching factor makes traditional search techniques ineffective, even on leading-edge hardware, and Go's evaluation function could change drastically with one stone change. Recent works [Maddison et al. (2015); Clark & Storkey (2015)] show that search is not strictly necessary for machine Go players. A pure pattern-matching approach, based on a Deep Convolutional Neural Network (DCNN) that predicts the next move, can perform as well as Monte Carlo Tree Search (MCTS)-based open source Go engines such as Pachi [Baudis & Gailly (2012)] if its search budget is limited. We extend this idea in our bot named darkforest, which relies on a DCNN designed for long-term predictions. Darkforest substantially improves the win rate for pattern-matching approaches against MCTS-based approaches, even with looser search budgets. Against human players, the newest versions, darkfores2, achieve a stable 3d level on KGS Go Server as a ranked bot, a substantial improvement upon the estimated 4k-5k ranks for DCNN reported in Clark & Storkey (2015) based on games against other machine players. Adding MCTS to darkfores2 creates a much stronger player named darkfmcts3: with 5000 rollouts, it beats Pachi with 10k rollouts in all 250 games; with 75k rollouts it achieves a stable 5d level in KGS server, on par with state-of-the-art Go AIs (e.g., Zen, DolBaram, CrazyStone) except for AlphaGo [Silver et al. (2016)]; with 110k rollouts, it won the 3rd place in January KGS Go Tournament.

연구 동기 및 목표

  • 단일 단계 예측을 넘어서 이동 예측을 향상시켜 딥 러닝 기반 가로 에이전트의 성능을 향상시키는 것.
  • 비판적인 국지적 전술적 결정을 다룰 때 순수한 패tern 매칭 접근 방식의 한계를 해결하는 것.
  • DCNN에서의 장기 예측이 MCTS 기반 및 인간 플레이어와의 대결에서 승률을 크게 향상시킬 수 있음을 입증하는 것.
  • DCNN 정책 네트워크를 MCTS와 통합하여 독립형 모델을 능가하는 하이브리드 시스템을 구축하는 것.
  • 실제 환경에서의 모델 강도 평가, KGS의 랭크 게임 및 대회 참가를 포함한다.

제안 방법

  • 현재 기물 배치 상태에서 다음 k개의 이동(k=3)을 예측하도록 딥 컨volution 네트워크(DCNN)를 훈련시키며, 단지 다음 이동만 예측하는 것과는 다름.
  • 19×19 가로 보드를 다중 채널 입력 이미지로 표현하여, 기물 색상, 빌리지, 특수 게임 상태(예: 코, 래더) 등을 인코딩.
  • 장기 전략적 패턴에 집중하기 위해 훈련 효율성과 일반화 능력을 향상시키기 위해 고밀도의 작업 특수 기능 세트를 사용.
  • DCNN 정책을 MCTS 프레임워크(darkfmcts3)에 통합하여, 상위-k개의 예측된 이동을 행동 후보로 사용해 트리 탐색을 유도.
  • 실시간 라이브 플레이에서 동적 코미 및 고민 기능을 적용하고, 초기에는 상위-3개 예측을 사용하여 탐색을 시작하며, 더 넓은 탐색을 위해 상위-5개로 전환.
  • 전문가 수준의 인간 게임 데이터를 기반으로 지도 학습을 수행하며, 다단계 감독을 통해 기울기 신호를 풍부하게 하는 데 중점을 둔다.

실험 결과

연구 질문

  • RQ1다음 이동이 아닌 향후 여러 이동을 예측함으로써 딥 러닝 기반 가로 에이전트의 성능을 향상시킬 수 있는가?
  • RQ2DCNN에서의 장기 예측이 복잡한 전술적 상황에서 일반화 능력과 강력한 플레이 스타일 향상에 기여하는가?
  • RQ3DCNN 정책을 MCTS와 조합할 경우, 기존의 오픈소스 및 상용 가로 엔진과의 대결에서 승률에 어떤 영향을 미치는가?
  • RQ4DCNN 기반 에이전트가 MCTS에 의존하지 않고도 KGS와 같은 공개 서버에서 안정적인 인간 수준 랭크(예: 3단)를 확보할 수 있는가?
  • RQ5특히 국지적 전술 전투에서 MCTS와 결합된 DCNN 기반 에이전트의 잔여 약점은 무엇인가?

주요 결과

  • 검색 기반 없는 DCNN 에이전트인 Darkfores2는 KGS 가로 서버에서 안정적인 3단 수준을 확보했으며, 이는 이전 DCNN 기반 에이전트의 추정 수준인 4단~5단에 비해 상당한 향상이다.
  • 5,000번의 롤아웃을 사용할 경우, 하이브리드 모델인 darkfmcts3는 10,000번의 롤아웃을 사용하는 Pachi와의 250판에서 100% 승리를 거두었으며, 성능 향상이 극명히 드러났다.
  • 75,000번의 롤아웃을 사용할 경우, darkfmcts3는 KGS에서 안정적인 5단 수준에 도달했으며, Zen, DolBaram, CrazyStone와 같은 최첨단 가로 인공지능의 수준과 동등했다.
  • 110,000번의 롤아웃과 64개의 GPU를 사용한 버전은 2016년 1월 KGS 가로 대회에서 3위를 기록했으며, 시간 관리 버그로 인해 유일하게 패배했다.
  • Pachi와의 대결에서 승률은 순수 DCNN일 경우 11.0%에서 100,000번의 롤아웃을 사용할 경우 72.6%로 상승하여 경쟁력이 6배 향상됨을 보였다.
  • 단지 1,000번의 롤아웃을 사용할 경우조차도, DCNN+MCTS 시스템은 순수 DCNN 베이스라인 대비 승률이 19% 이상 높아져 뛰어난 샘플 효율성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.