Skip to main content
QUICK REVIEW

[논문 리뷰] SAI: a Sensible Artificial Intelligence that plays with handicap and targets high scores in 9x9 Go (extended version)

Francesco Morandin, Gianluca Amato|arXiv (Cornell University)|2019. 05. 26.
Artificial Intelligence in Games참고 문헌 10인용 수 5
한 줄 요약

이 논문은 9×9 고에서 최종 점수를 극대화하는 데 초점을 맞춘 새로운 강화학습 프레임워크인 SAI(Sensible Artificial Intelligence)를 소개한다. 기존 알파고 스타일의 에이전트는 승리 확률을 최대화하는 데 치중되어 있었지만, SAI는 승리 확률을 보너스 점수의 시그모이드 함수로 모델링하고, 중간 위치에서 분기하는 이중가치헤드 신경망을 사용함으로써 초인간적 성능을 달성한다. 이는 점수 기반 수순과 위치 기반 허용수를 효과적으로 구현하고, 심각한 열세에서도 회복 가능하게 하며, 상당한 코미 페널티를 받는 상황에서도 프로 기사들과의 대국에서 승리를 거두는 데 성공했다.

ABSTRACT

We develop a new model that can be applied to any perfect information two-player zero-sum game to target a high score, and thus a perfect play. We integrate this model into the Monte Carlo tree search-policy iteration learning pipeline introduced by Google DeepMind with AlphaGo. Training this model on 9x9 Go produces a superhuman Go player, thus proving that it is stable and robust. We show that this model can be used to effectively play with both positional and score handicap, and to minimize suboptimal moves. We develop a family of agents that can target high scores against any opponent, and recover from very severe disadvantage against weak opponents. To the best of our knowledge, these are the first effective achievements in this direction.

연구 동기 및 목표

  • 완전 정보를 가진 두 명의 플레이어가 참여하는 제로섬 게임에서 승패 결과가 아닌 최종 점수를 극대화하는 강화학습 에이전트를 개발하는 것.
  • 기존 알파고 스타일의 에이전트에서 이진 승패 보상에 기인한 불안정성과 비최적의 말판 전략을 해결하는 것.
  • 모든 실력 수준에서 훈련 및 평가에 효과적으로 적용 가능한 점수 기반 및 위치 기반 허용수를 지원하는 것.
  • 약한 상대와의 대국에서 심각한 열세를 딛고 복귀할 수 있도록 강력한 에이전트를 구현하는 것.
  • 실제 인간 전문가 수준의 대국을 통해 프레임워크의 안정성과 초인간적 강도를 검증하는 것.

제안 방법

  • 목표 점수 차이의 2파rameter 시그모이드 함수로 승리 확률을 모델링하여 최종 점수에 대한 연속적 감독을 가능하게 한다.
  • 알파고 강화학습 파이프라인을 수정하여 신경망의 가치 헤드를 복제해 승리 확률과 기대 점수를 모두 예측하도록 한다.
  • 자기 복제 학습 중 중간 게임 위치에서 분기를 도입함으로써 점수 기반 목표의 학습 안정성을 높인다.
  • 훈련 중 다양한 점수 허용수에 일반화할 수 있는 가역적 가치 함수 가족을 사용한다.
  • 대규모 몬테카를로 트리 검색 시뮬레이션을 활용해 9×9 고에서 두 대표 GPU를 사용해 에이전트를 훈련한다.
  • 자기 복제 및 더 약한 넷과 인간 전문가를 대상으로 한 교차 평가를 통해 성능을 검증하고 모델을 校정한다.

실험 결과

연구 질문

  • RQ1사람의 지식이나 도메인 특화 보상 설계에 의존하지 않고도, 고에서 승리 확률이 아닌 최종 점수를 극대화하는 딥 강화학습 에이전트를 훈련시킬 수 있는가?
  • RQ2에이전트는 점수 기반 허용수와 위치 기반 허용수를 효과적으로 구현하여 다양한 수준의 열세 상황에서도 강력한 성능을 유지할 수 있는가?
  • RQ3약한 상대와의 대국에서 심각한 열세를 딛고 복귀하는 모습을 보이며 전략적 깊이와 점수 인식 능력을 입증하는가?
  • RQ4심지어 상당한 코미 페널티나 허용수를 받는 상황에서도 프로 기사들과의 실전에서 초인간적 성능을 달성할 수 있는가?
  • RQ5제안된 SAI 프레임워크는 다수의 훈련 런과 평가 설정에서 일관된 성능을 보이며 안정성과 일반화 능력을 입증하는가?

주요 결과

  • SAI는 9×9 고에서 초인간적 성능을 달성했으며, 13.5점의 코미 페널티를 받는 상황에서도 전문가 7단 기사와의 대국에서 승리하여 높은 전략적 사고와 점수 인식 능력을 입증했다.
  • 전문가 기사와의 대국에서 SAI는 5판 중 4판을 승리했으며, 코미가 1.5점(백이 항복으로 패배)과 3.5점(백이 항복으로 패배)일 때도 승리를 거두었고, 13.5점의 코미를 받는 블랙으로서 1.5점 차이로 승리한 바 있다.
  • 점수 허용수 상황에서 SAI는 최대 6점의 불리함을 안고도 W1, W2와의 대국에서 70% 이상의 승률을 유지했으며, 8점의 불리함을 안고도 5.6%의 승리를 거두었다.
  • 위치 허용수(H2) 상황에서 SAI는 0.5점의 코미 보너스를 받고 W3(가장 약한 넷)와의 대국에서 16.4%의 승률을 기록했으며, 복잡한 허용수 규칙에 효과적으로 적응함을 보였다.
  • 여러 훈련 런 동안 안정적이고 강건한 학습을 보였으며, 강력한 넷과 약한 넷 모두에서 일관된 校정이 이루어졌고, 성능 지표의 분산이 매우 낮았다.
  • SAI 프레임워크는 심각한 열세 상황에서도 복귀할 수 있도록 하여, 승리한 바 있으며, 이는 전략적 깊이와 점수 목표 설정 능력을 확인시켜 주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.