Skip to main content
QUICK REVIEW

[논문 리뷰] Diversifying AI: Towards Creative Chess with AlphaZero

Tom Zahavy, Vivek Veeriah|arXiv (Cornell University)|2023. 08. 17.
Artificial Intelligence in Games인용 수 4
한 줄 요약

이 논문은 압도적인 잠재 조건 아키텍처와 부분 가산 계획법을 사용하는 알파제로 기반 AI 에이전트로 구성된 다양성 있는 팀인 AZ db를 제안한다. 이는 체스에서 창의적 문제 해결 능력을 향상시키기 위한 것이다. 행동의 다양성을 증진하고 잠재적으로 높은 성능을 내는 수를 선택함으로써, AZ db는 단일 에이전트 알파제로보다 두 배로 더 많은 어려운 체스 퍼즐을 해결하며, 펜로즈 포지션을 포함하여 이를 해결하고, 전개 전략에서 50 Elo 향상도 달성하였다. 이는 전용 에이전트 선택을 통해 이루어졌다.

ABSTRACT

In recent years, Artificial Intelligence (AI) systems have surpassed human intelligence in a variety of computational tasks. However, AI systems, like humans, make mistakes, have blind spots, hallucinate, and struggle to generalize to new situations. This work explores whether AI can benefit from creative decision-making mechanisms when pushed to the limits of its computational rationality. In particular, we investigate whether a team of diverse AI systems can outperform a single AI in challenging tasks by generating more ideas as a group and then selecting the best ones. We study this question in the game of chess, the so-called drosophila of AI. We build on AlphaZero (AZ) and extend it to represent a league of agents via a latent-conditioned architecture, which we call AZ_db. We train AZ_db to generate a wider range of ideas using behavioral diversity techniques and select the most promising ones with sub-additive planning. Our experiments suggest that AZ_db plays chess in diverse ways, solves more puzzles as a group and outperforms a more homogeneous team. Notably, AZ_db solves twice as many challenging puzzles as AZ, including the challenging Penrose positions. When playing chess from different openings, we notice that players in AZ_db specialize in different openings, and that selecting a player for each opening using sub-additive planning results in a 50 Elo improvement over AZ. Our findings suggest that diversity bonuses emerge in teams of AI agents, just as they do in teams of humans and that diversity is a valuable asset in solving computationally hard problems.

연구 동기 및 목표

  • 컴퓨터적으로 어려운 과제, 예를 들어 체스에서 다양성이 있는 AI 팀이 단일 AI 에이전트를 능가할 수 있는가를 조사하는 것.
  • 인간의 인지 기반 창의적 의사결정 메커니즘이 AI 성능 향상에 기여할 수 있는가를 탐구하는 것.
  • 강화 학습을 활용하여 체스에서 다양하고 고성능의 수를 생성하고 선택하는 확장 가능한 프레임워크를 개발하는 것.
  • 행동의 다양성과 부분 가산 계획법이 비표준 체스 퍼즐 해결에 미치는 영향을 평가하는 것.
  • AI 팀의 다양성이 인간 팀의 동적 구조와 유사하게 측정 가능한 성능 향상을 이끌어낼 수 있는가를 보여주는 것.

제안 방법

  • 각 에이전트가 고유한 잠재 변수에 따라 조건화되는 잠재 조건 아키텍처를 사용하여, 서로 다른 플레이 스태일과 행동의 다양성을 가능하게 한다.
  • 학습 중에 내재된 다양성 보상 기반으로, 에이전트들이 다양한 전략을 탐색하고 중복된 행동을 피하도록 유도한다.
  • 추론 단계에서 부분 가산 계획법을 적용하여 여러 에이전트 중에서 가장 유망한 수를 선별하며, 그 평가를 조합하여 의사결정 품질을 향상시킨다.
  • 에이전트들은 몬테카를로 트리 서치(MCTS)를 사용한 자기대전 방식으로 학습되며, 사전 정보, 가치 네트워크, 다양성 신호를 활용한다.
  • 이 아키텍처는 동적 매칭 기능을 제공하여, 잠재 표현에 기반해 전략적 다양성을 극대화할 수 있도록 에이전트를 조합할 수 있다.
  • 퍼즐 해결 성능은 펜로즈 및 하세크 포지션을 포함한 커리레이티드 도전 세트를 사용해 평가되며, 분포 외의 추론 능력을 테스트한다.

실험 결과

연구 질문

  • RQ1다양한 AI 에이전트 팀이 복잡한 체스 퍼즐을 해결하는 데서 단일 AI 에이전트를 능가할 수 있는가?
  • RQ2AI 에이전트의 행동 다양성이 분포 외의 포지션에서 일반화 능력과 문제 해결 능력을 향상시키는가?
  • RQ3다양한 에이전트를 조합할 때 부분 가산 계획법이 의사결정 품질을 얼마나 향상시키는가?
  • RQ4다양한 팀 내에서 전문화된 에이전트가 나타날 수 있으며, 개방 유형에 따라 전문화된 에이전트를 선택하면 성능 향상이 이루어지는가?
  • RQ5AI 팀에서의 다양성 보너스는 창의적 또는 비표준 문제 해결에서 관찰되는 인간 팀의 성과와 유사한가?

주요 결과

  • AZ db는 표준 알파제로보다 두 배로 더 많은 어려운 체스 퍼즐을 해결하였으며, 펜로즈 세트의 15개 포지션을 모두 해결하였다.
  • 부분 가산 계획법을 통해 각 전개 유형에 맞는 전용 에이전트를 선택함으로써, AZ db는 알파제로보다 50 Elo 향상된 성과를 달성하였다.
  • AZ db는 명확한 전문화를 보였으며, 매치업 분석을 통해 다양한 전개에서 각기 다른 강점을 갖춘 에이전트들이 형성되었음을 확인하였다.
  • 다양성 보너스는 측정 가능했으며, AZ db는 동종 팀과 단일 에이전트 알파제로보다 퍼즐 해결 벤치마크에서 뛰어난 성능을 보였다.
  • 부분 가산 계획법은 다양한 에이전트의 출력을 효과적으로 조합하여, 개별 에이전트가 단독으로 달성할 수 없었던 더 나은 수 선택을 가능하게 하였다.
  • 분포 외의 퍼즐, 예를 들어 장기적인 예방 수 또는 직관에 어긋나는 기물 기부가 필요한 퍼즐에서의 성능은, 표준 체스 엔진의 능력을 초월한 향상된 추론 능력을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.