Skip to main content
QUICK REVIEW

[논문 리뷰] Aligning Superhuman AI with Human Behavior: Chess as a Model System

Reid McIlroy-Young, Siddhartha Sen|arXiv (Cornell University)|2020. 06. 02.
Sports Analytics and Performance참고 문헌 12인용 수 22
한 줄 요약

이 논문은 초보자부터 고수에 이르기까지 다양한 수준의 체스 루틴을 기반으로 훈련된 맞춤형 알파제로 기반 AI 모델인 마이아(Maia)를 소개한다. 이 모델은 기존 체스 엔진보다 훨씬 높은 정확도로 인간의 수를 예측한다. 다양한 수준의 플레이어로부터의 수 수준 데이터를 기반으로 훈련함으로써 마이아(Maia)는 인간 행동과의 유연한 일치를 가능하게 하며, 개인 및 집단적 실수(블ัน드)를 예측하는 데서 베이스라인을 압도적으로 뛰어넘는 성능을 보이며, 정밀한 행동 모델링을 통한 인간-AI 협업의 길을 제시한다.

ABSTRACT

As artificial intelligence becomes increasingly intelligent---in some cases, achieving superhuman performance---there is growing potential for humans to learn from and collaborate with algorithms. However, the ways in which AI systems approach problems are often different from the ways people do, and thus may be uninterpretable and hard to learn from. A crucial step in bridging this gap between human and artificial intelligence is modeling the granular actions that constitute human behavior, rather than simply matching aggregate human performance. We pursue this goal in a model system with a long history in artificial intelligence: chess. The aggregate performance of a chess player unfolds as they make decisions over the course of a game. The hundreds of millions of games played online by players at every skill level form a rich source of data in which these decisions, and their exact context, are recorded in minute detail. Applying existing chess engines to this data, including an open-source implementation of AlphaZero, we find that they do not predict human moves well. We develop and introduce Maia, a customized version of Alpha-Zero trained on human chess games, that predicts human moves at a much higher accuracy than existing engines, and can achieve maximum accuracy when predicting decisions made by players at a specific skill level in a tuneable way. For a dual task of predicting whether a human will make a large mistake on the next move, we develop a deep neural network that significantly outperforms competitive baselines. Taken together, our results suggest that there is substantial promise in designing artificial intelligence systems with human collaboration in mind by first accurately modeling granular human decision-making.

연구 동기 및 목표

  • 초인적 수준의 AI와 인간의 의사결정 간 격차를 좁히기 위해, 단순한 집합적 성능가 아니라 인간 행동의 세밀한 모델링을 통해 달성하고자 한다.
  • AI 시스템의 성능을 단순히 낮추는 것(예: 계산 자원 감소)이 인간 행동과의 일치를 이끌어내는지, 아니면 더 복잡한 파rametrization이 필요한지 탐구하고자 한다.
  • 특정 실력 수준에서 인간 행동을 정밀하게 일치시킬 수 있도록 조정 가능한 AI 시스템을 개발하여, 더 나은 협업과 교육 지원을 가능하게 하고자 한다.
  • 인간 게임 데이터 기반의 딥러닝을 통해 체스에서 인간의 실수(블ัน드)를 예측함으로써 성능을 향상시키고자 한다.
  • 전문가 수준의 의사결정이 요구되는 분야에서 인간-AI 정밀 일치를 연구하는 데 있어 체스를 모델 시스템으로서 정립하고자 한다.

제안 방법

  • 대규모 인간 체스 게임 데이터셋을 기반으로 알파제로 기반의 딥 강화학습 모델을 미세조정하여, 인간의 수를 고정밀도로 예측할 수 있는 마이아(Maia)를 개발한다.
  • 보드 상태와 메타데이터를 처리하기 위해 잔차 컨볼루션 신경망(CNN) 아키텍처를 사용함으로써 고해상도의 수 예측을 가능하게 한다.
  • 커리큘럼 학습 방식을 적용하여, 조절 가능한 온도 파rameter를 통해 특정 실력 수준에서 인간 행동과 일치하도록 모델의 정책을 조정한다.
  • 다중 작업 학습 프레임워크를 도입하여, 다음 인간 수와 다음 수에서 실수(블ัน드)가 발생할 가능성을 동시에 예측한다.
  • 반복되는 보드 상태를 위치 수준에서 그룹화하여 집단적 실수 예측 모델을 훈련함으로써 노이즈를 감소시키고 일반화 능력을 향상시킨다.
  • 실제 인간 게임 테스트 세트를 사용하여 랜덤 포레스트, 완전 연결 네트워크, 표준 체스 엔진 등 강력한 베이스라인과의 성능을 비교한다.

실험 결과

연구 질문

  • RQ1기존 초인적 수준의 AI 시스템이 인간의 수를 정확히 예측할 수 있는가, 아니면 의사결정 전략에서 근본적으로 다를까?
  • RQ2AI 시스템의 성능을 낮추는 것(예: 계산 자원 감소)이 인간 의사결정 행동과의 일치를 이끌어내는가, 아니면 그 반대가 되는가?
  • RQ3딥러닝 모델을 인간의 수를 고정밀도로 예측할 수 있도록 훈련하면서도 특정 실력 수준에 맞게 파rametrization할 수 있는가?
  • RQ4AI 모델이 인간이 체스에서 큰 실수(블ัน드)를 범할 가능성이 있는지를 어느 정도까지 정확히 예측할 수 있는가?
  • RQ5체스에서 인간 행동의 세밀한 모델링이 기존의 레이팅 체계를 넘어서 새로운 스킬 차원을 드러낼 수 있는가?

주요 결과

  • 보드 상태와 메타데이터를 사용할 때 마이아(Maia)는 개인적 인간 수 예측 정확도가 71.7%에 달하며, 가장 우수한 베이스라인(완전 연결 네트워크 기준 66.0%)을 크게 앞서며 뚜렷한 성능 우위를 보였다.
  • 마이아에서 사용된 잔차 CNN 아키텍처는 수 예측 정확도 71.7%를 달성하여, 인간 행동과의 높은 일치를 달성하기 위해 더 깊고 표현력이 풍부한 모델이 필수적임을 입증했다.
  • 마이아(Maia)는 특정 실력 수준에서 인간 행동과의 일치를 조정할 수 있어, 특정 등급 범위의 플레이어에 대해 최고의 정확도로 수를 예측할 수 있다.
  • 집단적 실수 예측 작업에서 딥 잔차 CNN 모델은 76.9%의 정확도를 기록하여 단순한 모델보다 뛰어난 성능을 보였으며, 그룹화된 데이터가 노이즈를 감소시키고 예측 성능을 향상시킨다는 점을 입증했다.
  • 마이아 모델은 인간이 다음 수에서 큰 실수를 범할 가능성이 있는지를 예측하는 데서도 경쟁적 베이스라인을 크게 앞서며, 인간-AI 협업에서의 오류 탐지 잠재력이 매우 높다는 것을 시사한다.
  • 결과적으로 단순한 AI 성능 저하가 인간 행동과의 일치를 이끌어내지 못하며, 효과적인 인간-AI 일치를 위해서는 인간 데이터 기반의 정밀한 미세조정이 필수적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.