Skip to main content
QUICK REVIEW

[논문 리뷰] Modeling Strong and Human-Like Gameplay with KL-Regularized Search

Athul Paul Jacob, David Wu|arXiv (Cornell University)|2021. 12. 14.
Sports Analytics and Performance인용 수 4
한 줄 요약

이 논문은 체스, 고, 딜로마시, 한라비와 같은 다중 에이전트 게임에서 뛰어난 성능과 인간과 유사한 행동을 균형 있게 이끌어내기 위해 KL-정규화된 검색을 제안한다. 몬테카를로 트리 검색(MCTS)과 위험 최소화(πKL-hedge)에서 인공지능 학습된 정책을 기준으로 하는 KL 발산 정규화를 통합함으로써, 이 방법은 단순한 인공지능 학습보다 뛰어난 인간 예측 정확도와 더 강력한 게임 플레이를 달성한다.

ABSTRACT

We consider the task of building strong but human-like policies in multi-agent decision-making problems, given examples of human behavior. Imitation learning is effective at predicting human actions but may not match the strength of expert humans, while self-play learning and search techniques (e.g. AlphaZero) lead to strong performance but may produce policies that are difficult for humans to understand and coordinate with. We show in chess and Go that regularizing search based on the KL divergence from an imitation-learned policy results in higher human prediction accuracy and stronger performance than imitation learning alone. We then introduce a novel regret minimization algorithm that is regularized based on the KL divergence from an imitation-learned policy, and show that using this algorithm for search in no-press Diplomacy yields a policy that matches the human prediction accuracy of imitation learning while being substantially stronger.

연구 동기 및 목표

  • 다중 에이전트 의사결정에서 강력한 AI 정책과 인간과 유사한 행동 사이의 격차를 해소하기 위해.
  • 복잡한 전략적 게임에서 성능을 희생시키지 않고 인간 예측 정확도를 향상시키기 위해.
  • 인간 중심의 강력한 정책을 위한 인공지능 학습과 검색 기반 계획을 통합하는 통합 프레임워크를 개발하기 위해.
  • 기본 MCTS가 적용되지 않는 불완전 정보 게임에 이 접근법을 확장하기 위해.
  • 인간 협업을 위한 인간이 이해할 수 있고 동시에 뛰어난 능력을 갖춘 AI 에이전트를 가능하게 하기 위해.

제안 방법

  • MCTS에서 검색 정책과 인공지능 학습된 정책 간의 KL 발산을 정규화 항으로 사용하여 검색을 인간과 유사한 행동으로 편향시키는 방식으로, 검색 정책이 인간과 유사한 행동을 취하도록 유도한다.
  • 새로운 위험 최소화 알고리즘인 πKL-hedge에 정규화를 적용하여 인간 모방 정책을 기준으로 하는 KL 페널티를 통합한다.
  • 위험 최소화의 유틸리티 함수를 보상 항과 계수 λ를 가진 KL 發산 페널티 항을 포함하도록 수정한다.
  • 누적된 위험에 기반한 지수 가중치를 정책 업데이트에 적용하며, 정규화된 유틸리티 함수가 정책의 진화를 이끈다.
  • 기준 정책 τ를 사용하여 검색 정책이 인간 행동에 가까이 유지되도록 하되, 同시에 게임 성능 최적화를 위해 노력한다.
  • 완전 정보 게임(체스, 고), 단일 라운드 불완전 정보 게임(프레스 없는 딜로마시), 순차적 게임(한라비) 등 다양한 도메인에 이 방법을 적용한다.

실험 결과

연구 질문

  • RQ1KL-정규화된 검색은 순수한 인공지능 학습 정책보다 뛰어난 성능을 유지하면서도 인간 예측 정확도를 향상시킬 수 있는가?
  • RQ2복잡한 전략적 게임에서 강력하고 인간과 유사한 행동을 취하는 정책을 도출하기 위해 검색 기반 계획을 어떻게 정규화할 수 있는가?
  • RQ3불완전 정보 게임에서 위험 최소화 알고리즘을 인간 모방 정책을 향한 KL 정규화를 포함하도록 어떻게 수정할 수 있는가?
  • RQ4검색에서 KL 정규화가 협력적 또는 혼합 동기 게임 환경에서 인간의 관례와의 일치도를 향상시키는가?
  • RQ5정규화 방향의 선택( KL(π||τ) 대비 KL(τ||π) )이 위험 최소화에서 수렴성과 성능에 어떤 영향을 미치는가?

주요 결과

  • 체스와 고에서, 인공지능 학습된 정책을 사전으로 사용한 MCTS에 KL-정규화된 검색을 적용함으로써, 단순한 인공지능 학습보다 더 높은 인간 예측 정확도를 달성했다.
  • 이 방법은 순수한 인공지능 학습보다 더 강력한 정책을 생성했으며, 체스와 고에서 인간 예측 정확도를 유지하거나 초월했다.
  • 프레스 없는 딜로마시에서는 πKL-hedge가 인공지능 학습과 유사한 인간 예측 정확도를 달성했지만, 이전 에이전트와의 1:1 대결에서 훨씬 뛰어난 성과를 보였다.
  • 위험 최소화 알고리즘 πKL-hedge는 기준 정책과 편차 비용을 고려할 때 균형에 도달함을 증명했으며, 이는 정책이 최적임을 의미한다.
  • 한라비에서는 SPARTA 검색 알고리즘에 KL 정규화를 적용함으로써 인간 예측 정확도가 향상되었고, 기존 인공지능 학습 기반 모델보다 성능이 크게 향상되었다.
  • 이러한 접근은 테스트한 네 도메인 전반에서 순수한 인공지능 학습 기반 모델보다 더 인간과 유사하고 더 강력한 에이전트를 지속적으로 생성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.