Skip to main content
QUICK REVIEW

[논문 리뷰] Leveling the Playing Field -- Fairness in AI Versus Human Game Benchmarks

Rodrigo Canaan, Christoph Salge|arXiv (Cornell University)|2019. 03. 17.
Ethics and Social Impacts of AI참고 문헌 30인용 수 20
한 줄 요약

이 논문은 게임 벤치마크에서 인간과 AI 간의 완전히 공정한 비교가 존재하지 않는다고 주장한다. 그 이유는 입력/출력 방식, 반응 속도, 표현 추상화 수준의 근본적인 차이 때문이며, 입력, 출력, 행동 공간, 반응 시간이라는 공정성 차원의 분류 체계를 제안한다. 이는 인간-AI 게임 대결을 평가하기 위한 것으로, 진정으로 균형 잡힌 비교는 AI가 인간의 신체적, 정신적, 사회적 맥락을 그대로 모방할 경우에만 가능하다는 결론을 이끌어낸다.

ABSTRACT

From the beginning if the history of AI, there has been interest in games as a platform of research. As the field developed, human-level competence in complex games became a target researchers worked to reach. Only relatively recently has this target been finally met for traditional tabletop games such as Backgammon, Chess and Go. Current research focus has shifted to electronic games, which provide unique challenges. As is often the case with AI research, these results are liable to be exaggerated or misrepresented by either authors or third parties. The extent to which these games benchmark consist of fair competition between human and AI is also a matter of debate. In this work, we review the statements made by authors and third parties in the general media and academic circle about these game benchmark results and discuss factors that can impact the perception of fairness in the contest between humans and machines

연구 동기 및 목표

  • AI가 인간 수준의 지능을 달성했다는 증가하는 주장에 비추어 인간-AI 게임 벤치마크의 공정성에 대해 조사하기 위해.
  • 인간과 AI 에이전트 간의 게임 대결에서 공정성에 영향을 미치는 핵심 차원을 식별하고 분석하기 위해.
  • 게임 벤치마크에서의 성공이 인간 수준의 지능이나 AGI에 해당한다는 서사를 도전하기 위해.
  • 특히 전자 게임에서의 AI-게임 대결에서 공정성 평가를 위한 체계적인 분류 체계를 제공하기 위해.
  • 완전히 공정한 경쟁이 가능하려면 AI가 신체적, 정신적, 사회적 신체성 측면에서 인간과 거의 구분되지 않을 때에만 가능하다고 주장하기 위해.

제안 방법

  • 주요 AI 게임 벤치마크(예: TD-Gammon, AlphaGo, AlphaStar, OpenAI Five)의 언론 및 학술적 묘사를 조사하여 공정성과 인간 수준 성능에 대한 주장 분석하기.
  • 입력, 출력, 행동 공간 표현, 반응 시간을 포함한 다차원 공정성 분류 체계를 제안하여 인간-AI 게임 비교 평가하기.
  • Atari, StarCraft II, Dota 2 등의 구체적 사례를 분석하여 입력/출력 방식과 반응 속도의 차이가 공정성에 어떻게 영향을 미치는지 설명하기.
  • '스티키 액션'과 같은 기술적 방법이나 행동 공간의 추상화(예: 능력 대상 지정, UI 시뮬레이션)를 통해 AI 에이전트의 비인간적 우위를 완화하기.
  • 강화 학습과 자기대칭 학습이 뛰어난 성능을 달성하는 데 기여하는 방식을 평가하면서도 표현의 정확성에 대한 상충 요소를 인정하기.
  • AI 아키텍처의 다양성과 인간 및 기계 능력 간의 완전한 일치가 불가능하기 때문에 게임 벤치마크에서 공정성이 본질적으로 실현 불가능하다고 주장하기.

실험 결과

연구 질문

  • RQ1인간-AI 게임 대결에서의 공정성을 정의하는 차원은 무엇이며, 이는 다양한 게임 유형에 따라 어떻게 달라지나?
  • RQ2게임에서의 AI 성능이 인간 수준의 지능을 평가하는 데 유효한 기준으로 간주될 수 있는가?
  • RQ3왜 인간과 AI 에이전트 간의 완전한 공정한 경쟁이 게임 벤치마크에서 불가능한가?
  • RQ4입력 방식, 행동 표현 방식, 반응 속도의 차이가 AI 게임 결과의 공정성 인식에 어떻게 영향을 미치는가?
  • RQ5'초인간적' AI 능력이 게임에서의 성과가 실제 세계의 AI 도입에 미치는 영향은 무엇이며, 특히 공정성과 윤리적 우려에 대해 어떤 함의를 지니는가?

주요 결과

  • 입력 방식, 반응 속도, 행동 표현의 근본적인 격차로 인해 인간과 AI 사이의 완전한 공정한 게임 벤치마크는 존재하지 않는다.
  • AI 에이전트는 종종 인간이 접근할 수 없는 초단위 반응 속도와 전체 게임 상태 정보에 대한 접근 권한을 통해 불공정한 우위를 점한다.
  • 고수준의 행동 표현(예: 스킬 대상 지정)이나 시뮬레이션된 UI 입력(예: 화면 클릭)의 사용은 인간 게임 플레이는와의 괴리를 유발하는 추상화를 도입한다.
  • 스티키 액션 같은 기법은 비인간적 반응 속도를 줄일 수 있지만, 원래는 환경의 불확실성에 대응하기 위해 개발된 것으로, 공정성의 목적으로는 아니다.
  • 이러한 불균형에도 불구하고 AI 게임 벤치마크는 일반화 능력 향상, 샘플 효율성 향상, 실제 적용 가능성 향상 측면에서 여전히 가치가 있다.
  • 공정성에 대한 인식은 맥락에 매우 의존적이며, 종종 언론과 대중의 서사에 의해 영향을 받는다. 이는 AI 성취를 AGI 향한 돌파구로 과장하는 경향이 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.