Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluation of Human-AI Teams for Learned and Rule-Based Agents in Hanabi

Ho Chit Siu, Jaime Peña|arXiv (Cornell University)|2021. 07. 15.
Ethics and Social Impacts of AI참고 문헌 42인용 수 16
한 줄 요약

이 연구는 규칙 기반(SmartBot) 및 딥 강화학습 기반(Other-Play) 에이전트를 사용하여 한파니에서 인간-AI 협업을 평가한다. 목적 점수에 유의미한 차이가 없음에도 불구하고, 인간은 신뢰성, 해석 가능성, 인식된 협업 정도 측면에서 규칙 기반 에이전트를 일관되게 선호함을 확인하였으며, 이는 공동 작업 AI 시스템에서 목적 성능와 인간 선호도 사이에 중요한 괴리가 있음을 드러낸다.

ABSTRACT

Deep reinforcement learning has generated superhuman AI in competitive games such as Go and StarCraft. Can similar learning techniques create a superior AI teammate for human-machine collaborative games? Will humans prefer AI teammates that improve objective team performance or those that improve subjective metrics of trust? In this study, we perform a single-blind evaluation of teams of humans and AI agents in the cooperative card game Hanabi, with both rule-based and learning-based agents. In addition to the game score, used as an objective metric of the human-AI team performance, we also quantify subjective measures of the human's perceived performance, teamwork, interpretability, trust, and overall preference of AI teammate. We find that humans have a clear preference toward a rule-based AI teammate (SmartBot) over a state-of-the-art learning-based AI teammate (Other-Play) across nearly all subjective metrics, and generally view the learning-based agent negatively, despite no statistical difference in the game score. This result has implications for future AI design and reinforcement learning benchmarking, highlighting the need to incorporate subjective metrics of human-AI teaming rather than a singular focus on objective task performance.

연구 동기 및 목표

  • 딥 강화학습이 협동적이고 정보가 불완전한 게임에서 인간이 선호하는 AI 팀원을 생성할 수 있는지 조사하기 위해
  • 한파니에서 규칙 기반 및 학습된 AI 에이전트 간의 인간-AI 팀 성과와 주관적 인식을 비교하기 위해
  • 팀 점수 측면에서 뛰어난 목적 성능가 인간의 신뢰성, 해석 가능성, 선호도에 영향을 미치는지 평가하기 위해
  • 협동 환경에서 목적 AI 성능와 주관적 인간-AI 팀워크 경험 사이의 격차를 규명하기 위해
  • 순수한 작업 성과보다는 해석 가능성과 인간 중심 지표의 중요성을 강조하여 향후 AI 설계에 정보를 제공하기 위해

제안 방법

  • 26명의 참가자가 참여한 단일 망각 인간-AI 팀워크 실험을 실시하여, 각 참가자는 SmartBot(규칙 기반) 또는 Other-Play(딥 RL 기반) 에이전트와 한파니를 쌍으로 플레이함.
  • 최종 게임 점수 및 힌트 사용 수와 같은 목적 지표와, 신뢰성, 해석 가능성, 인식된 성과, 팀원 선호도 측면의 사후 설문조사를 통해 주관적 지표를 수집함.
  • 학습 효과를 통제하기 위해 각 참가자가 무작위 순서로 두 에이전트 유형 각각과 두 번의 게임을 플레이하는 내부 설계를 적용함.
  • 두 AI 에이전트 간의 게임 점수와 주관적 평가를 비교하기 위해 통계 분석을 적용함.
  • 인식 전략, 예측 가능성, 협업 정도에 대한 패턴을 규명하기 위해 정성적 피드백을 분석함.
  • 카드 플레이, 기각, 힌팅 행동 포함한 한파니 규칙 준수 여부 및 크로스플레이 성능 기반으로 에이전트 평가함.

실험 결과

연구 질문

  • RQ1딥 강화학습 기반 AI 팀원이 규칙 기반 팀원보다 한파니에서 인간 선호도 측면에서 뛰어나게 성과를 내는가?
  • RQ2목적 팀 성과(게임 점수)와 인간의 주관적 인식(신뢰성, 해석 가능성, 협업 정도) 사이에 상관관계가 있는가?
  • RQ3성능이 동일한 상황에서 인간은 규칙 기반 에이전트가 학습된 에이전트보다 더 예측 가능하고 해석 가능하다고 느끼는가?
  • RQ4모르는 파artner와의 크로스플레이를 최적화하기 위해 설계된 학습 기반 에이전트도 인간 팀원에게는 여전히 부정적으로 인식될 수 있는가?
  • RQ5인간 플레이어가 AI 팀원의 일관성과 명확성에 따라 전략을 얼마나 적응적으로 조정하는가?

주요 결과

  • 규칙 기반 에이전트(SmartBot)와 학습 기반 에이전트(Other-Play)를 사용한 팀 간에 게임 점수에 통계적으로 유의미한 차이가 없었으며, 두 에이전트 모두 유사한 평균 점수를 기록함.
  • 참가자들은 인식된 협업 정도, 신뢰성, 해석 가능성, 전체적인 선호도 등 모든 주관적 지표에서 규칙 기반 에이전트를 강력하고 일관되게 선호함.
  • 참가자들은 규칙 기반 에이전트의 기각 및 힌팅 전략이 더 예측 가능하고 인간의 기대와 부합한다고 보고함—이를 비록 이론적으로는 최적화되지 않더라도.
  • 학습 기반 에이전트는 자주 예측 불가능하고 신뢰성 떨어지는 것으로 인식되었으며, 플레이어들은 그 결정 과정을 이해하기 어려워하고 행동을 보완해야 했다고 보고함.
  • 특히 모르는 파artner와의 크로스플레이를 위해 최적화된 학습 기반 에이전트도 규칙 기반 에이전트보다 협업 정신이 떨어지고 직관적이지 않게 평가됨.
  • 정성적 피드백은 참가자들이 규칙 기반 에이전트와 더 조율이 잘 되어 있음을 느꼈으며, 이는 시간이 지남에 따라 더 '인간 友好的'이고 협업이 쉬운 것으로 묘사됨.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.