Skip to main content
QUICK REVIEW

[논문 리뷰] Learned human-agent decision-making, communication and joint action in a virtual reality environment

Patrick M. Pilarski, Andrew Butcher|arXiv (Cornell University)|2019. 05. 07.
Action Observation and Synchronization인용 수 5
한 줄 요약

이 연구는 인간-에이전트 공동작업을 조사하기 위해 인간 조종사와 AI 코파ilot가 예측 학습과 정책 기반 커뮤니케이션을 통해 상호 적응하는 가상현실 채집 환경을 도입한다. 코파ilot는 맥락 기반 밴디트 정책를 통해 음성 신호를 학습하여 공유 보상 수준을 점차 향상시키며, 결과적으로 야간 채집 성능 향상과 잠재적 협업이 발생하지만, 신호 타이밍과 학습 지연으로 인해 초반 오류가 발생한다.

ABSTRACT

Humans make decisions and act alongside other humans to pursue both short-term and long-term goals. As a result of ongoing progress in areas such as computing science and automation, humans now also interact with non-human agents of varying complexity as part of their day-to-day activities; substantial work is being done to integrate increasingly intelligent machine agents into human work and play. With increases in the cognitive, sensory, and motor capacity of these agents, intelligent machinery for human assistance can now reasonably be considered to engage in joint action with humans---i.e., two or more agents adapting their behaviour and their understanding of each other so as to progress in shared objectives or goals. The mechanisms, conditions, and opportunities for skillful joint action in human-machine partnerships is of great interest to multiple communities. Despite this, human-machine joint action is as yet under-explored, especially in cases where a human and an intelligent machine interact in a persistent way during the course of real-time, daily-life experience. In this work, we contribute a virtual reality environment wherein a human and an agent can adapt their predictions, their actions, and their communication so as to pursue a simple foraging task. In a case study with a single participant, we provide an example of human-agent coordination and decision-making involving prediction learning on the part of the human and the machine agent, and control learning on the part of the machine agent wherein audio communication signals are used to cue its human partner in service of acquiring shared reward. These comparisons suggest the utility of studying human-machine coordination in a virtual reality environment, and identify further research that will expand our understanding of persistent human-machine joint action.

연구 동기 및 목표

  • 자연스럽고 몰입감 있는 VR 환경에서 지속적이고 실시간으로 이루어지는 인간-기계 공동작업을 조사하기 위해.
  • 인간과 학습 에이전트가 예측 학습과 커뮤니케이션을 통해 상호 적응하는 방식을 연구하기 위해.
  • 다양한 AI 코파ilot 아키텍처(파블로프적 신호 제공 vs. 맥락 기반 밴디트 정책 학습)가 인간의 의사결정 및 협업에 미치는 영향을 평가하기 위해.
  • 지속적이고 동적인 상호작용 과정에서 인간-에이전트 파트너십에서 나타나는 잠재적 커뮤니케이션과 기술 이행을 탐색하기 위해.

제안 방법

  • 낮과 밤의 조명 변화를 반복하는 6종의 과일이 포함된 가상현실 채집 작업이 설계되었으며, 실시간으로 인간과 에이전트의 협업이 요구되었다.
  • 인간 조종사는 수동 컨트롤러를 통해 과일을 수확하였고, AI 코파ilot는 익숙해진 가치 예측 기반으로 숙성도를 예측하고 음성 신호를 발화하였다.
  • 코파ilot는 맥락 기반 밴디트 알고리즘을 사용하여 보상 수준 향상에 기여하는 행동을 강화함으로써 확률적 정책을 업데이트하였다.
  • 인간 조종사의 행동은 누적 점수, 신호 반응 타이밍, 그리고 예측 값의 변화($\Delta V(h,s)$)를 통해 추적되었으며, 이는 학습과 가르침 신호를 반영한다.
  • 세 가지 실험 조건을 테스트: 코파ilot 없음(NoCP), 파블로프적 신호 제공(Pav), 정책 학습 코파ilot(Bandit)로, 후자는 적응형 신호 제공을 가능하게 하였다.
  • 코파ilot의 정책은 보상 피드백 기반으로 업데이트되었으며, 신뢰도 할당은 조종사의 행동과 타이밍에 따라 결정되어 실시간 공동작업을 모델링하였다.

실험 결과

연구 질문

  • RQ1AI 코파ilot의 존재가 지속적이고 실시간인 VR 환경에서 인간의 채집 행동에 어떤 영향을 미치는가?
  • RQ2정책 학습 코파ilot는 적응적이고 맥락 민감한 커뮤니케이션을 통해 공유 보상을 향상시킬 수 있는가?
  • RQ3시기와 신뢰도 할당이 효과적인 인간-에이전트 공동작업 및 커뮤니케이션에 어떤 역할을 하는가?
  • RQ4다른 코파ilot 아키텍처(파블로프적 vs. 맥락 기반 밴디트)가 인간의 학습과 협업에 어떤 영향을 미치는가?
  • RQ5공동 작업 과정에서 인간과 에이전트의 예측 및 제어 정책이 상호 학습을 통해 얼마나 깊이 적응하는가?

주요 결과

  • 정책 학습 코파ilot(Bandit)는 야간 조건에서 코파ilot 없음 조건보다 훨씬 더 많은 채집 활동을 유도하여 저조도 환경에 대한 적응이 향상됨을 시사한다.
  • 채집 활동이 증가했음에도 불구하고, 두 코파ilot 조건 모두에서 조종사가 더 많은 실수를 저질렀으며, 특히 야간과 익숙하지 않은 과일 위치에서 두드러져, 신호 해석에 대한 학습 지연이 있음을 시사한다.
  • 부정적 점수 이벤트를 제외한 총 점수 분석 결과, Bandit 코파ilot와의 협업은 양측이 최적의 협업을 학습한 후 더 높은 실질적 성능을 달성할 수 있음을 보여준다.
  • 예측 값 변화($\Delta V(h,s)$)로 측정된 가르침 상호작용은 조종사가 시간이 지남에 따라 코파일롯의 신호에 적응함을 보여주며, 상호 학습이 이루어졌음을 시사한다.
  • Bandit 조건은 파블로프적 접근보다 더 효과적이고 점진적인 신호 제공을 보였으며, 적응형이고 맥락 민감한 커뮤니케이션의 필요성을 뒷받침한다.
  • 시간 지연과 신뢰도 할당은 핵심 요소였다: 신호가 정렬되지 않은 경우 오류가 발생했으며, 이는 인간-에이전트 공동작업에서 정밀한 시간적 일치의 중요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.