Skip to main content
QUICK REVIEW

[논문 리뷰] Assessing Human Interaction in Virtual Reality With Continually Learning Prediction Agents Based on Reinforcement Learning Algorithms: A Pilot Study

Dylan J. A. Brenneis, Adam S. Parker|arXiv (Cornell University)|2021. 12. 14.
Explainable Artificial Intelligence (XAI)인용 수 5
한 줄 요약

이 예비 연구는 가상현실 시간 예측 작업에서 지속적으로 학습하는 강화학습 에이전트와 협업할 때 인간의 신뢰와 상호작용이 어떻게 변화하는지 조사한다. 임계값 기반과 바이닝 기반의 두 에이전트 아키텍처를 비교하여, 초기 상호작용이 인간의 신뢰를 크게 형성하며, 정확도는 낮지만 전략적 행동을 더 많이 유도하는 임계값 기반 에이전트가 더 우수한 결과를 보였다는 점을 발견했다. 이는 대표적 설계가 인간-에이전트 간의 신뢰 역학에 결정적인 영향을 미친다는 것을 시사한다.

ABSTRACT

Artificial intelligence systems increasingly involve continual learning to enable flexibility in general situations that are not encountered during system training. Human interaction with autonomous systems is broadly studied, but research has hitherto under-explored interactions that occur while the system is actively learning, and can noticeably change its behaviour in minutes. In this pilot study, we investigate how the interaction between a human and a continually learning prediction agent develops as the agent develops competency. Additionally, we compare two different agent architectures to assess how representational choices in agent design affect the human-agent interaction. We develop a virtual reality environment and a time-based prediction task wherein learned predictions from a reinforcement learning (RL) algorithm augment human predictions. We assess how a participant's performance and behaviour in this task differs across agent types, using both quantitative and qualitative analyses. Our findings suggest that human trust of the system may be influenced by early interactions with the agent, and that trust in turn affects strategic behaviour, but limitations of the pilot study rule out any conclusive statement. We identify trust as a key feature of interaction to focus on when considering RL-based technologies, and make several recommendations for modification to this study in preparation for a larger-scale investigation. A video summary of this paper can be found at https://youtu.be/oVYJdnBqTwQ .

연구 동기 및 목표

  • 지속적으로 실시간으로 학습하는 강화학습 에이전트와의 인간-에이전트 상호작용이 어떻게 진화하는지 조사하기 위해.
  • 임계값 기반과 바이닝 기반의 두 개별 에이전트 아키텍처가 인간의 신뢰와 전략적 행동에 미치는 영향을 비교하기 위해.
  • 초기 상호작용이 학습 에이전트에 대한 장기적 인간의 신뢰와 협업을 어떻게 형성하는지 탐구하기 위해.
  • 동적이고 실시간 작업 환경에서 인간의 인식과 협업에 영향을 미치는 RL 기반 에이전트의 핵심 설계 요소를 특정하기 위해.

제안 방법

  • 시간 기반 예측 작업을 위한 가상현실 환경을 개발하여 참가자들이 강화학습 에이전트와 협업해 확률적 자극을 예측하도록 하였다.
  • 일반가치함수를 사용하여 두 개의 강화학습 에이전트를 구현: 하나는 임계값 기반 표현을 사용하고, 다른 하나는 바이닝 기반 특성 이산화를 사용하였다.
  • 에이전트를 실시간으로 펄스 자극의 발생을 예측하도록 훈련시켰으며, 인간과의 상호작용 도중 정책을 지속적으로 업데이트하였다.
  • 정량적 성능 지표(예측 정확도, 타이밍)와 정성적 행동 데이터(전략적 전환, 신뢰 지표)를 모두 수집하였다.
  • 시간이 지남에 따라 인간의 행동과 신뢰 변화를 분석하였으며, 특히 초기 상호작용 단계에 집중하였다.
  • 상호작용 역학을 탐색하기 위해 한 명의 전문 참가자를 사용하였으며, 향후 연구를 위한 권고로 나이브 참가자 사용과 직접적 신뢰 측정 방법을 제안하였다.

실험 결과

연구 질문

  • RQ1지속적으로 학습하는 에이전트와의 실시간 상호작용 도중 인간의 신뢰는 어떻게 변화하는가?
  • RQ2에이전트의 표현 설계(임계값 대비 바이닝 기반)는 인간의 전략적 행동과 인식된 신뢰성에 어떤 영향을 미치는가?
  • RQ3학습 에이전트와의 초기 상호작용이 장기적 인간의 신뢰와 협업을 얼마나 깊이 형성하는가?
  • RQ4에이전트의 학습 진행 상황이 인간의 인지적 외주화와 작업 성과에 어떤 영향을 미치는가?
  • RQ5표현 선택이 인간-에이전트 간의 의사소통 및 상호 이해 형성 과정에서 어떤 역할을 하는가?

주요 결과

  • 정확도는 높지만 전략적 행동의 다양성이 적은 바이닝 기반 에이전트(BC)에 비해, 임계값 기반 에이전트(TCT)가 인간의 더 높은 신뢰와 더 다양한 전략적 행동을 유도하였다.
  • 초기 상호작용이 인간의 신뢰 형성에 결정적인 영향을 미쳤으며, 신뢰 수준은 빠르게 형성되어 세션 전반에 걸쳐 유지되었다.
  • TCT 에이전트의 더 빠른 학습과 더 직관적인 신호 전달 방식이 더 강한 인식된 신뢰성으로 이어졌으며, 성능가 다소 열 劣하더라도 그러한 효과가 있었다.
  • BC 에이전트의 더 세밀한 특성 바이닝은 후기 단계에서 더 높은 정확도를 달성했지만, 느린 학습 곡선으로 인해 초기 단계의 신뢰 형성이 저해되었다.
  • 참가자들은 TCT 에이전트와 상호작용하면서 인지적 외주화를 보였으며, 이는 TCT 에이전트가 시간 측정 작업에서 더 신뢰할 만한 파트너로 인식되었음을 시사한다.
  • 본 연구는 성능 차이가 미미할지라도 RL 에이전트의 표현 설계가 인간의 신뢰와 상호작용 품질에 결정적인 영향을 미칠 수 있음을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.