Skip to main content
QUICK REVIEW

[논문 리뷰] Trust-Aware Decision Making for Human-Robot Collaboration: Model Learning and Planning

Min Chen, Stefanos Nikolaidis|arXiv (Cornell University)|2018. 01. 12.
Human-Automation Interaction and Safety인용 수 16
한 줄 요약

이 논문은 상호작용 데이터를 바탕으로 학습함으로써 로봇이 협업 과정에서 인간의 신뢰를 추론하고 영향력을 행사할 수 있는 신뢰 인지 POMDP 모델을 제안한다. 전략적으로 신뢰를 조작함으로써(예: 저위험 작업에서 의도적으로 실패함), 로봇은 장기적인 팀 성능을 향상시켜 시뮬레이션 및 실제 테이블 정리 작업에서 단기적 성과나 신뢰 최대화 정책보다 뛰어난 성능을 달성한다.

ABSTRACT

Trust in autonomy is essential for effective human-robot collaboration and user adoption of autonomous systems such as robot assistants. This paper introduces a computational model which integrates trust into robot decision-making. Specifically, we learn from data a partially observable Markov decision process (POMDP) with human trust as a latent variable. The trust-POMDP model provides a principled approach for the robot to (i) infer the trust of a human teammate through interaction, (ii) reason about the effect of its own actions on human trust, and (iii) choose actions that maximize team performance over the long term. We validated the model through human subject experiments on a table-clearing task in simulation (201 participants) and with a real robot (20 participants). In our studies, the robot builds human trust by manipulating low-risk objects first. Interestingly, the robot sometimes fails intentionally in order to modulate human trust and achieve the best team performance. These results show that the trust-POMDP calibrates trust to improve human-robot team performance over the long term. Further, they highlight that maximizing trust alone does not always lead to the best performance.

연구 동기 및 목표

  • 자율 시스템에서 인간의 신뢰가 잘못 조율되어 효과적인 인간-로봇 협업을 방해할 수 있는 문제를 해결하기 위해.
  • 신뢰를 잠재 변수로 통합한 POMDP 프레임워크를 통해 신뢰 모델링과 로봇 의사결정 간의 피드백 루프를 닫기 위해.
  • 상호작용을 통해 인간의 신뢰 수준을 추론하고, 로봇의 실제 능력에 맞게 신뢰를 조정할 수 있도록 로봇이 행동을 적응시킬 수 있도록 하기 위해.
  • 로봇 고장이 발생할 경우에도 신뢰 조정과 작업 효율성의 균형을 유지함으로써 장기적인 팀 성능을 향상시키기 위해.
  • 신뢰 최대화가 항상 최적은 아니며, 전략적 신뢰 조절이 더 나은 종합 성능을 이끌 수 있음을 보여주기 위해.

제안 방법

  • 신뢰-POMDP 모델은 부분관측 가능한 마르코프 결정 과정 내에서 신뢰를 잠재 변수로 표현하여, 로봇이 관측되지 않은 인간의 신뢰 수준을 추론할 수 있도록 한다.
  • 모델은 인간 상호작용 데이터로부터 신뢰 동역학 성분을 학습하여, 로봇 행동에 따라 신뢰가 어떻게 변화하는지를 포착한다.
  • 신뢰 수준과 인간의 간섭 행동(예: 고위험 작업 수행을 중단하도록 요청하는 것) 간의 관계를 연결하기 위해 인간의 의사결정 모델을 학습한다.
  • 로봇은 POMDP 정책을 사용하여 장기적인 팀 성과를 극대화하는 행동을 선택하며, 신뢰 구축과 작업 진행 간의 균형을 유지한다.
  • 고위험 실패 확률이 높은 상황에서는 로봇이 저위험 물체(예: botte)에서 의도적으로 실패함으로써 과신을 줄이고, 고가치 물체(예: 유리잔)에서의 나중 실패를 방지한다.
  • 모델은 시뮬레이션에서 201명의 참가자와 실제 로봇을 사용한 테이블 정리 작업에서 20명의 참가자로부터 수집한 데이터를 바탕으로 훈련 및 검증된다.

실험 결과

연구 질문

  • RQ1신뢰가 직접 관측되지 않을 경우, 로봇이 인간-로봇 협업 과정에서 인간의 신뢰를 체계적으로 추론할 수 있는가?
  • RQ2로봇 행동이 인간의 신뢰 변화에 어떤 영향을 미치는가? 이를 계산적으로 어떻게 모델링할 수 있는가?
  • RQ3로봇이 의도적인 실패를 통해 인간의 신뢰를 전략적으로 조절함으로써 장기적인 팀 성능을 향상시킬 수 있는가?
  • RQ4로봇 고장이 발생할 가능성이 높을 경우, 인간의 신뢰를 최대화하는 것이 항상 작업 성능에 최적인가?
  • RQ5신뢰 인지 정책의 성능는 신뢰를 고려하지 않는 단기적 정책보다 어떻게 비교되는가?

주요 결과

  • 신뢰-POMDP 전략은 단기적 정책보다 인간의 간섭 빈도를 크게 감소시켜 협업과 성능 향상을 나타낸다.
  • 로봇은 먼저 저위험 물체(예: 플라스틱 병)를 처리함으로써 성공적으로 신뢰를 구축했으며, 이는 고위험 행동 중 간섭 빈도를 줄이는 데 기여했다.
  • 와인 글라스에서 고위험 실패 확률이 높은 상황에서는, 신뢰-POMDP 정책이 병에서 의도적으로 실패함으로써 과신을 줄였고, 이로 인해 나중에 고가치 물체에서의 실패를 방지했다.
  • 성과 최적화 정책은 10,000번의 실행 동안 평균 누적 보상 -1.36을 달성했으며, 신뢰 최적화 정책의 -1.65보다 유의미하게 높았다(p < 0.001).
  • 로봇 고장이 발생할 경우, 신뢰 최대화는 최적의 전략이 아니었으며, 고장 발생 시 신뢰가 급격히 하락하여 장기적 성능이 저하되었다.
  • 모델은 과신이나 과소신이 아닌, 적절한 신뢰 조정—즉, 신뢰 보정—이 최적의 인간-로봇 팀 성능을 위해 필수적임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.