Skip to main content
QUICK REVIEW

[논문 리뷰] On the Utility of Model Learning in HRI

Gokul Swamy, Jens Schulz|arXiv (Cornell University)|2019. 01. 04.
Reinforcement Learning in Robotics참고 문헌 28인용 수 11
한 줄 요약

이 논문은 자율 주행 시뮬레이션에서 모델 자유형, 블랙박스 모델 기반형, 그리고 이론적 마음(ToM) 기반 학습을 비교함으로써 인간-로봇 상호작용(HRI)에서 이론적 마음(ToM)의 유용성을 조사한다. 연구 결과, 가정이 올바를 경우 ToM은 표본 복잡도를 크게 감소시키며, 분포 이탈 상황에서도 블랙박스 방법보다 뛰어난 성능을 보이고, 인간 행동의 다양성에 대해 더 잘 일반화되지만, 잘못된 가정이 있을 경우 성능이 저하됨을 확인하였다.

ABSTRACT

Fundamental to robotics is the debate between model-based and model-free learning: should the robot build an explicit model of the world, or learn a policy directly? In the context of HRI, part of the world to be modeled is the human. One option is for the robot to treat the human as a black box and learn a policy for how they act directly. But it can also model the human as an agent, and rely on a "theory of mind" to guide or bias the learning (grey box). We contribute a characterization of the performance of these methods for an autonomous driving task under the optimistic case of having an ideal theory of mind, as well as under different scenarios in which the assumptions behind the robot's theory of mind for the human are wrong, as they inevitably will be in practice.

연구 동기 및 목표

  • 이deal 및 부정확한 가정 조건 하에서 인간-로봇 상호작용(HRI)에서 이론적 마음(ToM)의 성능 우월성을 평가하기 위해.
  • 표본 복잡도와 데이터 효율성 측면에서 모델 자유형, 블랙박스 모델 기반형, ToM 기반 학습을 비교하기 위해.
  • ToM 가정이 인간 행동에 대해 잘못되었을 경우 성능 저하가 어떻게 발생하는지 분석하기 위해.
  • 인간 행동의 분포 이탈 상황에서 ToM 및 블랙박스 모델의 이식 가능성 평가하기 위해.
  • HRI에서 예측 정확도, 계획의 비최적성, 데이터 수집 간의 상호 상충 관계 이해하기 위해.

제안 방법

  • 저자들은 인간 운전자 존재 하에 안전하게 차선을 변경하는 데에 로봇이 학습하는 단순화된 자율 주행 작업을 설계하였다.
  • 세 가지 접근법을 구현: 모델 자유형(직접 정책 학습), 블랙박스 모델 기반형(데이터로부터 인간 정책 학습), ToM 기반형(인간을 보상 최적화 에이전트로 모델링하고 미지의 파rameter를 가짐).
  • ToM는 관찰된 행동으로부터 인간 보상 함수를 추론하기 위해 역강화학습을 사용하여 훈련된다.
  • 로봇는 추론된 인간 모델을 사용하여 인간의 반응을 예측하는 행동을 계획한다.
  • 운전 스타일, 반응 시간, 시야 변화 등 다양한 인간 행동 모델에서 성능을 평가하였다.
  • 실험은 온정책 및 오프정책 데이터를 사용하였으며, 데이터 분포 이탈 및 모델 이식 가능성에 대한 분석도 포함하였다.

실험 결과

연구 질문

  • RQ1완벽한 이론적 마음(ToM) 모델을 사용할 경우, 블랙박스 및 모델 자유형 방법에 비해 HRI에서 성능 향상은 어느 정도인가?
  • RQ2HRI에서 모델 자유형, 블랙박스 모델 기반형, ToM 기반 학습 간의 표본 복잡도는 어떻게 다름가?
  • RQ3인간 행동에 대한 ToM 가정이 잘못되었을 경우 성능은 어떻게 저하되는가?
  • RQ4인간 행동의 분포 이탈 상황에서 ToM 기반 방법이 블랙박스 모델보다 더 잘 일반화되는가?
  • RQ5충분한 데이터가 있음에도 불구하고 블랙박스 모델 기반 학습이 실패하는 조건은 무엇인가?

주요 결과

  • 완벽한 ToM 가정 조건에서, 이 방법은 블랙박스 모델 기반 학습보다 표본 복잡도를 감소시키며, 최소한의 온정책 데이터로도 높은 성능를 달성하였다.
  • 블랙박스 모델 기반 학습은 ToM보다 약 10배 이상 많은 데이터가 필요했고, 데이터 분포가 이탈할 경우 일반화 실패를 보였다.
  • 모델 자유형 학습은 몇 개의 지수 수준 이상 더 많은 데이터가 필요했고, 경쟁 가능한 성능를 달성하지 못했다.
  • 인간 속도, 공격성, 시야 변화 등의 분포 이탈 상황에서 ToM 방법이 블랙박스 모델보다 더 잘 일반화되었다.
  • 잘못된 가정이 있음에도 불구하고, ToM는 그 구조적 인덕티브 바이어스 덕분에 일부 경우 블랙박스 방법보다 뛰어난 성능를 보였지만, 모델 오차가 증가할수록 성능 저하가 발생하였다.
  • 이 연구는 ToM의 우월성이 단지 데이터 효율성에만 국한되지 않으며, 특히 인간-인간 데이터로의 사전 훈련을 병행할 경우 분포 이탈에 대한 강건성 또한 확보됨을 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.