Skip to main content
QUICK REVIEW

[논문 리뷰] Learning under Misspecified Objective Spaces

Andreea Bobu, Andrea Bajcsy|arXiv (Cornell University)|2018. 10. 11.
Explainable Artificial Intelligence (XAI)인용 수 5
한 줄 요약

이 논문은 로봇이 작업 수행 중 물리적 인간 보정의 관련성을 실시간으로 평가할 수 있는 방법을 제안한다. 이는 인간의 의도가 로봇의 가설 공간 외부에 있을 경우 뜻하지 않은 학습을 방지하기 위한 것이다. 보정이 알려진 목표와 일치하는지 평가함으로써, 로봇은 보수적으로 학습한다. 사용자 연구에서 실시간으로 회귀와 뜻하지 않은 업데이트가 감소함을 입증하였고, 관련 보정에 대한 성능는 유지한다.

ABSTRACT

Learning robot objective functions from human input has become increasingly important, but state-of-the-art techniques assume that the human's desired objective lies within the robot's hypothesis space. When this is not true, even methods that keep track of uncertainty over the objective fail because they reason about which hypothesis might be correct, and not whether any of the hypotheses are correct. We focus specifically on learning from physical human corrections during the robot's task execution, where not having a rich enough hypothesis space leads to the robot updating its objective in ways that the person did not actually intend. We observe that such corrections appear irrelevant to the robot, because they are not the best way of achieving any of the candidate objectives. Instead of naively trusting and learning from every human interaction, we propose robots learn conservatively by reasoning in real time about how relevant the human's correction is for the robot's hypothesis space. We test our inference method in an experiment with human interaction data, and demonstrate that this alleviates unintended learning in an in-person user study with a 7DoF robot manipulator.

연구 동기 및 목표

  • 로봇 보상 학습에서 모델의 잘못된 특정화 문제를 해결하기 위해 인간의 선호가 로봇의 사전 정의된 가설 공간 외부에 있을 경우를 다루는 것.
  • 로봇의 목적 공간이 불완전하거나 잘못 설정되어 있을 경우, 물리적 인간 보정으로 인한 뜻하지 않은 학습을 줄이는 것.
  • 로봇이 실시간으로 보정의 관련성을 판단할 수 있도록 하여, 정보적인 상호작용과 관련이 없는 상호작용을 구분하는 것.
  • 로봇이 현재 작업에 대한 이해를 바탕으로 인간의 보정이 합리적인지 판단함으로써 인간-로봇 협업의 정렬을 향상시키는 것.
  • 관련 보정에 대한 성능를 유지하면서도, 관련이 없거나 잘못 해석된 입력에 과도하게 피팅되지 않도록 하는 것.

제안 방법

  • 로봇은 현재의 가설 공간 내에서 인간 보정이 합리적인지 평가하기 위해 베이지안 추론 프레임워크를 사용한다.
  • 관련성 평가를 위해 관측된 상태 변화가 알려진 목표를 통해 더 효율적으로 달성될 수 있는지 점수를 매기며, 최소 노력 원칙에 기반한 합리성 점수를 사용한다.
  • 이 방법은 관련성 점수 $ r \in \{0,1\} $ 를 계산하며, $ r=1 $ 은 보정이 알려진 목표와 일치하여 정보적임을 나타낸다.
  • 로봇은 보정이 관련성이 있다고 판단될 경우에만 목적 함수를 업데이트하며, 어떤 알려진 목표와도 일치하지 않는 행동으로부터 학습을 피한다.
  • 이 관련성 검사를 선형 상태 특성에 대한 보상 함수와 임피던스 제어를 사용한 온라인 실시간 경로 재계획에 통합한다.
  • 이 방법은 인간 상호작용 데이터를 사용한 로봇 액추에이터를 통해 테스트되었으며, 항상 보정에 따라 업데이트하는 기준 대비 성능을 비교하였다.

실험 결과

연구 질문

  • RQ1로봇은 현재의 가설 공간 외부에 있는 물리적 인간 보정이 관련이 없는지 실시간으로 탐지할 수 있는가?
  • RQ2보정의 관련성 기반 보수적 학습이 인간-로봇 상호작용에서 회귀와 뜻하지 않은 학습에 어떤 영향을 미치는가?
  • RQ3기본 방법과 비교하여 이 방법은 관련 보정이 있는 작업에서 성능를 유지하는가?
  • RQ4사용자들은 이 관련성 검사를 적용했을 때 뜻하지 않은 학습이 줄어들었다고 얼마나 잘 인지하는가?
  • RQ5실시간 합리성 평가가 잘못 설정된 목적 공간에서 인간의 의도와 로봇 행동 간의 정렬을 향상시키는 데 얼마나 기여하는가?

주요 결과

  • 관련이 없는 보정이 있는 작업에서, 제안된 방법은 기준 대비 유의미하게 회귀를 감소시켰다 (p = 0.001), 이는 뜻하지 않은 학습 감소를 입증한다.
  • 관련 보정이 있는 작업에서, 제안된 방법과 기준 간에 유의미한 차이가 없었다 (p = 0.9991), 성능 저하가 없음을 보여준다.
  • 학습된 가중치 업데이트($ \hat{\theta} $)의 경로 길이가 제안된 방법에서 유의미하게 짧아져 더 안정적이고 효율적인 학습임을 나타낸다.
  • 참가자들은 제안된 방법이 뜻하지 않은 학습을 줄이는 데 유의미하게 선호되었다 (F(1,7) = 9.15, p = 0.0046), 작업 완료나 이해도에 유의미한 차이가 없었다.
  • 주관적 설문 결과는 사용자들이 로봇이 자신의 의도를 더 잘 이해하고, 이미 올바른 부분에 대해 잘못된 업데이트를 덜 한다고 느꼈다고 확인했다.
  • 이 방법은 인간이 거리 증가를 의도했을 때 로봇이 테이블에 더 가까이 가는 것을 방지하여 심각한 정렬 오류를 피하는 데 성공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.