Skip to main content
QUICK REVIEW

[논문 리뷰] Learning robotic ultrasound scanning using probabilistic temporal ranking.

Michael Burke, Katie Lu|arXiv (Cornell University)|2020. 02. 04.
Reinforcement Learning in Robotics참고 문헌 32인용 수 4
한 줄 요약

이 논문은 인간의 시연에서 연속적인 상태가 점차 보상 가능성 증가를 보인다고 가정하는 확률적 시간 순서 매기기 방법을 제안한다. 최대 엔트로피 역강화 학습과는 달리, 보다 나은 계획에 대해 지수적으로 높은 보상 가능성이라고 가정하지 않으며, 시연의 시간적 진행을 모델링하여 의료 영상 작업에서 열악한 인간 시연에 대해 향상된 성능을 보인다.

ABSTRACT

This paper addresses a common class of problems where a robot learns to perform a discovery task based on example solutions, or human demonstrations. For example consider the problem of ultrasound scanning, where the demonstration requires that an expert adaptively searches for a satisfactory view of internal organs, vessels or tissue and potential anomalies while maintaining optimal contact between the probe and surface tissue. Such problems are currently solved by inferring notional rewards that, when optimised for, result in a plan that mimics demonstrations. A pivotal assumption, that plans with higher reward should be exponentially more likely, leads to the de facto approach for reward inference in robotics. While this approach of maximum entropy inverse reinforcement learning leads to a general and elegant formulation, it struggles to cope with frequently encountered sub-optimal demonstrations. In this paper, we propose an alternative approach to cope with the class of problems where sub-optimal demonstrations occur frequently. We hypothesise that, in tasks which require discovery, successive states of any demonstration are progressively more likely to be associated with a higher reward. We formalise this temporal ranking approach and show that it improves upon maximum-entropy approaches to perform reward inference for autonomous ultrasound scanning, a novel application of learning from demonstration in medical imaging.

연구 동기 및 목표

  • 열악한 인간 시연에서 로봇 초음파 스캔을 학습하는 데 도전 과제를 해결하기 위해.
  • 최대 엔트로피 역강화 학습의 한계를 극복하기 위해, 보다 나은 계획에 대해 지수적으로 더 높은 보상 가능성이라고 가정하는 것.
  • 시연에서 연속적인 상태가 점차 더 높은 보상과 관련이 있을 가능성이 증가하는 시간 순서 매기기 가설을 정식화하기 위해.
  • 특히 시연가 자주 열악한 경우가 있는 의료 영상 작업에서 보상 추론을 향상시키기 위해.
  • 학습 시연의 새로운 적용 분야인 자율 초음파 스캔에서 제안된 방법의 효과성을 입증하기 위해.

제안 방법

  • 이 방법은 시연에서 상태의 시간적 진행을, 각 후속 상태가 점점 더 높은 보상과 관련이 있을 가능성이 높아지는 순서로 모델링한다.
  • 시연 순서에서 상태의 위치에 따라 증가하는 가능성을 할당하는 확률적 순서 매기기 프레임워크를 도입한다.
  • 최대 엔트로피 IRL과 달리 지수적 보상 가능성 가정을 하지 않는 순서 기반 보상 추론 기반 메커니즘을 사용한다.
  • 보상 추론 문제를 시연의 상태 순서에 대한 가능도 함수 최적화 문제로 공식화한다.
  • 로봇이 탐색을 통해 내부 장기의 최적 시각을 발견하도록 학습하는 데 적용된다.
  • 절대 보상 척도가 아닌 상대적 시간 순서에 중점을 두어 최대 엔트로피 IRL에서 흔히 발생하는 열악한 행동에 대한 과적합을 피한다.

실험 결과

연구 질문

  • RQ1확률적 시간 순서 매기기 방법은 열악한 시연이 자주 발생하는 로봇 작업에서 보상 추론을 향상시킬 수 있는가?
  • RQ2시간 순서 매기기 방법은 초음파 스캔에서 불완전한 인간 시연을 학습할 때 최대 엔트로피 역강화 학습보다 어떻게 비교되는가?
  • RQ3시연 상태 간의 점진적 보상 가능성 모델링이 탐색 기반 작업에서 더 나은 정책 모방을 이끌 수 있는가?
  • RQ4제안된 방법은 적응적 스캔이 필요한 의료 영상 적용 분야로 얼마나 일반화되는가?
  • RQ5시간 순서 매기기 방법은 시연 기반 로봇 학습에서 열악한 행동에 대한 과적합을 줄일 수 있는가?

주요 결과

  • 제안된 시간 순서 매기기 방법은 열악한 인간 시연에서 로봇 초음파 스캔을 학습할 때 최대 엔트로피 역강화 학습을 능가한다.
  • 이 방법은 후속 상태일수록 더 높은 보상과 관련이 있을 가능성이 높다는 탐색 작업의 점진적 성격을 성공적으로 포착한다.
  • 지수적 보상 가능성 가정을 피하기 때문에, 인간 시연에서 흔히 존재하는 열악한 행동에 대한 과적합을 줄인다.
  • 이 프레임워크는 최적의 시각을 탐색을 통해 발견해야 하는 의료 영상 작업에서 더 견고하고 적응 가능한 정책 학습을 가능하게 한다.
  • 실험 결과는 시간 순서 매기기 방법이 초음파 작업에서 전문가의 스캔 행동을 더 정확하고 신뢰성 있게 모방하는 데 기여함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.