Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Reinforcement Learning for Haptic Shared Control in Unknown Tasks

Franklin Cardeñoso Fernández, Wouter Caarls|arXiv (Cornell University)|2021. 01. 15.
Teleoperation and Haptic Systems인용 수 4
한 줄 요약

이 논문은 시각 입력에서 작업 의도를 추론하기 위해 딥 강화학습(DDPG)과 컨volution 신경망(CNN, VGG16)을 사용하는 작업에 관계없는 촉각 공유 제어 시스템을 제안한다. 이는 원격 조작에서 개인화되고 적응형 보조 기능을 가능하게 하며, 사용자별 정책을 학습하여 작업 완료 시간과 저항을 동적으로 조정함으로써 감소시킨다.

ABSTRACT

Recent years have shown a growing interest in using haptic shared control (HSC) in teleoperated systems. In HSC, the application of virtual guiding forces decreases the user's control effort and improves execution time in various tasks, presenting a good alternative in comparison with direct teleoperation. HSC, despite demonstrating good performance, opens a new gap: how to design the guiding forces. For this reason, the challenge lies in developing controllers to provide the optimal guiding forces for the tasks that are being performed. This work addresses this challenge by designing a controller based on the deep deterministic policy gradient (DDPG) algorithm to provide the assistance, and a convolutional neural network (CNN) to perform the task detection, called TAHSC (Task Agnostic Haptic Shared Controller). The agent learns to minimize the time it takes the human to execute the desired task, while simultaneously minimizing their resistance to the provided feedback. This resistance thus provides the learning algorithm with information about which direction the human is trying to follow, in this case, the pick-and-place task. Diverse results demonstrate the successful application of the proposed approach by learning custom policies for each user who was asked to test the system. It exhibits stable convergence and aids the user in completing the task with the least amount of time possible.

연구 동기 및 목표

  • 알 수 없거나 동적인 작업에 대해 최적의 안내력 설계의 과제를 해결하기 위해.
  • 사전 정의된 작업 정의 없이도 시각 입력(예: 집기 및 놓기)으로부터 암시적으로 작업 의도를 추론할 수 있도록 하기 위해.
  • 강화학습을 통해 사용자별 정책을 학습하여 개인의 사용자 행동에 적응함으로써 보조 기능을 개인화하기 위해.
  • 작업 수행 성능을 향상시키기 위해 실행 시간과 사용자 촉각 피드백에 대한 저항을 최소화하기 위해.
  • 실시간 원격 조작에서 안정적인 수렴성과 적응성을 유지하면서 사용자 간 일반화가 가능한 시스템을 개발하기 위해.

제안 방법

  • 실시간 원격 조작에서 촉각 보조 기능을 위한 연속 제어 정책을 학습하기 위해 깊이 있는 결정적 정책 기울기(DDPG) 알고리즘을 사용한다.
  • 환경의 시각 입력을 처리하여 작업 맥락을 추론하고 강화학습 정책을 안내하기 위해 컨volution 신경망(VGG16)을 사용한다.
  • 보상 함수는 작업 완료 시간과 사용자 저항을 최소화하도록 설계되었으며, 사용자 행동에 맞게 조정된 임계값 파라미터를 포함한다.
  • DDPG 기반 강화학습 제어기와 비례 원격 조작 제어기를 통합하여 인간-로봇 성능을 최적화할 수 있도록 한다.
  • 사용자 행동과 시각 관측을 상태 입력으로 사용하며, 시뮬레이션 환경에서의 시도-오류 상호작용을 통해 강화학습 에이전트가 학습한다.
  • 사용자 행동이 최적의 보조 전략을 직접 형성하도록, 온-폴리시 상호작용을 통해 정책을 종단 간(end-to-end)으로 훈련한다.

실험 결과

연구 질문

  • RQ1딥 강화학습 에이전트가 작업에 대한 사전 지식 없이 효과적이고 사용자별로 맞춤화된 촉각 보조 정책을 학습할 수 있는가?
  • RQ2알 수 없는 작업이 있는 원격 조작 환경에서 VGG16 기반 CNN이 시각 입력으로부터 작업 의도를 얼마나 잘 추론할 수 있는가?
  • RQ3기본 원격 조작 대비 학습된 정책이 작업 완료 시간과 사용자 저항을 얼마나 줄이는가?
  • RQ4시스템은 다양한 사용자 간에 얼마나 잘 일반화되는가? 사용자별 정밀 조정이 성능 향상에 기여하는가?
  • RQ5한 사용자의 행동 기반으로 설정된 임계값 파라미터가 사용자 의도를 효과적으로 포착할 수 있는가?

주요 결과

  • 시스템은 훈련을 통해 사용자별 정책을 성공적으로 학습하여 작업 완료 시간을 단축시키고 사용자 저항을 감소시켰다.
  • 주제 2는 훈련 후 평균 속도 향상과 힘 감소에서 뚜렷한 향상을 보였으며, 강력한 정책 적응을 확인했다.
  • 주제 1은 낮은 속도와 높은 시간에도 불구하고 일관된 정책 학습을 보였으며, 이는 시스템이 다양한 사용자 행동에 적응할 수 있음을 확인했다.
  • 주제 0는 중간 수준의 성능를 보였으며, 이는 시스템이 사용자 간 일반화 가능하지만 최적의 성능는 사용자별 훈련이 필요함을 확인했다.
  • 모든 주제에서 정책이 안정적으로 수렴하여 실시간 운영에서 높은 신뢰성과 내구성을 입증했다.
  • 시각 입력(VGG16를 통한)을 활용하여 명시적인 작업 정의 없이도 동적 작업 추론이 가능했으며, 이는 작업에 관계없는 운영을 지원했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.