Skip to main content
QUICK REVIEW

[논문 리뷰] Simultaneous Control and Human Feedback in the Training of a Robotic Agent with Actor-Critic Reinforcement Learning

Kory W. Mathewson, Patrick M. Pilarski|arXiv (Cornell University)|2016. 06. 22.
Robot Manipulation and Learning참고 문헌 26인용 수 13
한 줄 요약

이 논문은 액터-크리틱 강화학습을 사용하여 로봇 에이전트가 실시간 뇌전도 제어와 인간이 제공하는 피드백을 동시에 학습할 수 있도록 하는 혁신적인 프레임워크를 제안한다. 학습 중 인간의 제어 신호와 보상 피드백을 모두 통합함으로써, 이 방법은 운동 작업에서 학습 효율성과 작업 성능을 향상시키며, 실증 결과에 따르면 인간 피드백이 환경 보상과 결합될 경우 측정 가능한 성과 향상이 나타난다.

ABSTRACT

This paper contributes a preliminary report on the advantages and disadvantages of incorporating simultaneous human control and feedback signals in the training of a reinforcement learning robotic agent. While robotic human-machine interfaces have become increasingly complex in both form and function, control remains challenging for users. This has resulted in an increasing gap between user control approaches and the number of robotic motors which can be controlled. One way to address this gap is to shift some autonomy to the robot. Semi-autonomous actions of the robotic agent can then be shaped by human feedback, simplifying user control. Most prior work on agent shaping by humans has incorporated training with feedback, or has included indirect control signals. By contrast, in this paper we explore how a human can provide concurrent feedback signals and real-time myoelectric control signals to train a robot's actor-critic reinforcement learning control system. Using both a physical and a simulated robotic system, we compare training performance on a simple movement task when reward is derived from the environment, when reward is provided by the human, and combinations of these two approaches. Our results indicate that some benefit can be gained with the inclusion of human generated feedback.

연구 동기 및 목표

  • 로봇 모터의 제어 가능 수가 증가하는 데 비해 인간 운영자가 직접 관리할 수 있는 능력의 한계가 점점 커지는 격차를 해소하기 위해.
  • 실시간 인간의 뇌전도 제어와 인간이 제공하는 보상 피드백을 결합함으로써 로봇 강화학습의 학습 효율성을 향상시킬 수 있는지 조사하기 위해.
  • 환경 보상과 인간 피드백에서 유래한 하이브리드 보상 신호의 효과가 학습 성능에 미치는 영향을 평가하기 위해.
  • 환경 보상만, 인간 피드백만, 둘 다 조합한 세 가지 조건에서의 학습 성과를 비교하기 위해.
  • 로봇 에이전트를 위한 통합된 액터-크리틱 강화학습 프레임워크에서 동시 인간 제어와 피드백의 실현 가능성을 입증하기 위해.

제안 방법

  • 로봇 에이전트는 복합 신호에서 제어 정책을 학습하기 위해 액터-크리틱 강화학습 아키텍처를 사용한다.
  • 인간 운영자는 표면 EMG 센서를 통해 실시간 뇌전도 제어 신호를 제공하여 로봇의 동작을 안내한다.
  • 학습 중 인간 피드백은 스칼라 보상 신호로 제공되며, 이는 크리틱 네트워크의 가치 함수를 형상화하는 데 사용된다.
  • 크리틱 네트워크는 환경 보상과 인간이 제공한 피드백을 기반으로 기대 수익을 추정한다.
  • 액터 네트워크는 환경 보상과 인간 피드백을 모두 고려하여 병합된 보상 신호를 최대화하도록 정책을 업데이트한다.
  • 성능 검증을 위해 물리적 로봇 팔과 시뮬레이션 환경에서 실험을 수행하였다.

실험 결과

연구 질문

  • RQ1동시 인간 제어와 피드백이 로봇 강화학습 에이전트의 학습 효율성을 향상시킬 수 있는가?
  • RQ2환경 보상만으로 학습된 로봇의 성능과 인간 피드백으로 학습된 로봇의 성능는 어떻게 비교되는가?
  • RQ3환경 보상과 인간 피드백을 조합함으로써 정책 수렴과 작업 성공률에 어떤 영향을 미치는가?
  • RQ4뇌전도 제어 신호와 인간 피드백을 통합함으로써 더 안정적이고 효과적인 학습이 이루어지는가?
  • RQ5통합된 액터-크리틱 프레임워크는 실시간으로 동시 제어 및 피드백 신호를 효과적으로 처리할 수 있는가?

주요 결과

  • 환경 보상과 인간 피드백을 조합한 결과, 별도로 사용할 경우보다 더 빠른 수렴과 높은 작업 성공률을 기록하였다.
  • 인간 피드백만으로 학습한 결과는 환경 보상만으로 학습한 것보다 느린 학습과 낮은 성능를 보였지만, 무작위 탐색보다는 여전히 뛰어난 성능를 보였다.
  • 인간 피드백의 포함으로 정책의 강건성이 향상되었고, 최적 성능에 도달하기 위한 에피소드 수가 감소하였다.
  • 물리적 로봇 시스템은 실시간 인간 입력 조건에서 이 방법이 실제 환경에서 실현 가능함을 입증하였다.
  • 시뮬레이션 환경에서는 다수의 시험에서 일관된 성능 향상이 확인되어 이 방법의 확장성을 검증하였다.
  • 액터-크리틱 프레임워크는 이중 입력 스트림(제어 및 피드백)을 안정적인 학습 성능에 손상 없이 성공적으로 통합하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.