Skip to main content
QUICK REVIEW

[논문 리뷰] Actor-Critic Reinforcement Learning with Simultaneous Human Control and Feedback

Kory W. Mathewson, Patrick M. Pilarski|arXiv (Cornell University)|2017. 03. 03.
Reinforcement Learning in Robotics참고 문헌 22인용 수 6
한 줄 요약

이 논문은 인간-로봇 상호작용를 위한 액터-크리틱 강화학습에서 동시 인간 제어 및 피드백에 대한 최초의 연구를 제시한다. 일반 상호작용 학습 프레임워크를 도입하여 사용자가 제어와 피드백을 제공하되 제어 품질이 저하되지 않음을 입증하였다. 다만, 두 신호를 동시에 제공할 경우 피드백 빈도는 감소함을 확인하였다.

ABSTRACT

This paper contributes a first study into how different human users deliver simultaneous control and feedback signals during human-robot interaction. As part of this work, we formalize and present a general interactive learning framework for online cooperation between humans and reinforcement learning agents. In many human-machine interaction settings, there is a growing gap between the degrees-of-freedom of complex semi-autonomous systems and the number of human control channels. Simple human control and feedback mechanisms are required to close this gap and allow for better collaboration between humans and machines on complex tasks. To better inform the design of concurrent control and feedback interfaces, we present experimental results from a human-robot collaborative domain wherein the human must simultaneously deliver both control and feedback signals to interactively train an actor-critic reinforcement learning robot. We compare three experimental conditions: 1) human delivered control signals, 2) reward-shaping feedback signals, and 3) simultaneous control and feedback. Our results suggest that subjects provide less feedback when simultaneously delivering feedback and control signals and that control signal quality is not significantly diminished. Our data suggest that subjects may also modify when and how they provide feedback. Through algorithmic development and tuning informed by this study, we expect semi-autonomous actions of robotic agents can be better shaped by human feedback, allowing for seamless collaboration and improved performance in difficult interactive domains.

연구 동기 및 목표

  • 인간-로봇 상호작용 중 인간이 동시에 제어 및 피드백 신호를 어떻게 제공하는지 조사한다.
  • 복잡한 로봇 시스템과 제한된 인간 제어 채널 간 격차를 해소하기 위해 동시 신호 전달을 가능하게 한다.
  • 강화학습 에이전트와의 상호작용 학습을 모델링하고 분석하기 위한 공식적 프레임워크를 개발한다.
  • 동시 제어 및 피드백이 인간-로봇 협업 과제에서 신호 품질, 피드백 빈도, 학습 성능에 미치는 영향을 조사한다.
  • 향후 인간 중심의 적응형 강화학습 시스템 설계를 위한 알고리즘적 설계를 향한 통찰을 제공하며, 피드백 통합 능력 향상과 인간의 다양성에 대한 내성 강화를 도모한다.

제안 방법

  • 도식 2에 도시된 일반 상호작용 학습 프레임워크(GILF)를 제안하여 인간과 에이전트 간의 커뮤니케이션 채널을 정형화한다. 이는 피드백(F), 상태(S), 디스플레이(D) 신호를 포함한다.
  • 사용자가 제공한 제어 신호(마이오 암밴드를 통한)와 보상 조정 피드백(왼손 버튼 누름을 통한)을 사용해 학습된 액터-크리틱 강화학습 에이전트를 구현한다.
  • 모의 나오 로봇 환경에서 사용자가 실시간으로 운동 제어와 보상 조정을 동시에 수행해야 하는 인간-로봇 협업 과제를 설계한다.
  • 주요 과제로 연속 제어 공간과 관절 각도 추적을 사용하며, 피드백을 통해 보상 함수를 조정하여 학습을 이끌어낸다.
  • 13명의 참가자(N=13)를 대상으로 제어 전용, 피드백 전용, 동시 제어 및 피드백 제공 조건의 세 가지 조건에서 사용자 행동을 수집하고 분석한다.
  • 사용자 신호 패tern을 바탕으로 알고리즘 튜닝을 적용하여 학습 효율성 향상과 피드백 변동성에 대한 내성 강화를 도모한다.

실험 결과

연구 질문

  • RQ1동시 제어 및 피드백이 존재할 경우 인간의 피드백 제공 빈도와 시기에는 어떤 영향을 미치는가?
  • RQ2제어 및 피드백을 동시에 제공할 경우 제어 신호 품질이 제어 전용 조건 대비 떨어지는가?
  • RQ3두 신호를 동시에 제공할 때 학습 과정 내내 피드백 패턴은 어떻게 변화하는가?
  • RQ4실시간 인간-로봇 상호작용에서 이중 신호 모odal을 관리할 때 사용자가 겪는 행동적·인지적 트레이드오프는 무엇인가?
  • RQ5복잡한 과제에서 비침습적인 동시 인간 제어 및 피드백 신호를 효과적으로 학습할 수 있는 강화학습 에이전트는 가능한가?

주요 결과

  • 동시 제어 및 피드백을 제공할 경우 참가자들이 피드백 전용 조건 대비 유의미하게 낮은 빈도로 피드백을 제공함을 확인하여 인지 부하 트레이드오프가 존재함을 시사한다.
  • 동시 조건에서도 제어 신호 품질에 유의미한 저하가 없었으며, 이는 사용자가 피드백을 제공하는 동안에도 고정밀 제어를 유지할 수 있음을 의미한다.
  • 참가자들은 로봇이 안정된 상태에 도달한 후에 피드백을 주로 제공함으로써 '먼저 안정성 확보' 전략을 사용하고 있음을 확인하였다.
  • 시간이 지남에 따라 피드백 패턴이 변화하여 초기 안정화 이후 설정값 간 변화에 더 집중함을 확인하였으며, 이는 진화하는 교육 전략을 의미한다.
  • 질적 피드백에서 사용자들은 제어와 피드백 간의 조율이 필요하다고 인식하였으며, 일부는 지시적 또는 반응형 피드백 스타일을 채택하였다.
  • 결과적으로 동시 인간 제어 및 피드백이 상호작용 기반 강화학습에서 실현 가능함을 뒷받침하며, 저대역폭, 고효율성 인간-기계 협업 시스템 설계에 대한 함의를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.