Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Switch Between Machines and Humans.

Vahid Balazadeh Meresht, Abir De|arXiv (Cornell University)|2020. 02. 11.
Reinforcement Learning in Robotics참고 문헌 49인용 수 8
한 줄 요약

이 논문은 두 계층의 마르코프 결정 과정을 사용하여 반자율 시스템에서 인간과 기계 에이전트 간의 제어 전환을 학습하는 강화 학습 알고리즘을 제안한다. 정책과 환경 전이에 대한 상한 신뢰구간을 활용하여 비선형 회귀를 달성하며, 장애물 회피 시뮬레이션에서 일반적인 알고리즘보다 뛰어난 성능을 보인다.

ABSTRACT

Reinforcement learning agents have been mostly developed and evaluated under the assumption that they will operate in a fully autonomous manner -- they will take all actions. In this work, our goal is to develop algorithms that, by learning to switch control between machine and human agents, allow existing reinforcement learning agents to operate under different automation levels. To this end, we first formally define the problem of learning to switch control among agents in a team via a 2-layer Markov decision process. Then, we develop an online learning algorithm that uses upper confidence bounds on the agents' policies and the environment's transition probabilities to find a sequence of switching policies. We prove that the total regret of our algorithm with respect to the optimal switching policy is sublinear in the number of learning steps. Moreover, we also show that our algorithm can be used to find multiple sequences of switching policies across several independent teams of agents operating in similar environments, where it greatly benefits from maintaining shared confidence bounds for the environments' transition probabilities. Simulation experiments in obstacle avoidance in a semi-autonomous driving scenario illustrate our theoretical findings and demonstrate that, by exploiting the specific structure of the problem, our proposed algorithm is superior to problem-agnostic algorithms.

연구 동기 및 목표

  • 실제 세계의 시스템이 인간-기계 협업을 필요로 함에도 불구하고 에이전트가 완전히 자율적이라고 가정하는 강화 학습 분야의 격차를 메운다.
  • 인간과 기계 에이전트 간 최적의 전환 정책을 학습하기 위한 이중 계층 마르코프 결정 과정을 체계적으로 정의한다.
  • 정책과 환경 동역학에 대한 신뢰구간을 사용하여 전환 정책을 온라인으로 적응적으로 업데이트하는 학습 알고리즘을 개발한다.
  • 환경 전이에 대한 공유된 신뢰구간을 통해 여러 개별 에이전트 팀 간의 확장성을 입증한다.
  • 장애물 회피 시나리오에서 반자율 주행 환경을 검증하여, 문제에 무관한 방법보다 우수한 성능을 입증한다.

제안 방법

  • 전환 제어 문제를 두 계층 MDP로 모델링하며, 상위 계층은 전환 정책을 선택하고 하위 계층은 에이전트 행동을 지배한다.
  • 에이전트 정책과 환경 전이 확률에 대한 상한 신뢰구간(UCB)을 사용하여 탐색과 이용의 균형을 이룬다.
  • 여러 개별 팀 간에 공유되는 신뢰구간을 유지하여 샘플 효율성을 향상시키고 계산 오버헤드를 감소시킨다.
  • 관측된 결과와 불확실성 추정치에 기반해 동적으로 전환 정책을 업데이트하는 온라인 학습 알고리즘을 설계한다.
  • 최적의 전환 정책에 대해 이론적으로 비선형 회귀를 증명하여 장기적인 성능 수렴을 보장한다.
  • 장애물 회피 작업에서 도메인 특화 구조적 가정을 통합하여 학습 효율성을 향상시킨다.

실험 결과

연구 질문

  • RQ1강화 학습 에이전트는 반자율 시스템에서 인간과 기계 에이전트 간 제어 전환을 학습하여 성능을 향상시킬 수 있는가?
  • RQ2정책과 환경 전이에 대한 신뢰구간은 어떻게 다이나믹한 전환 시나리오에서 회귀를 최소화하는 데 사용될 수 있는가?
  • RQ3여러 개별 에이전트 팀 간에 신뢰구간을 공유할 경우 학습 효율성과 성능에 어떤 영향을 미치는가?
  • RQ4제안된 알고리즘은 장애물 회피와 같은 구조화된 실세계 과제에서 일반적인 강화 학습 방법보다 뛰어나게 성능을 내는가?
  • RQ5일반적인 알고리즘에 비해 문제의 구조를 활용할 경우 학습 속도와 정확도는 얼마나 향상되는가?

주요 결과

  • 제안된 알고리즘은 최적의 전환 정책에 대해 비선형 회귀를 달성하여 장기적으로 근사 최적의 성능로 수렴함을 나타낸다.
  • 반자율 주행 환경에서 장애물 회피 시뮬레이션에서 문제에 무관한 강화 학습 기반 알고리즘보다 뚜렷한 성능 향상을 보였다.
  • 여러 개별 팀 간에 신뢰구간을 공유함으로써 학습 효율성이 향상되고 전체 회귀가 감소함을 확인했다.
  • 정책과 환경 전이에 대한 구조화된 신뢰구간 사용은 복잡한 과제에서 더 빠른 수렴과 더 나은 의사결정을 가능하게 하였다.
  • 시뮬레이션 결과는 도메인 특화 문제 구조를 활용할 경우 일반적인 RL 접근 방식을 초월해 알고리즘 성능을 향상시킴을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.