Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Behaviors with Uncertain Human Feedback

Xu He, Haipeng Chen|arXiv (Cornell University)|2020. 06. 07.
Advanced Bandit Algorithms Research참고 문헌 18인용 수 8
한 줄 요약

이 논문은 강화학습 중 인간 트레이너의 응답에 존재하는 불확실성을 고려하는 새로운 확률적 인간 피드백 모델을 제안한다. 특히 최적 행동이 모호하거나 보상이 확률적인 상황에서 유용하다. 이는 경사 하강법을 사용해 피드백 모델의 파라미터를 추정하는 근사 EM 알고리즘을 도입하여, 기존의 기준보다 불확실한 환경에서 정책 학습을 크게 향상시킨다. 이는 인간의 피드백이 가정된 모델에서 벗어나더라도 성능을 유지한다.

ABSTRACT

Human feedback is widely used to train agents in many domains. However, previous works rarely consider the uncertainty when humans provide feedback, especially in cases that the optimal actions are not obvious to the trainers. For example, the reward of a sub-optimal action can be stochastic and sometimes exceeds that of the optimal action, which is common in games or real-world. Trainers are likely to provide positive feedback to sub-optimal actions, negative feedback to the optimal actions and even do not provide feedback in some confusing situations. Existing works, which utilize the Expectation Maximization (EM) algorithm and treat the feedback model as hidden parameters, do not consider uncertainties in the learning environment and human feedback. To address this challenge, we introduce a novel feedback model that considers the uncertainty of human feedback. However, this incurs intractable calculus in the EM algorithm. To this end, we propose a novel approximate EM algorithm, in which we approximate the expectation step with the Gradient Descent method. Experimental results in both synthetic scenarios and two real-world scenarios with human participants demonstrate the superior performance of our proposed approach.

연구 동기 및 목표

  • 기존 강화학습 방법이 최적 행동이 모호할 때조차 인간 피드백이 결정론적이라고 가정하는 한계를 해결하기 위해.
  • 실제 세계의 모호성과 반영하기 위해 인간 피드백을 행동 최적성에 따라 확률적 함수로 모델링하기 위해.
  • 정책과 인간 피드백 모델의 파라미터를 동시에 최적화할 수 있는 계산적으로 실현 가능한 학습 알고리즘을 개발하기 위해.
  • 인간 피드백이 가정된 확률적 모델을 엄격히 따르지 않을 경우의 강인성 평가를 위해.

제안 방법

  • 최적 행동으로부터의 행동 거리에 따라 긍정/부정 피드백의 확률이 증가하거나 감소하는 피드백 모델을 제안하며, 이를 가우시안 분포로 모델링한다.
  • 파라미터 추정을 분리하기 위해 일부 파라미터(예: 표준편차)를 고정한 후 경사 하강법을 사용해 최적화하는 근사 EM 알고리즘을 도입한다.
  • 확률적 피드백 모델에서 발생하는 적분이 계산이 불가능한 경우, E단계 근사에서 경사 하강법을 사용해 이를 처리한다.
  • 이중 단계 학습 절차를 사용한다: 먼저 EM을 통해 정책 파라미터를 추정하고, 그 다음 경사 하강법을 통해 피드백 모델 파라미터를 정밀 조정한다.
  • 인간 피드백 모델을 학습 가능한 파라미터를 가진 잠재 변수로 간주하여 정책과 피드백 모델을 동시에 최적화할 수 있도록 한다.
  • 합성 환경과 두 가지 실제 인간-중개 작업(쥐의 사냥 및 가상 개 훈련)에서 방법을 검증한다.

실험 결과

연구 질문

  • RQ1최적 행동이 모호한 확률적 환경에서 인간 피드백의 불확실성을 모델링하면 정책 학습에 어떤 영향을 미치는가?
  • RQ2정확한 추론이 불가능할 경우, 경사 하강법을 사용한 근사 EM 알고리즘이 정책과 인간 피드백 모델의 파라미터를 효과적으로 학습할 수 있는가?
  • RQ3인간 트레이너가 가정된 피드백 모델을 엄격히 따르지 않을 경우, 제안된 방법의 강인성은 어떠한가?
  • RQ4상태 수와 행동 수의 변화가 피드백 모델 파라미터 추정 정확도와 학습 성능에 어떤 영향을 미치는가?
  • RQ5다양한 피드백 조건 하에서 수렴 속도와 최종 정책 품질 측면에서 기존 기준보다 성능이 뛰어나다고 할 수 있는가?

주요 결과

  • 제안된 ABLUF 방법은 합성 및 실제 환경에서 여러 지표(스텝당 캐고된 쥐 수, 최적 정책으로부터의 누적 거리 등)에서 BLUF 및 ISABL 기준보다 뛰어난 성능을 보였다.
  • 쥐의 사냥 작업에서 ABLUF는 행동 수가 증가할수록 기준보다 뛰어난 성능을 보였으며, 이는 더 복잡한 행동 공간을 더 잘 다루고 있음을 시사한다.
  • 가상 개 훈련 작업에서 ABLUF는 기준보다 최적 정책으로부터의 누적 거리를 크게 줄여, 더 빠르고 정확한 정책 학습을 보였다.
  • 간결성 분석 결과, ABLUF는 가정된 모델을 따르지 않는 트레이너의 피드백 상황에서도 강력한 성능을 유지하여 실제 피드백 변동성에 대한 적응성을 입증했다.
  • 대부분의 설정에서 피드백 모델 파라미터 σ를 낮은 분산으로 학습했지만, 매우 짧은 에피소드에서는 수렴이 이루어지지 않아 성능이 제한되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.