Skip to main content
QUICK REVIEW

[논문 리뷰] Policy Learning Using Weak Supervision

Jingkang Wang, Hongyi Guo|arXiv (Cornell University)|2020. 10. 05.
Reinforcement Learning in Robotics참고 문헌 60인용 수 6
한 줄 요약

이 논문은 노이즈가 있거나 완벽하지 않은 신호를 동료 에이전트의 출력으로 간주하고, 과적합을 방지하기 위해 '상관된 일치'를 강제하는 방식으로 약한 지도하에 정책 학습을 위한 통합 프레임워크인 PeerPL을 제안한다. 노이즈가 있는 보상에서 강화학습과 약한 시연에서 행동 복제를 수행할 때 최신 기술 수준의 성능을 달성하며, 노이즈 비율이나 청소된 지도에 대한 사전 지식이 필요로 하지 않는다.

ABSTRACT

Most existing policy learning solutions require the learning agents to receive high-quality supervision signals such as well-designed rewards in reinforcement learning (RL) or high-quality expert demonstrations in behavioral cloning (BC). These quality supervisions are usually infeasible or prohibitively expensive to obtain in practice. We aim for a unified framework that leverages the available cheap weak supervisions to perform policy learning efficiently. To handle this problem, we treat the "weak supervision" as imperfect information coming from a peer agent, and evaluate the learning agent's policy based on a "correlated agreement" with the peer agent's policy (instead of simple agreements). Our approach explicitly punishes a policy for overfitting to the weak supervision. In addition to theoretical guarantees, extensive evaluations on tasks including RL with noisy rewards, BC with weak demonstrations, and standard policy co-training show that our method leads to substantial performance improvements, especially when the complexity or the noise of the learning environments is high.

연구 동기 및 목표

  • 고품질의 지도(예: 청소된 보상 또는 전문가 시연)를 확보하기 어렵거나 너무 비싸게 느껴질 때 효과적인 정책을 학습하는 데 도전하는 것.
  • 노이즈 비율이나 오염 수준에 대한 사전 지식이 필요로 하지 않는 약한 지도 하에서 정책 학습을 위한 통합 프레임워크를 개발하는 것.
  • 강화학습과 행동 복제 양 측면에서 노이즈가 있거나 완벽하지 않은 지도 신호에 과적합되는 것을 방지하기 위한 강건성 향상.
  • 지도 신호가 손상되거나 편향되어 있어도, 약한 지도 하에서 정책 복구에 대한 이론적 보장을 제공하는 것.

제안 방법

  • 약한 지도 신호를 동료 에이전트에서 유래된 것으로 간주하여, 완벽하지 않지만 상관관계가 있는 정보 소스로 모델링하는 것.
  • 정책 성능을 단순한 일치가 아닌 동료 에이전트의 행동과의 일치 기반으로 평가하는 '상관된 일치'(CA) 손실을 도입하는 것.
  • 동료 에이전트의 행동에 과적합하는 정책을 명시적으로 페널티 부여하여, 노이즈가 있거나 편향된 신호에 대한 과적합을 줄이는 것.
  • 상관된 일치 손실의 강도를 제어하기 위해 피어 페널티 계수 ξ를 설계하였으며, 분석 결과 최적의 성능는 중간 수준의 값에서 달성됨.
  • 딥 Q 네트워크(DQN)에서의 강화학습과 행동 복제(PeerBC)에 모두 적용 가능한 PeerPL 프레임워크를 적응시켜 에이전트 간의 공동 학습을 가능하게 하는 것.
  • 특히 후반 학습 단계에서 과도한 페널티가 성능 저하를 유도할 수 있으므로, 학습 기간 동안 ξ에 선형 감소 스케줄을 적용하여 수렴 안정성을 향상시키는 것.

실험 결과

연구 질문

  • RQ1노이즈가 있거나 손상된 지도 신호에서, 노이즈 비율에 대한 사전 지식 없이도 정책 학습 프레임워크가 강건한 성능을 달성할 수 있는가?
  • RQ2약한 지도에 대한 단순한 일치보다, 동료 에이전트와의 '상관된 일치'를 강제할 경우 일반화 성능가 어떻게 향상되는가?
  • RQ3피어 페널티 계수 ξ가 강화학습과 행동 복제 환경 모두에서 학습 안정성과 최종 정책 성능에 어떤 영향을 미치는가?
  • RQ4전문가나 보상 함수가 확률적일 경우에도 PeerPL이 약한 시연나 노이즈가 있는 보상에서 고품질의 정책을 효과적으로 복구할 수 있는가?
  • RQ5피어 페널티 계수에 동적 감소 스케줄을 적용하면 학습 수렴과 최종 성능에 어떤 영향을 미치는가?

주요 결과

  • 노이즈가 있는 보상에서 강화학습을 수행할 경우, PeerPL은 표준 DQN 및 행동 복제 기준보다 뚜렷이 뛰어난 성능을 보이며, 특히 높은 노이즈 수준(예: 오류 비율 e=0.4)에서 더 빠른 수렴과 더 높은 최종 수익을 달성한다.
  • 약한 시범 시연에서 행동 복제를 수행할 경우, PeerBC는 표준 BC 및 SQIL보다 여러 환경에서 뛰어난 성능을 보이며, ξ ∈ [0.1, 0.7] 범위에서 최적의 성능를 달성한다.
  • 피어 페널티 계수 ξ에 대해 선형 감소 스케줄(0.4에서 0.1로 감소)을 적용하면 학습이 안정화되고 수렴이 향상되며, CartPole에서 정적 ξ=0.4보다 뛰어난 성능을 보였다.
  • 이 방법은 확률적 전문가 정책에 대해 강건하다: 엔트로피 분석과 행동 확률 분석을 통해, 청소된 전문가 정책이 확률적일지라도 PeerBC가 결정론적 행동을 효과적으로 복구함을 확인하였다.
  • 이론적 분석을 통해, 동료 에이전트의 행동과 노이즈 분포에 대해 약한 조건이 만족될 경우 PeerPL이 최적의 정책을 복구할 수 있음을 확인하였다.
  • 실험 결과, PeerPL은 노이즈가 있는 신호에 대한 과적합을 줄이며, 특히 고복잡도 또는 고노이즈 환경에서 성능 향상이 가장 두드러진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.