[논문 리뷰] Addressing reward bias in Adversarial Imitation Learning with neutral reward functions
이 논문은 단일 또는 다중 종료 상태를 가진 작업 기반 환경에서 생존 및 종료 편향을 제거하는 중립적 보상 함수를 제안한다. 기존의 양성 또는 음성 보상 함수를 대체하여 대칭적인 로그 비율 형태를 사용함으로써, 이 방법은 복잡한 종료 동역학을 가진 환경에서 기존의 GAIL 및 DAC 방법들을 능가하는 우수한 모방 성능을 달성한다.
Generative Adversarial Imitation Learning suffers from the fundamental problem of reward bias stemming from the choice of reward functions used in the algorithm. Different types of biases also affect different types of environments - which are broadly divided into survival and task-based environments. We provide a theoretical sketch of why existing reward functions would fail in imitation learning scenarios in task based environments with multiple terminal states. We also propose a new reward function for GAIL which outperforms existing GAIL methods on task based environments with single and multiple terminal states and effectively overcomes both survival and termination bias.
연구 동기 및 목표
- GAIL에서 발생하는 보상 편향, 특히 생존 및 종료 편향을 특정하고 해결함으로써, 작업 기반 환경에서의 모방을 방해하는 요인을 제거하는 것.
- 다중 종료 상태를 가진 환경에서 기존의 보상 함수(양성/음성)가 최적의 정책을 이끌어내지 못하는 이유를 분석하는 것.
- 생존이나 조기 종료에 편향되지 않은 중립적 보상 함수를 제안하여 다양한 작업 기반 환경에서 견고한 모방 성능을 달성하는 것.
- 단일 및 다중 종료 상태를 가진 환경에서 기존의 DAC 및 표준 GAIL 변종과 비교하여 중립적 보상 함수의 우수성을 실증적으로 검증하는 것.
제안 방법
- 판별기의 출력인 $ D(s,a) $를 기반으로 $ R = \log(D(s,a)) - \log(1 - D(s,a)) $로 정의된 새로운 보상 함수를 제안하여 대칭적이고 중립적인 보상 신호를 생성한다.
- 기존의 $ \log(D(s,a)) $ 또는 $ -\log(1 - D(s,a)) $ 형태를 대체하여 GAIL 프레임워크에 이 중립적 보상 함수를 적용함으로써 생존 또는 종료에 대한 편향을 방지한다.
- 정책이 판별기로부터 생성된 중립적 보상 신호를 최대화하도록 최적화하는 온정책 강화학습 알고리즘을 사용한 표준 GAIL 학습 파이프라인을 활용한다.
- 전문가 전이와 전문가 모방 전이를 구분하기 위해 판별기를 학습시키며, GAIL 목적함수를 유지하되 보상 신호를 균형 잡힌 방식으로 유지한다.
- 정책 및 가치 네트워크에 2층의 MLP와 Leaky ReLU 활성화 함수를 사용하며, 결과의 안정성을 확보하기 위해 3개의 랜덤 시드 평균을 취한다.
- 성공률 및 환경 수익을 사용하여, 종료 상태의 구조가 다양한 5개의 MiniGrid 환경에서 성능을 평가한다.
실험 결과
연구 질문
- RQ1GAIL에서 양성 및 음성 보상 함수는 다중 종료 상태를 가진 작업 기반 환경에서 어떻게 생존 및 종료 편향을 유도하는가?
- RQ2DAC와 같은 기존 방법들은 단순한 설정에서는 편향을 해결했지만, 왜 다중 종료 상태를 가진 작업 기반 환경에서는 실패하는가?
- RQ3생존이나 종료에 편향되지 않는 중립적 보상 함수는 복잡한 작업 기반 환경에서 모방 성능 향상에 기여할 수 있는가?
- RQ4제안된 중립적 보상 함수는 단일 및 다중 종료 상태를 가진 환경에서 음성 및 양성 보상 기반 모델과 DAC를 모두 능가하는가?
주요 결과
- 중립적 보상 함수는 Empty 및 DoorKey 환경에서 성공률 1.00 ± 0.00을 기록하여 전문가 성능을 정확히 재현하고 모든 기준 모델을 능가했다.
- GoToDoor 환경에서 중립적 보상 함수는 0.97 ± 0.15의 성공률을 기록했으며, DAC(0.26 ± 0.44) 및 음성 보상(0.38 ± 0.48)을 크게 앞섰다.
- RedBlueDoors 환경에서 중립적 보상 함수는 0.91 ± 0.27의 성공률을 기록했으며, DAC(0.70 ± 0.45) 및 음성 보상(0.00 ± 0.00)을 초월했다.
- DistShift 환경에서 중립적 보상 함수는 0.97 ± 0.15의 성공률을 기록했으며, DAC(0.76 ± 0.42) 및 음성 보상(0.65 ± 0.47)을 앞섰다.
- GAIL에 양성 보상 함수를 적용한 경우, 다중 종료 상태를 가진 환경에서 완전히 실패하여 모든 환경에서 성공률 0.00 ± 0.00을 기록했다.
- 음성 보상 함수는 GoToDoor에서 뿐만 아니라 0.25 ± 0.43의 성공률을 기록하여, 정확한 문에 도달할 확률이 낮은 랜덤한 요소로 인한 강한 종료 편향을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.