Skip to main content
QUICK REVIEW

[논문 리뷰] ARSM: Augment-REINFORCE-Swap-Merge Estimator for Gradient Backpropagation Through Categorical Variables

Mingzhang Yin, Yuguang Yue|arXiv (Cornell University)|2019. 05. 04.
Adversarial Robustness in Machine Learning인용 수 17
한 줄 요약

이 논문은 딜리클 분포 하에서 동일한 기울기 기대값을 구성하기 위해 변수 증강, REINFORCE, 라오-블랙웰라이제이션, 그리고 새로운 변수 교환 메커니즘을 결합하여 범주형 변수를 통한 역전파를 위한 편향 없고 분산이 낮은 기울기 추정기인 ARSM을 제안한다. 이 방법은 이러한 기대값 간에 공유되는 난수를 통해 분산을 크게 감소시켜 기존 추정기보다 변분 오토에인드어(VAE)에서 뛰어난 성능을 발휘하며, 이산 강화학습의 이산 행동에 대한 '시도하고 보는 자체비판자(baseline-free) 정책 그래เดียน트 방법'을 제공한다.

ABSTRACT

To address the challenge of backpropagating the gradient through categorical variables, we propose the augment-REINFORCE-swap-merge (ARSM) gradient estimator that is unbiased and has low variance. ARSM first uses variable augmentation, REINFORCE, and Rao-Blackwellization to re-express the gradient as an expectation under the Dirichlet distribution, then uses variable swapping to construct differently expressed but equivalent expectations, and finally shares common random numbers between these expectations to achieve significant variance reduction. Experimental results show ARSM closely resembles the performance of the true gradient for optimization in univariate settings; outperforms existing estimators by a large margin when applied to categorical variational auto-encoders; and provides a "try-and-see self-critic" variance reduction method for discrete-action policy gradient, which removes the need of estimating baselines by generating a random number of pseudo actions and estimating their action-value functions.

연구 동기 및 목표

  • 딥러닝 및 강화학습에서 범주형 변수를 통한 역전파 시 높은 분산을 가지는 기울기 추정 문제를 해결하기 위해.
  • C ≥ 2개의 카테고리를 가진 다변량 범주형 변수에 대해 편향 없고 분산이 낮은 기울기 추정기를 개발하기 위해.
  • 가짜 행동을 통한 롤아웃을 통해 자체비판 메커니즘을 도입하여 이산 행동 정책 그래디언트에서 베이스라인 추정이 필요 없도록 하기 위해.
  • 원래 이진 변수 전용이었던 ARM 추정기를 일반적인 범주형 경우(C ≥ 2)로 일반화하고 확장하기 위해.
  • 이산 잠재변수와 이산 제어 정책을 갖는 모델을 훈련하기 위한 실용적이고 재현 가능한 방법을 제공하기 위해.

제안 방법

  • ARSM 추정기는 변수 증강을 사용하여 기울기를 딜리클 분포 하에서의 기대값으로 재표현한다.
  • 증강된 공간에서 REINFORCE 기울기 추정기를 적용하여 초기 편향 없는 기울기 추정치를 확보한다.
  • 충분통계량에 조건을 두어 라오-블랙웰라이제이션을 적용하여 분산을 감소시킨다.
  • 변수 교환을 통해 딜리클 분포 하에서 동일하지만 다른 방식으로 표현된 여러 기대값을 생성한다.
  • 이러한 교환된 기대값들 간에 공통된 난수를 공유함으로써 추가로 분산을 감소시키는 병합 단계를 수행한다.
  • 최종 추정기는 이러한 공유된 동치 기대값들의 가중 평균으로 계산되어 상당한 분산 감소를 달성한다.

실험 결과

연구 질문

  • RQ1증강 및 분산 감소 기법을 사용하여 C ≥ 2개의 카테고리를 가진 이산 변수에 대해 저분산·편향 없는 기울기 추정기를 구성할 수 있는가?
  • RQ2딜리클 분포 하에서의 변수 교환을 통해 분산 감소에 효과적으로 기여할 수 있는 동치 기대값을 생성할 수 있는가?
  • RQ3가짜 행동을 생성하고 그 가치 함수를 추정함으로써 ARSM이 이산 행동 정책 그래디언트에서 베이스라인 추정이 필요 없도록 할 수 있는가?
  • RQ4ARSM은 범주형 변분 오토에인드어(VAE) 및 이산 강화학습 에이전트에서 기존 추정기와 비교해 어떻게 성능을 냈는가?
  • RQ5ARSM은 단변량 설정에서는 진짜 기울기에 가까운 성능을 달성하고, 다변량 및 복잡한 설정에서는 최첨단 성능을 달성하는가?

주요 결과

  • 단변량 설정에서는 ARSM이 진짜 기울기에 매우 가까이 근사하여 기울기 추정의 높은 정확도를 보였다.
  • 범주형 변분 오토에인드어에서 ARSM은 기존 추정기들과 비교해 최첨단의 훈련 성능과 샘플 외 예측 성능을 달성했다.
  • 이산 강화학습에서 ARSM은 '시도하고 보는 자체비판자' 방법을 제공하여 가짜 행동을 생성하고 평가함으로써 베이스라인 추정이 필요 없도록 했다.
  • 교환된 기대값들 간에 공유된 난수를 통해 기울기 분산을 상당히 감소시켜, 합성 및 실제 작업 모두에서 REINFORCE 및 기타 베이스라인을 능가하는 성능을 발휘했다.
  • C ≥ 2인 경우 ARSM은 반대칭 샘플링만으로는 실현될 수 없으며, 이는 분산 감소에 필수적인 새로운 변수 교환 메커니즘이 필요하다는 것을 의미한다.
  • 제안된 알고리즘은 재현 가능하며, ARSM 기울기 추정기 및 강화학습과 VAE에서의 응용을 위해 GitHub에 공개된 코드를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.