Skip to main content
QUICK REVIEW

[논문 리뷰] Credit Assignment Techniques in Stochastic Computation Graphs

Théophane Weber, Nicolas Heess|arXiv (Cornell University)|2019. 01. 07.
Stochastic Gradient Optimization Techniques인용 수 13
한 줄 요약

이 논문은 확률적 계산 그래프(Stochastic Computation Graphs, SCGs)에서 일반적인 신용 할당 도구로 가치 함수, 베이스라인, 크리틱을 도입하여, 부분 모델 평가를 통해 저분산이고 국소적인 기울기 추정기를 가능하게 한다. 강화학습과 확률적 추론 기법을 통합하여 복잡한 모델에서 효율적이고 확장 가능한 최적화를 위한 유연한 프레임워크를 제공한다.

ABSTRACT

Stochastic computation graphs (SCGs) provide a formalism to represent structured optimization problems arising in artificial intelligence, including supervised, unsupervised, and reinforcement learning. Previous work has shown that an unbiased estimator of the gradient of the expected loss of SCGs can be derived from a single principle. However, this estimator often has high variance and requires a full model evaluation per data point, making this algorithm costly in large graphs. In this work, we address these problems by generalizing concepts from the reinforcement learning literature. We introduce the concepts of value functions, baselines and critics for arbitrary SCGs, and show how to use them to derive lower-variance gradient estimates from partial model evaluations, paving the way towards general and efficient credit assignment for gradient-based optimization. In doing so, we demonstrate how our results unify recent advances in the probabilistic inference and reinforcement learning literature.

연구 동기 및 목표

  • 대규모 또는 깊은 모델에서 학습을 방해하는 확률적 계산 그래프(SCGs)의 기울기 추정에서 높은 분산과 계산 비용을 해결하기 위해.
  • 정책 기반 기울기 외에도 임의의 SCGs에 대해 강화학습 개념인 가치 함수, 베이스라인, 크리틱을 일반화하여 확률적 또는 비미분 가능한 노드를 포함한 모델에 적용하기 위해.
  • 전체 정방향-역방향 전파가 아닌 부분 모델 평가를 활용하여 국소적이고 비동기적인 기울기 갱신을 가능하게 하기 위해.
  • 신용 할당을 위한 단일 형식적 프레임워크 아래에서 확률적 추론과 강화학습의 다양한 기법을 통합하기 위해.
  • 특정 모델 구조에 맞게 저분산이고 효율적인 기울기 추정기를 설계하기 위한 방법론적 지침을 제공하기 위해.

제안 방법

  • 일반적인 SCG 기울기 추정기에서 유도된 가치 함수와 베이스라인을 제어 변수로 사용하여 SCGs의 기울기 추정기 분산을 줄임.
  • 하류 손실 기울기의 학습된 근사치인 기울기 크리틱(gradient critics)을 제안하여 분산이 낮고 샘플 효율성이 높은 기울기 추정을 가능하게 함.
  • 중간 상태나 파라미터에 조건을 두어 크리틱을 조건화함으로써 부분 모델 평가를 가능하게 하여 전체 그래프를 전파하지 않는 국소 학습 규칙을 도입함.
  • 신경망과 같은 함수 근사 기법을 사용해 가치 함수와 기울기 크리틱을 학습함으로써 복잡한 모델에서의 확장 가능한 학습을 가능하게 함.
  • 행동에 조건을 두는 대신 정책 파라미터에 조건을 두는 행동-파라미터 크리틱을 제안하여, 리laxation이나 재파rameterization 없이도 비미분 가능한 행동에 대해 저분산 추정을 가능하게 함.
  • 비편향 추정기와 선형 조합을 통해 크리틱과 기울기 크리틱을 결합함으로써 편향-분산 트레이드오프를 조정 가능하게 하며, 일관성을 유지함.

실험 결과

연구 질문

  • RQ1가치 함수와 베이스라인은 임의의 확률적 계산 그래프에 어떻게 일반화되어 기울기 분산을 줄일 수 있는가?
  • RQ2크리틱과 기울기 크리틱은 SCGs에서 전체 정방향-역방향 전파가 아닌 국소적 부분 평가를 어떻게 가능하게 하는가?
  • RQ3상태, 행동, 또는 정책 파라미터에 조건을 두는 것의 선택이 기울기 추정의 편향-분산 트레이드오프에 어떤 영향을 미치는가?
  • RQ4리laxation이나 재파라미터화 없이도 기울기 크리틱을 사용해 비미분 가능한 행동에 대해 저분산 추정기를 유도할 수 있는가?
  • RQ5제안된 기법들은 강화학습과 변분 추론의 기존 기법들을 어떻게 통합하고 일반화하는가?

주요 결과

  • 제어 변수로 가치 함수와 베이스라인을 사용함으로써, 편향을 유발하지 않으면서도 확률적 계산 그래프에서 기울기 추정기의 분산을 크게 줄일 수 있다.
  • 기울기 크리틱은 하류 기울기의 근사를 통해 국소 학습 규칙을 가능하게 하여 전체 그래프 탐색이 아닌 효율적인 부분 평가를 가능하게 한다.
  • 행동-파라미터 크리틱은 모든 행동을 암묵적으로 평균화함으로써 리laxation이나 재파라미터화 없이도 비미분 가능한 행동에 대해 저분산 추정을 가능하게 한다.
  • 이 프레임워크는 REINFORCE, 재파라미터화 기법, 정책 기반 기울기 방법 등 기존 기법들을 특정 크리틱 선택에 따라 일반 SCG 기울기 추정기의 특수한 경우로 통합한다.
  • 크리틱과 기울기 크리틱을 조합함으로써 편향-분산 트레이드오프를 조절할 수 있는 추정기 스펙트럼을 제공하며, 다양한 모델 아키텍처에 적합하다.
  • 기울기 갱신 당 계산 비용을 줄임으로써, 반복 네트워크나 계층적 강화학습 등의 깊거나 장거리 모델에서의 확장 가능한 학습을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.