Skip to main content
QUICK REVIEW

[논문 리뷰] An Online Method for Distributionally Deep Robust Optimization

Qi Qi, Zhishuai Guo|arXiv (Cornell University)|2020. 06. 17.
Stochastic Gradient Optimization Techniques참고 문헌 44인용 수 5
한 줄 요약

이 논문은 딥러닝에서 분포로버스트 최적화(DRO)를 위한 이중성 없는 온라인 확률적 방법을 제안한다. min-max 공식을 이중 변수가 필요한 고차원의 이중 변수를 피하는 최소화 문제로 변환한다. Polyak-Łojasiewicz(PL) 조건 하에서, 큰 배치 크기를 요구하지 않고도 최적의 샘플 복잡도를 달성하여 효율적인 온라인 학습과 향상된 로버스트성을 가능하게 한다.

ABSTRACT

In this paper, we propose a practical online method for solving a distributionally robust optimization (DRO) for deep learning, which has important applications in machine learning for improving the robustness of neural networks. In the literature, most methods for solving DRO are based on stochastic primal-dual methods. However, primal-dual methods for deep DRO suffer from several drawbacks: (1) manipulating a high-dimensional dual variable corresponding to the size of data is time expensive; (2) they are not friendly to online learning where data is coming sequentially. To address these issues, we transform the min-max formulation into a minimization formulation and propose a practical duality-free online stochastic method for solving deep DRO with KL divergence regularization. The proposed online stochastic method resembles the practical stochastic Nesterovs method in several perspectives that are widely used for learning deep neural networks. Under a Polyak-Lojasiewicz (PL) condition, we prove that the proposed method can enjoy an optimal sample complexity without any requirements on large batch size. Of independent interest, the proposed method can be also used for solving a family of stochastic compositional problems.

연구 동기 및 목표

  • 고차원의 이중 변수로 인해 높은 계산 비용이 발생하는 기존의 확률적 원천-이중 방법의 한계를 해결한다.
  • 데이터가 순차적으로 도착하는 온라인 학습 환경에서 원천-이중 방법의 부적합성을 극복한다.
  • 순차적 데이터에 적합한 효율적이고 확장 가능한 온라인 최적화 방법을 개발하여 딥 DRO에 적용한다.
  • 큰 배치 크기를 의존하지 않고도 Polyak-Łojasiewicz(PL) 조건 하에서 최적의 샘플 복잡도를 달성한다.
  • DRO를 초월하여 더 넓은 범위의 확률적 복합 최적화 문제에 적용 가능한 방법을 개발한다.

제안 방법

  • 고차원의 이중 변수가 필요 없는 최소화 문제로 DRO의 min-max 공식을 변환한다.
  • KL 발산 정규화를 사용하여 분포로버스트성을 모델링하는 이중성 없는 온라인 확률적 최적화 방법을 제안한다.
  • 스토하스틱 Nesterov 방법의 구조를 DRO 설정에 적응시켜 유리한 수렴 성질을 활용한다.
  • 데이터를 순차적으로 처리하여 온라인 학습을 통합함으로써 스트리밍 데이터 환경에 적합한 방법을 만든다.
  • 소규모 배치의 도착 데이터를 기반으로 모델 파라미터를 갱신하기 위해 확률적 근사 프레임워크를 사용한다.
  • Polyak-Łojasiewicz(PL) 조건을 활용하여 최적의 샘플 복잡도를 확보하는 수렴 보장을 수립한다.

실험 결과

연구 질문

  • RQ1고차원의 이중 변수를 유지하고 갱신할 필요 없이 계산 부담을 줄이는 이중성 없는 온라인 방법을 딥 DRO에 설계할 수 있는가?
  • RQ2순차적 데이터를 처리하는 온라인 환경에서도 제안된 방법이 강력한 수렴 보장을 유지하는가?
  • RQ3기본 가정 하에서 큰 배치 크기를 요구하지 않고도 방법이 최적의 샘플 복잡도를 달성할 수 있는가?
  • RQ4이 방법은 다른 확률적 복합 최적화 문제로 얼마나 일반화될 수 있는가?
  • RQ5실제로 기존의 원천-이중 접근법과 비교했을 때 수렴 속도와 로버스트성 측면에서 어떻게 성능을 내는가?

주요 결과

  • 제안된 이중성 없는 방법은 고차원의 이중 변수를 유지하고 갱신할 필요 없이 계산 오버헤드를 크게 줄였다.
  • Polyak-Łojasiewicz(PL) 조건 하에서 큰 배치 크기를 요구하지 않아도 최적의 샘플 복잡도를 달성한다.
  • 온라인 학습과 호환되어 순차적으로 도착하는 데이터 스트림에서 효율적인 학습이 가능하다.
  • 이 방법의 수렴 행동은 스토하스틱 Nesterov 방법과 유사하여 유사한 가속 성질의 이점을 얻는다.
  • 이 방법은 분포로버스트 딥러닝을 초월해 다양한 확률적 복합 최적화 문제를 해결하는 데 응용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.