Skip to main content
QUICK REVIEW

[논문 리뷰] An Online Method for A Class of Distributionally Robust Optimization with Non-Convex Objectives

Qi Qi, Zhishuai Guo|arXiv (Cornell University)|2020. 06. 17.
Risk and Portfolio Optimization인용 수 9
한 줄 요약

이 논문은 비볼록 목표 함수를 가진 분포로버스트 최적화(DRO)를 위한 이중성 없이 온라인 스토하스틱 방법을 제안한다. KL 발산 정규화를 통해 최소-최대 DRO 문제를 스토하스틱 복합 최적화 문제로 변환한다. 이 방법은 최신 기술 수준의 수렴 복잡도를 달성하며, 불균형 데이터셋 포함 대규모 딥러닝 작업에서 학습을 2배 이상 가속화한다. 이중 변수의 고차원성 문제를 피하고 온라인 학습을 가능하게 한다.

ABSTRACT

In this paper, we propose a practical online method for solving a class of distributionally robust optimization (DRO) with non-convex objectives, which has important applications in machine learning for improving the robustness of neural networks. In the literature, most methods for solving DRO are based on stochastic primal-dual methods. However, primal-dual methods for DRO suffer from several drawbacks: (1) manipulating a high-dimensional dual variable corresponding to the size of data is time expensive; (2) they are not friendly to online learning where data is coming sequentially. To address these issues, we consider a class of DRO with an KL divergence regularization on the dual variables, transform the min-max problem into a compositional minimization problem, and propose practical duality-free online stochastic methods without requiring a large mini-batch size. We establish the state-of-the-art complexities of the proposed methods with and without a Polyak-Łojasiewicz (PL) condition of the objective. Empirical studies on large-scale deep learning tasks (i) demonstrate that our method can speed up the training by more than 2 times than baseline methods and save days of training time on a large-scale dataset with $\sim$ 265K images, and (ii) verify the supreme performance of DRO over Empirical Risk Minimization (ERM) on imbalanced datasets. Of independent interest, the proposed method can be also used for solving a family of stochastic compositional problems with state-of-the-art complexities.

연구 동기 및 목표

  • 비볼록 목표 함수를 가진 DRO에서 스토하스틱 프리멀-이중 방법의 비효율성, 특히 고차원 이중 변수와 온라인 학습 지원 부족 문제를 해결하기 위해.
  • 완전한 크기 $ n $ 의 이중 벡터를 유지하지 않아도 되는 온라인이고 확장 가능한 알고리즘을 개발하여 메모리 및 계산 비용을 감소시키기 위해.
  • 일반 조건과 Polyak-Łojasiewicz(PL) 조건 하에서 DRO의 최적 수렴 속도를 확립하여 기존 스토하스틱 복합 방법보다 향상시키기 위해.
  • 특히 대규모 및 불균형 데이터셋에서 강건한 학습을 위한 실용적 응용을 가능하게 하기 위해.

제안 방법

  • 이중 변수에 대한 KL 발산 정규화를 사용하여 최소-최대 DRO 문제를 복합 최소화 문제로 변환함으로써 이중성 없는 공식을 가능하게 한다.
  • 다음과 같은 등가 목적 함수 유도: $ F_{\text{dro}}(\mathbf{w}) = \lambda \log\left(\frac{1}{n}\sum_{i=1}^{n} \exp(\ell(\mathbf{w};\mathbf{z}_i)/\lambda)\right) + r(\mathbf{w}) $, 이는 스토하스틱 복합 문제이다.
  • 분산 감소 기법(예: SPIDER)을 사용하는 새로운 온라인 스토하스틱 알고리즘 RECOVER를 제안하여 최적의 샘플 복잡도를 달성한다.
  • 적응형 단계 크기와 미니배치 샘플링을 통합하여 기울기 분산을 줄이고 수렴을 향상시키며, 큰 미니배치 크기를 요구하지 않는다.
  • 복합 목적 함수의 지수족 구조를 활용하여 효율적인 온라인 업데이트를 가능하게 하고, 명시적인 이중 변수 유지 없이도 작동하도록 한다.
  • 일반 조건과 PL 조건 하에서 이론적 수렴 보장을 확립하며, 복잡도 한계가 최신 기술 수준과 동일하거나 이를 초월한다.

실험 결과

연구 질문

  • RQ1고차원 이중 변수 $ \mathbf{p} \in \mathbb{R}^n $ 를 유지하지 않는 온라인 DRO 알고리즘을 설계할 수 있는가? 이는 확장 가능하고 메모리 효율적인 학습을 가능하게 한다.
  • RQ2프리멀-이중 분해에 의존하지 않고도 비볼록 DRO 문제에 대해 최적의 수렴 복잡도를 달성할 수 있는가?
  • RQ3제안된 방법은 불균형 데이터를 포함한 대규모 딥러닝 작업에서 실제로 어떻게 성능을 발휘하는가?
  • RQ4이 방법은 최적의 샘플 복잡도를 확보하는 더 넓은 범위의 스토하스틱 복합 문제를 해결하는 데 일반화될 수 있는가?

주요 결과

  • 제안된 방법은 약 265,000장의 이미지를 포함한 대규모 데이터셋에서 기존 기준 방법 대비 학습 시간을 2배 이상 단축시킨다.
  • 대규모 딥러닝 작업에서 학습 시간을 수일간 단축시켜 강력한 실용적 확장성을 입증한다.
  • 실험 결과는 제안된 방법을 사용한 DRO가 불균형 데이터셋에서 경험 리스크 최소화(ERM)보다 유의미하게 뛰어난 성능을 보임을 확인한다.
  • 이론적 분석을 통해 일반 조건과 Polyak-Łojasiewicz(PL) 조건 하에서 비볼록 DRO의 최신 기술 수준 샘플 복잡도를 확립한다.
  • 샘플 복잡도가 $ O(1/\epsilon) $ 인 최적 수렴 속도를 달성하며, 스토하스틱 복합 문제의 최고 성능 기준과 일치한다.
  • 알고리즘은 완전히 온라인이며 데이터 크기 $ n $ 의 사전 지식이 필요 없어 순차적 데이터 처리에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.