Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-block-Single-probe Variance Reduced Estimator for Coupled Compositional Optimization

Wei Jiang, Gang Li|arXiv (Cornell University)|2022. 07. 18.
Risk and Portfolio Optimization인용 수 4
한 줄 요약

이 논문은 각 반복에서 $\mathcal{O}(1)$개의 블록만 샘플링 가능한 조건에서 $\sum_{i=1}^{m}f_i(g_i(\mathbf{w}))$ 형태의 결합된 복합 최적화 문제를 위한 다중블록-단일프로브 분산 감소(MSVR) 추정기인 Multi-block-Single-probe Variance Reduced (MSVR) 추정기를 제안한다. 샘플링된 블록과 미샘플링된 블록 양쪽의 노이즈를 줄이기 위해 맞춤형 오차 보정 항을 도입함으로써, MSVR는 향상된 샘플 복잡도를 달성한다: 비볼록 목적 함수의 경우 $\mathcal{O}(\epsilon^{-3})$, 볼록 목적 함수의 경우 $\mathcal{O}(\epsilon^{-2})$, 강력 볼록 목적 함수의 경우 $\mathcal{O}(\mu^{-1}\epsilon^{-1})$ — 이는 기존 최상의 성능를 유지하거나 초월한다.

ABSTRACT

Variance reduction techniques such as SPIDER/SARAH/STORM have been extensively studied to improve the convergence rates of stochastic non-convex optimization, which usually maintain and update a sequence of estimators for a single function across iterations. What if we need to track multiple functional mappings across iterations but only with access to stochastic samples of $\mathcal{O}(1)$ functional mappings at each iteration? There is an important application in solving an emerging family of coupled compositional optimization problems in the form of $\sum_{i=1}^m f_i(g_i(\mathbf{w}))$, where $g_i$ is accessible through a stochastic oracle. The key issue is to track and estimate a sequence of $\mathbf g(\mathbf{w})=(g_1(\mathbf{w}), \ldots, g_m(\mathbf{w}))$ across iterations, where $\mathbf g(\mathbf{w})$ has $m$ blocks and it is only allowed to probe $\mathcal{O}(1)$ blocks to attain their stochastic values and Jacobians. To improve the complexity for solving these problems, we propose a novel stochastic method named Multi-block-Single-probe Variance Reduced (MSVR) estimator to track the sequence of $\mathbf g(\mathbf{w})$. It is inspired by STORM but introduces a customized error correction term to alleviate the noise not only in stochastic samples for the selected blocks but also in those blocks that are not sampled. With the help of the MSVR estimator, we develop several algorithms for solving the aforementioned compositional problems with improved complexities across a spectrum of settings with non-convex/convex/strongly convex/Polyak-Łojasiewicz (PL) objectives. Our results improve upon prior ones in several aspects, including the order of sample complexities and dependence on the strong convexity parameter. Empirical studies on multi-task deep AUC maximization demonstrate the better performance of using the new estimator.

연구 동기 및 목표

  • 계산 또는 메모리 제약으로 인해 각 반복에서 $g_i(\mathbf{w})$의 $\mathcal{O}(1)$개 블록만 탐색 가능한 조건에서 결합된 복합 최적화 문제를 다루기 위해.
  • 특히 부분적인 블록 액세스만 가능한 상황에서 $\mathbf{g}(\mathbf{w}) = (g_1(\mathbf{w}), \dots, g_m(\mathbf{w}))$의 추정에서의 분산을 줄이기 위해.
  • 비볼록 목적 함수의 경우 $\mathcal{O}(m\epsilon^{-4})$의 복잡도를 보이는 기존 방법들(SOX)에 비해 더 나은 샘플 복잡도를 확보하기 위해.
  • 샘플링된 블록 뿐 아니라 미샘플링된 블록의 노이즈까지도 고려한 맞춤형 오차 보정 메커니즘을 통해 분산 감소 추정기를 개발하기 위해.
  • 유한합 및 기대값 기반 설정에서 비볼금, 볼금, 강력 볼금 목적 함수에 대해 최신 기술 수준의 샘플 복잡도를 달성하기 위해.

제안 방법

  • 각 반복 동안 $g_i(\mathbf{w})$의 각 블록에 대해 추정기 $\mathbf{u}_t^i$를 유지하는 다중블록, 단일프로브 분산 감소 기법인 MSVR 추정기를 제안한다.
  • STORM 프레임워크를 변형하여, $(1-\beta)(g_i(\mathbf{w}_t;\xi_t^i) - g_i(\mathbf{w}_{t-1};\xi_t^i))$ 형태의 맞춤형 오차 보정 항을 도입함으로써 샘플링된 블록과 미샘플링된 블록 양쪽의 노이즈를 감소시킨다.
  • 각 반복에서 $\mathcal{O}(1)$개의 블록만 탐색하지만, 오차 보정을 통한 재귀적 업데이트를 통해 모든 $m$개 블록을 추적하는 하이브리드 샘플링 전략을 사용한다.
  • MSVR 추정기를 유한합 및 기대값 기반 복합 최적화 문제에 통합하여 수렴 속도 향상을 가능하게 한다.
  • 수렴과 분산 감소를 반복 과정에서 균형 있게 유지하기 위해 적응형 스텝 사이즈와 재귀적 업데이트 규칙을 활용한다.
  • MSVR 추정기를 다중작업 딥 AUC 최적화에 적용하여, SOX와 같은 기준 방법들보다 실증적으로 뛰어난 성능을 입증한다.

실험 결과

연구 질문

  • RQ1각 반복에서 $\mathcal{O}(1)$개의 블록만 샘플링 가능한 조건에서, 여러 기능 맵핑 $g_i(\mathbf{w})$를 추적할 수 있는 분산 감소 추정기를 설계할 수 있는가?
  • RQ2맞춤형 오차 보정 항을 도입함으로써 결합된 복합 최적화 문제에서 수렴 속도와 샘플 복잡도가 향상되는가?
  • RQ3제안된 MSVR 추정기는 비볼금, 볼금, 강력 볼금 목적 함수에 대해 SOX 및 이전의 분산 감소 방법보다 더 나은 샘플 복잡도를 달성할 수 있는가?
  • RQ4실제 머신러닝 작업(예: 다중작업 AUC 최적화)에서 MSVR 추정기는 기존 방법들에 비해 실증적으로 어떻게 성능을 발휘하는가?
  • RQ5제안된 알고리즘의 이론적 샘플 복잡도는 비볼금, 볼금, 강력 볼금 문제 유형에서 각각 어떻게 되는가?

주요 결과

  • MSVR 추정기는 비볼금 목적 함수의 경우 $\mathcal{O}(\epsilon^{-3})$의 샘플 복잡도를 달성하여, 이전의 SOX의 $\mathcal{O}(m\epsilon^{-4})$ 복잡도를 향상시켰다.
  • 볼금 목적 함수의 경우 $\mathcal{O}(\epsilon^{-2})$의 샘플 복잡도를 확보하여 최신 기술 수준과 동일하며, SOX의 $\mathcal{O}(m\epsilon^{-3})$보다 향상되었다.
  • 강력 볼금의 경우 $\mathcal{O}(\mu^{-1}\epsilon^{-1})$의 샘플 복잡도를 달성하여 최고 수준의 결과를 유지하면서도 SOX의 $\mathcal{O}(m\mu^{-2}\epsilon^{-1})$보다 향상되었다.
  • 다중작업 AUC 최적화에서의 실증 결과로 MSVR-v1, MSVR-v2, MSVR-v3가 SOX 및 표준 STORM 기반 추정기를 사용한 변형들보다 뛰어난 성능을 보였다.
  • 제거 실험을 통해 맞춤형 오차 보정 항이 필수적임을 확인하였으며, 이를 표준 STORM 기반 업데이트로 대체할 경우 성능 저하가 발생하였다.
  • 다양한 배치 크기 $B_1$ 및 $B_2$를 사용한 실험을 통해 이론적 수렴 경향이 검증되었으며, 더 큰 배치 크기일수록 더 빠른 수렴이 관찰되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.