Skip to main content
QUICK REVIEW

[논문 리뷰] An iterative regularized mirror descent method for ill-posed nondifferentiable stochastic optimization

Mostafa Amini, Farzad Yousefian|arXiv (Cornell University)|2019. 01. 28.
Sparse and Compressive Sensing Techniques참고 문헌 43인용 수 5
한 줄 요약

이 논문은 내부 및 외부 目적 모두가 기대값으로 주어지고 미분 가능성이 없을 수 있는 불안정한, 비미분 가능하며 확률적인 이중목적 최적화 문제를 해결하기 위해 반복적 정규화 확률 미러 경사하강법(IR-SMD)을 제안한다. 이 방법은 스텝사이즈와 정규화 파라미터를 적응적으로 갱신하며, 거의 확실한 수렴과 평균 수렴을 달성하여 수렴 속도가 $\mathcal{O}(1/N^{0.5-\delta})$임을 보였다. 이는 합성 및 실제 텍스트 분류 문제에서 검증되었다.

ABSTRACT

A wide range of applications arising in machine learning and signal processing can be cast as convex optimization problems. These problems are often ill-posed, i.e., the optimal solution lacks a desired property such as uniqueness or sparsity. In the literature, to address ill-posedness, a bilevel optimization problem is considered where the goal is to find among optimal solutions of the inner level optimization problem, a solution that minimizes a secondary metric, i.e., the outer level objective function. In addressing the resulting bilevel model, the convergence analysis of most existing methods is limited to the case where both inner and outer level objectives are differentiable deterministic functions. While these assumptions may not hold in big data applications, to the best of our knowledge, no solution method equipped with complexity analysis exists to address presence of uncertainty and nondifferentiability in both levels in this class of problems. Motivated by this gap, we develop a first-order method called Iterative Regularized Stochastic Mirror Descent (IR-SMD). We establish the global convergence of the iterate generated by the algorithm to the optimal solution of the bilevel problem in an almost sure and a mean sense. We derive a convergence rate of ${\cal O}\left(1/N^{0.5-δ} ight)$ for the inner level problem, where $δ>0$ is an arbitrary small scalar. Numerical experiments for solving two classes of bilevel problems, including a large scale binary text classification application, are presented.

연구 동기 및 목표

  • 내부 및 외부 목적이 모두 비미분 가능할 수 있는 불안정한, 확률적, 이중목적 최적화 문제에 대해 복잡도 분석이 있는 최초의 순서 방법이 부족한 문제를 해결하기 위해.
  • 불확실성과 비미분 가능성 하에서 이중목적 문제의 최적해로의 전역 수렴을 보장하는 방법을 개발하기 위해.
  • 적응적 파rameter 갱신 하에 탇합성 갭과 반복값의 수렴 속도를 확립하기 위해.
  • 대규모 문제, 특히 RCV1 데이터셋을 사용한 이진 텍스트 분류 작업에서 방법을 검증하기 위해.
  • 기존의 확률적 미러 경사하강 프레임워크를 외부 목적이 강하게 볼록하고 내부 목적이 확률적, 비미분 가능한 이중목적 기하학적 형태를 다룰 수 있도록 확장하기 위해.

제안 방법

  • 스텝사이즈와 정규화 파라미터를 각 반복에서 갱신하는 반복적 정규화 확률 미러 경사하강법(IR-SMD) 알고리즘을 제안한다.
  • 반복 횟수와 문제 파라미터에 기반한 스텝사이즈 $\gamma_k$와 정규화 파라미터 $\lambda_k$에 대한 적응적 갱신 규칙을 적용한다.
  • 비유클리드 기하학을 다룰 수 있도록 Bregman 발산을 사용하는 미러 경사하강 프레임워크를 활용한다. 이는 고차원 및 희소 문제에 적합하다.
  • 수렴 안정성과 희소성과 같은 원하는 해 성질을 촉진하기 위해 각 반복에서 정규화된 보조문제를 도입한다.
  • 기대값 수렴과 거의 확실한 수렴을 향상시키기 위해 평균화 기법을 적용한다.
  • 외부 목적이 강하게 볼록하고, 확률적 하위기울기의 유계성 등 가정 하에 수렴 보장을 도출한다.

실험 결과

연구 질문

  • RQ1내부 및 외부 목적이 모두 비미분 가능할 수 있는 불안정한 확률적 이중목적 최적화 문제에 대해 최초의 순서 방법을 개발할 수 있는가?
  • RQ2스텝사이즈와 정규화 파라미터에 대한 어떤 적응적 갱신 규칙이 거의 확실한 수렴과 평균 수렴을 보장하는가?
  • RQ3그러한 갱신 규칙 하에 탇합성 갭과 반복값의 수렴 속도를 어떻게 설정할 수 있는가?
  • RQ4불확실성과 비미분 가능성으로 인해 어려운 대규모 문제, 예를 들어 텍스트 분류 문제에서 이 방법은 어떻게 성능을 발휘하는가?
  • RQ5확률적, 비미분 가능하며 불안정한 목적이 존재하는 상황에서 이 방법이 근사 최적 수렴 속도를 달성할 수 있는가?

주요 결과

  • 제안된 스텝사이즈와 정규화 파라미터에 대한 적응적 갱신 규칙 하에 IR-SMD 방법은 유일한 최적해로 거의 확실한 수렴과 평균 수렴을 달성한다.
  • 기대 탇합성 갭에 대해 $\mathcal{O}(1/N^{0.5-\delta})$ 수렴 속도가 확립되었으며, 여기서 $\delta > 0$는 임의의 작은 스칼라이다.
  • 합성 선형 역문제에 대한 수치 실험 결과, 다양한 초기화 및 파라미터 설정에서도 일관된 수렴이 관찰되었다.
  • 150,000개의 기사와 138,921개의 토큰을 포함하는 RCV1 텍스트 분류 데이터셋에서, 방법은 희소성을 효과적으로 유도하고 낮은 손실 해에 수렴하였다.
  • 초기 조건에 대해 뛰어난 내성성을 보였으며, $x_0 = -10\mathbf{1}_n$, $\mathbf{0}_n$, 및 $10\mathbf{1}_n$의 경우 유사한 수렴 행동이 관찰되었다.
  • 반복 과정 전반에 걸쳐 낮은 탇합성 갭과 목적함수 값을 유지하였으며, 10,000개의 샘플 경로에서 손실 함수가 로그적으로 감소하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.