[논문 리뷰] Improved Algorithms for Convex-Concave Minimax Optimization
이 논문은 조건 수에 대한 더 낫고 선형 수렴 속도를 보장하는 새로운 알고리즘, Proximal Best Response를 제안한다. 이 알고리즘은 조건 수에 대한 더 강한 의존성과 함께 볼록-볼록 최소화 문제에서 개선된 기울기 복잡도를 달성한다. 특히 교차 변수 상호작용이 약할 경우, 이는 이차 함수의 경우 알려진 하한선에 하위다항수 인자까지 일치한다.
This paper studies minimax optimization problems $\min_x \max_y f(x,y)$, where $f(x,y)$ is $m_x$-strongly convex with respect to $x$, $m_y$-strongly concave with respect to $y$ and $(L_x,L_{xy},L_y)$-smooth. Zhang et al. provided the following lower bound of the gradient complexity for any first-order method: $Ω\Bigl(\sqrt{\frac{L_x}{m_x}+\frac{L_{xy}^2}{m_x m_y}+\frac{L_y}{m_y}}\ln(1/ε)\Bigr).$ This paper proposes a new algorithm with gradient complexity upper bound $ ilde{O}\Bigl(\sqrt{\frac{L_x}{m_x}+\frac{L\cdot L_{xy}}{m_x m_y}+\frac{L_y}{m_y}}\ln\left(1/ε ight)\Bigr),$ where $L=\max\{L_x,L_{xy},L_y\}$. This improves over the best known upper bound $ ilde{O}\left(\sqrt{\frac{L^2}{m_x m_y}} \ln^3\left(1/ε ight) ight)$ by Lin et al. Our bound achieves linear convergence rate and tighter dependency on condition numbers, especially when $L_{xy}\ll L$ (i.e., when the interaction between $x$ and $y$ is weak). Via reduction, our new bound also implies improved bounds for strongly convex-concave and convex-concave minimax optimization problems. When $f$ is quadratic, we can further improve the upper bound, which matches the lower bound up to a small sub-polynomial factor.
연구 동기 및 목표
- 교차 변수 상호작용이 약할 때 복합-볼록 최소화 문제의 기울기 복잡도 상한선 간극을 메우기.
- Lin 등이 제안한 이전 최고 상한선 $\tilde{O}\left(\sqrt{L^2/(m_{\mathbf{x}}m_{\mathbf{y}})}\ln^3(1/\epsilon)\right)$ 을 초월하기.
- 고정밀도 해를 위한 핵심적인 선형 수렴 속도 확보하기.
- 강한 복합-볼록 및 일반 복합-볼록 최소화 문제에 대해 감소 기법을 통해 더 낫고 강한 상한선 제공하기.
- 이차 함수의 경우 상한선과 하한선 간 격차를 하위다항수 인자 수준으로 좁히기.
제안 방법
- 일반 복합-볼록 최소화 문제를 위한 새로운 알고리즘인 Proximal Best Response (PBR) 도입.
- 강한 복합성과 강한 볼록성, 스무스니스 매개변수 $L_{\mathbf{x}}, L_{\mathbf{y}}, L_{\mathbf{xy}}$ 및 모듈러스 $m_{\mathbf{x}}, m_{\mathbf{y}}$ 활용.
- 이차 함수의 경우 조건 수 의존도를 줄이기 위해 재귀적 행렬 해법인 Recursive Hermitian-Skew-Hermitian Split (RHSS(k)) 설계.
- 최적성 조건에서 유도된 선형 시스템을 행렬-벡터 곱을 반복적으로 사용해 해결하기 위한 반복 정밀화 기법 사용.
- RHSS(k)의 반복 횟수 $k$를 최적화하여 수렴 속도의 하위다항수 인자 최소화.
- 강한 복합-강한 볼록 케이스에서의 결과를 보다 넓은 최소화 설정으로 확장하기 위해 감소 기법 적용.
실험 결과
연구 질문
- RQ1복합-볼록 최소화 문제에 대해 알려진 하한선에 하위다항수 인자까지 일치하는 일阶 알고리즘을 설계할 수 있는가?
- RQ2상호작용 항 $L_{\mathbf{xy}}$ 가 다른 스무스니스 매개변수에 비해 작을 경우, 수렴 속도와 조건 수 의존도를 어떻게 향상시킬 수 있는가?
- RQ3이차 최소화 문제의 반복 선형 해법에서 반복 횟수와 조건 수 사이의 최적 균형은 무엇인가?
- RQ4일반 복합-볼록 설정에서 선형 수렴을 달성하면서도 조건 수에 대한 날카운 의존도를 유지할 수 있는가?
- RQ5재귀적 행렬 해법 RHSS(k)는 어떻게 효과적 조건 수를 감소시키고 이차 함수의 경우 수렴을 향상시키는가?
주요 결과
- 제안된 Proximal Best Response 알고리즘은 $\tilde{O}\left(\sqrt{\frac{L_{\mathbf{x}}}{m_{\mathbf{x}}} + \frac{L \cdot L_{\mathbf{xy}}}{m_{\mathbf{x}}m_{\mathbf{y}}} + \frac{L_{\mathbf{y}}}{m_{\mathbf{y}}}} \ln(1/\epsilon)\right)$ 의 기울기 복잡도를 달성한다. 여기서 $L = \max\{L_{\mathbf{x}}, L_{\mathbf{xy}}, L_{\mathbf{y}}\}$ 이며, 이는 이전 상한선을 향상시킨다.
- 이 알고리즘은 선형 수렴 속도를 달성한다. 이는 Lin 등이 제안한 이전 최고 방법에서는 보장되지 않는다.
- 이차 함수의 경우, RHSS(k) 알고리즘은 $O\left(\sqrt{\frac{L_{\mathbf{x}}}{m_{\mathbf{x}}} + \frac{L_{\mathbf{xy}}^2}{m_{\mathbf{x}}m_{\mathbf{y}}} + \frac{L_{\mathbf{y}}}{m_{\mathbf{y}}}} \left(\frac{L^2}{m_{\mathbf{x}}m_{\mathbf{y}}}\right)^{o(1)} \ln(1/\epsilon)\right)$ 의 상한선을 달성하며, 하한선에 하위다항수 인자까지 일치한다.
- 상한선의 하위다항수 인자는 $k = \Theta\left(\sqrt{\ln(L^2/(m_{\mathbf{x}}m_{\mathbf{y}})) / \ln\ln(L^2/(m_{\mathbf{x}}m_{\mathbf{y}}))}\right)$ 일 때 최소화되며, 이는 거의 최적의 수렴을 이룬다.
- 향상된 상한선은 감소 기법을 통해 강한 복합-볼록 및 일반 복합-볼록 최소화 문제에 대한 더 낫고 복잡도 결과를 암시한다.
- 특히 $L_{\mathbf{xy}} \ll \max\{L_{\mathbf{x}}, L_{\mathbf{y}}\}$ 일 경우, 이는 이전 방법보다 크게 향상되며, 특히 약하게 결합된 영역에서 두각을 나타낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.