[논문 리뷰] New Projection-free Algorithms for Online Convex Optimization with Adaptive Regret Guarantees
이 논문은 새로운 비투영 기반의 온라인 볼록 최적화 알고리즘을 제안하며, 온라인 경사 하강법에 기반한 새로운 비가능한 투영 기법을 사용하여, 처음으로 적응형 리그레트 보장을 달성한다. 전체 정보 설정에서는 $O(T^{3/4})$의 적응형 리그레트를, 밴딧 설정에서는 $O(T^{3/4})$의 적응형 기대 리그레트를 달성하며, 선형 최적화 오라클(LOO)을 총 $O(T)$번만 호출한다. 이 방법은 수직 투영을 피하고 효율적인 오라클에 의존하며, 전체 정보 설정에서 $O( ext{sqrt}{T})$의 적응형 리그레트를 달성하는 분리 오라클로도 확장 가능하다.
We present new efficient extit{projection-free} algorithms for online convex optimization (OCO), where by projection-free we refer to algorithms that avoid computing orthogonal projections onto the feasible set, and instead relay on different and potentially much more efficient oracles. While most state-of-the-art projection-free algorithms are based on the extit{follow-the-leader} framework, our algorithms are fundamentally different and are based on the extit{online gradient descent} algorithm with a novel and efficient approach to computing so-called extit{infeasible projections}. As a consequence, we obtain the first projection-free algorithms which naturally yield extit{adaptive regret} guarantees, i.e., regret bounds that hold w.r.t. any sub-interval of the sequence. Concretely, when assuming the availability of a linear optimization oracle (LOO) for the feasible set, on a sequence of length $T$, our algorithms guarantee $O(T^{3/4})$ adaptive regret and $O(T^{3/4})$ adaptive expected regret, for the full-information and bandit settings, respectively, using only $O(T)$ calls to the LOO. These bounds match the current state-of-the-art regret bounds for LOO-based projection-free OCO, which are extit{not adaptive}. We also consider a new natural setting in which the feasible set is accessible through a separation oracle. We present algorithms which, using overall $O(T)$ calls to the separation oracle, guarantee $O(\sqrt{T})$ adaptive regret and $O(T^{3/4})$ adaptive expected regret for the full-information and bandit settings, respectively.
연구 동기 및 목표
- 가능한 집합 위로의 계산적으로 비용이 많이 드는 수직 투영을 피하는 비투영 온라인 볼록 최적화 알고리즘을 개발하는 것.
- 모든 부분 시퀀스에 대해 성립하는 리그레트 경계를 확보하는 적응형 리그레트 보장을 달성하면서, Follow-The-Leader 프레임워크에 의존하지 않는 것.
- 최적화 오라클(LOO) 또는 분리 오라클을 총 $O(T)$번만 사용하면서도 최신 기술 수준의 리그레트 경계를 유지하는 알고리즘을 설계하는 것.
- 가능한 집합이 선형 최적화 오라클이 아닌 분리 오라클을 통해 접근되는 설정으로 프레임워크를 확장하여, 전체 정보 설정에서 향상된 적응형 리그레트를 달성하는 것.
- 이전의 COLT 2022 버전에서 강凸 손실에 대한 수렴 증명의 결함을 수정하면서도, 리그레트 경계에 로그 인자만큼의 열등함을 초래하는 것.
제안 방법
- 알고리즘은 가능한 집합 위로의 수직 투영이 필요 없이 근사 투영을 계산하는 새로운 비가능한 투영 메커니즘을 갖춘 온라인 경사 하강법에 기반한다.
- 효율적인 가능 집합 접근을 위해 선형 최적화 오라클(LOO)을 사용하여, 명시적 투영 없이 내림걸음 단계를 계산할 수 있도록 한다.
- 밴딧 설정에서는 랜덤화된 스무딩 기법을 사용하여 기울기를 추정하며, 이로 인해 LOO를 확률적 설정에서 사용할 수 있도록 한다.
- 분리 오라클 기반 변형은 반복값이 가능 집합 근처에 유지되도록 캐비티링 절차를 사용하고, 수렴을 보장하기 위해 재귀적 거리 감소 전략을 채택한다.
- 알고리즘은 리그레트와 오라클 호출 효율성 간의 균형을 맞추기 위해 단계 크기와 스무딩 파라미터를 동적으로 조정한다.
- 이론적 분석은 비가능한 투영 과정에서의 거리 감쇠와 기울기 추정 오차의 경계를 활용하여 적응형 리그레트 보장을 유도한다.
실험 결과
연구 질문
- RQ1비투영 온라인 볼록 최적화 알고리즘은 Follow-The-Leader 프레임워크에 의존하지 않고도, 임의의 부분 시퀀스에 대해 리그레트 경계를 확보하는 적응형 리그레트 보장을 달성할 수 있는가?
- RQ2선형 최적화 오라클(LOO)을 총 $O(T)$번만 사용하면서도, 기존에 알려진 최고 수준의 비적응형 리그레트 경계를 달성할 수 있는가?
- RQ3가능한 집합이 선형 최적화 오라클이 아닌 분리 오라클을 통해 접근되는 설정으로 이 프레임워크를 어떻게 확장할 수 있는가?
- RQ4수직 투영 대신 비가능한 투영을 사용할 경우, 리그레트 성능과 오라클 호출 수 사이의 상충 관계는 어떻게 되는가?
- RQ5밴딧 설정에서 LOO 또는 분리 오라클을 총 $O(T)$번만 사용하면서도 적응형 리그레트 보장을 유지할 수 있는가?
주요 결과
- 제안된 알고리즘은 전체 정보 설정에서 $O(T^{3/4})$의 적응형 리그레트를 달성하고, 밴딧 설정에서는 $O(T^{3/4})$의 적응형 기대 리그레트를 달성하며, 선형 최적화 오라클(LOO)을 총 $O(T)$번만 사용한다.
- 분리 오라클 설정에서는 전체 정보 설정에서 $O(\sqrt{T})$의 적응형 리그레트를 보장하고, 밴딧 설정에서는 $O(T^{3/4})$의 적응형 기대 리그레트를 달성하며, 총 호출 수는 여전히 $O(T)$이다.
- 이 방법은 수직 투영을 피하는 새로운 비가능한 투영 기법을 도입하여, LOO 또는 분리 오라클을 통한 효율적 구현을 가능하게 한다.
- 이 알고리즘은 Follow-The-Leader 기반 접근의 내재된 한계를 극복하고, 자연스럽게 적응형 리그레트 보장을 제공하는 최초의 비투영 OCO 방법이다.
- 원래의 COLT 2022 버전에서 강凸 손실에 대한 수렴 증명의 결함을 수정하였지만, 새로운 리그레트 경계는 로그 인자만큼 열등하다.
- 이론적 분석은 분리 오라클 호출 수가 여전히 $O(T)$로 유지되며, 비가능한 반복값에도 불구하고 거리 감쇠 메커니즘이 수렴을 보장함을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.