Skip to main content
QUICK REVIEW

[논문 리뷰] Online Continuous DR-Submodular Maximization with Long-Term Budget Constraints

Omid Sadeghi, Maryam Fazel|arXiv (Cornell University)|2019. 06. 30.
Advanced Bandit Algorithms Research참고 문헌 23인용 수 4
한 줄 요약

이 논문은 장기적 예산 제약 조건 하에서 온라인 연속 DR-하위모듈러 최대화 문제를 위한 온라인 안장점 하이브리드 기울기(Onlne Saddle Point Hybrid Gradient, OSPHG) 알고리즘을 제안한다. 목적 함수는 단조 증가하는 DR-하위모듈러이고, 예산 함수는 선형이다. 창문 크기 $W = o(T)$일 때, 하위선형의 오차와 예산 위반 한계를 확립한다. 이는 $W = T$일 때 악성 예산 함수에 의해 하위선형 오차의 불가능성을 극복한다. 주요 기여는 $W = o(T)$일 때 $(1 - \frac{1}{e})$-근사 오차 한계와 하위선형 총 예산 위반을 동시에 달성하는 것이다.

ABSTRACT

In this paper, we study a class of online optimization problems with long-term budget constraints where the objective functions are not necessarily concave (nor convex) but they instead satisfy the Diminishing Returns (DR) property. Specifically, a sequence of monotone DR-submodular objective functions $\{f_t(x)\}_{t=1}^T$ and monotone linear budget functions $\{\langle p_t,x angle \}_{t=1}^T$ arrive over time and assuming a total targeted budget $B_T$, the goal is to choose points $x_t$ at each time $t\in\{1,\dots,T\}$, without knowing $f_t$ and $p_t$ on that step, to achieve sub-linear regret bound while the total budget violation $\sum_{t=1}^T \langle p_t,x_t angle -B_T$ is sub-linear as well. Prior work has shown that achieving sub-linear regret is impossible if the budget functions are chosen adversarially. Therefore, we modify the notion of regret by comparing the agent against a $(1-\frac{1}{e})$-approximation to the best fixed decision in hindsight which satisfies the budget constraint proportionally over any window of length $W$. We propose the Online Saddle Point Hybrid Gradient (OSPHG) algorithm to solve this class of online problems. For $W=T$, we recover the aforementioned impossibility result. However, when $W=o(T)$, we show that it is possible to obtain sub-linear bounds for both the $(1-\frac{1}{e})$-regret and the total budget violation.

연구 동기 및 목표

  • 악성 조건 하에서 단조 증가하는 DR-하위모듈러 목적 함수와 선형 예산 제약 조건을 가진 온라인 최적화 문제를 다루는 것.
  • 창문 크기 $W = T$일 때, 전체 시간 범위에서 악성 예산 함수에 의해 하위선형 오차의 불가능성을 극복하는 것.
  • 슬라이딩 창 크기 $W$에 대해 고정된 결정에 대해 $(1 - \frac{1}{e})$-근사값을 기준으로 하위선형 오차와 하위선형 예산 위반을 달성하는 알고리즘을 설계하는 것.
  • 시간에 따라 변하는 악성 예산 함수 조건 하에서도 실현 가능한 성능 보장을 허용하는 새로운 오차 개념을 정식화하는 것.

제안 방법

  • 온라인 안장점 방법과 DR-하위모듈러 함수를 위한 하이브리드 기울기 업데이트를 결합한 온라인 안장점 하이브리드 기울기(Onlne Saddle Point Hybrid Gradient, OSPHG) 알고리즘을 제안한다.
  • 에이전트의 성능을 고정된 결정과 비교하기 위해 크기 $W$의 슬라이딩 창을 사용하며, 이는 임의의 길이 $W$ 창 내에서 예산 제약 조건을 비례적으로 만족하는 결정을 기준으로 한다.
  • 예산 제약 조건을 처리하기 위해 이중 변수 $\lambda_t$를 사용하는 라그랑주 이론 틀을 적용하며, 이중 업데이트는 라그랑주 함수에 대한 기울기 상승 기반으로 이루어진다.
  • 프리멀 및 이중 업데이트를 번갈아 가며 수행하는 하이브리드 기울기 기법을 도입하며, 오차 및 제약 잔여 항의 수렴 분석을 수행한다.
  • 강한 볼록성과 미끄러움 성질을 이용해 항을 바ounds하는 텔레스코프 합 기법을 사용하여 오차 및 예산 위반 한계를 유도한다.
  • 라그랑주 함수의 새로운 분해 기법을 적용하여 $(1 - \frac{1}{e})$-오차와 예산 위반을 분리하고, $W = o(T)$ 조건 하에서 하위선형 한계를 달성한다.

실험 결과

연구 질문

  • RQ1창문 크기 $W = T$일 때, 전체 시간 범위에서 악성 예산 함수에 의해 온라인 연속 DR-하위모듈러 최대화 문제에서 하위선형 오차를 달성할 수 있는가?
  • RQ2악성 예산 함수 조건 하에서 하위선형 총 예산 위반과 함께 하위선형 오차를 동시에 달성할 수 있는가?
  • RQ3크기 $W$의 슬라이딩 창 내에서 예산 제약 조건을 비례적으로 만족하는 고정된 결정과 비교할 때 어떤 성능 보장을 달성할 수 있는가?
  • RQ4창문 크기 $W$의 선택이 온라인 DR-하위모듈러 최적화에서 오차와 예산 위반 간의 트레이드오프에 어떤 영향을 미치는가?
  • RQ5창문 크기 $W = o(T)$일 때, $(1 - \frac{1}{e})$-근사 오차 한계를 달성하면서도 총 예산 위반이 하위선형이 되는가?

주요 결과

  • 창문 크기 $W = o(T)$일 때, $W = T$일 경우의 불가능성 결과를 극복하고 하위선형 오차와 하위선형 총 예산 위반을 달성할 수 있다.
  • 제안된 OSPHG 알고리즘은 $W = o(T)$ 조건 하에서 $(1 - \frac{1}{e})$-오차 한계와 함께 하위선형 총 예산 위반을 달성하여, 온라인 DR-하위모듈러 최적화의 새로운 성능 보장을 수립한다.
  • 오차 및 제약 잔여 항의 한계는 라그랑주 함수의 새로운 분해와 텔레스코프 합 기법을 통해 유도되었으며, 이는 $W$, $T$, 그리고 미끄러움 성질의 매개변수에 명시적인 의존성을 보인다.
  • 분석 결과, $WT \geq 16R^2$ 조건을 만족할 경우, 최종 오차 표현식에서 $\sum_{t=1}^{T} \lambda_t^2$ 항을 제거할 수 있으며, 이는 최종 오차 표현을 단순화한다.
  • 핵심 기술적 통찰은 창 기반 기준이 경계 효과를 상쇄시켜, 악성 예산 함수 조건 하에서도 하위선형 성능을 달성할 수 있도록 한다.
  • $W = o(T)$일 경우, 적절한 매개변수 조정 하에 알고리즘이 $\mathcal{O}(W)$의 오차와 $\mathcal{O}(WT)$의 예산 위반을 달성하며, 둘 다 $T$에 대해 하위선형이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.