Skip to main content
QUICK REVIEW

[논문 리뷰] No-regret algorithms for online $k$-submodular maximization

Tasuku Soma|arXiv (Cornell University)|2018. 07. 13.
Advanced Bandit Algorithms Research참고 문헌 21인용 수 7
한 줄 요약

이 논문은 블랙웰의 접근 가능성 정리와 온라인 선형 최적화를 사용하여 온라인 $k$-하위모듈라 최대화를 위한 다항시간 무회피 알고리즘을 제시한다. 비단조화 $k$-하위모듈라 함수에 대해 $O(nk\sqrt{T})$의 기대 $1/2$-회피를 달성하고, 단조화 $k$-하위모듈라 함수에 대해 $O(nk\sqrt{T})$의 기대 $ rac{k}{2k-1}$-회피를 달성하며, 이는 渐近적으로 알려진 최고의 오프라인 근사 비율과 일치한다.

ABSTRACT

We present a polynomial time algorithm for online maximization of $k$-submodular maximization. For online (nonmonotone) $k$-submodular maximization, our algorithm achieves a tight approximate factor in an approximate regret. For online monotone $k$-submodular maximization, our approximate-regret matches to the best-known approximation ratio, which is tight asymptotically as $k$ tends to infinity. Our approach is based on the Blackwell approachability theorem and online linear optimization.

연구 동기 및 목표

  • 일般적인 제약 조건 하에 온라인 $k$-하위모듈라 최대화를 위한 무회피 알고리즘을 설계하는 것.
  • 기존의 온라인 하위모듈라 최대화 결과를 하위모듈라성과 비하위모듈라성을 일반화하는 $k$-하위모듈라 설정으로 확장하는 것.
  • $k$-하위모듈라 함수에 대해 알려진 최고의 오프라인 근사 비율과 일치하는 날카로운 근사 보장을 달성하는 것.
  • 다음과 같은 표준 온라인 학습 알고리즘의 한계를 극복하기 위해 블랙웰의 접근 가능성 정리를 사용하는 것: 다중 가중치 업데이트

제안 방법

  • 블랙웰의 접근 가능성 정리를 활용하여, $k$-하위모듈라 선택 게임에 대해 응답 만족 전략을 유지하는 온라인 알고리즘을 설계한다.
  • 목표 근사 비율 $\alpha$를 인코딩하기 위해 수정된 벡터 보상 함수 $\ell'(\mathbf{p}, \mathbf{y})(i)$를 정의한다.
  • 내부 OLO 알고리즘으로 온라인 경사 하강법을 사용하여 $k$-튜플 위의 확률 분포 $\mathbf{p}_t$의 시퀀스를 구성한다.
  • 비단조화 케이스의 경우, 기대 회피가 $O(nk\sqrt{T})$ 이하로 유한하게 유지되도록 하여 $1/2$-회피를 달성한다.
  • 단조화 케이스의 경우, $\frac{k}{2k-1}$-근사 비율을 사용하고, 단조화 $k$-하위모듈라 선택 게임을 통해 동일한 $O(nk\sqrt{T})$의 회피 경계를 달성한다.
  • 알고리즘이 결정론적이므로, 적응적 적대자에 대해서도 강건하다.

실험 결과

연구 질문

  • RQ1온라인 $k$-하위모듈라 최대화를 위한 무회피 알고리즘을 설계할 수 있는가? 이 알고리즘은 알려진 최고의 오프라인 근사 비율을 충족하는가?
  • RQ2블랙웰의 접근 가능성 정리는 어떻게 $k$-하위모듈라 함수에 대한 온라인 알고리즘을 구성하는 데 적용될 수 있는가?
  • RQ3회피 경계를 비선형으로 만들고 함수의 특정 구조에 종속되지 않게 만들 수 있는가?
  • RQ4기존의 온라인 학습 기법(예: 다중 가중치 업데이트)을 $k$-하위모듈라 설정으로 확장하여 더 날카로운 보장을 달성할 수 있는가?

주요 결과

  • 논문은 온라인 비단조화 $k$-하위모듈라 최대화를 위한 다항시간 알고리즘을 제시하며, $O(nk\sqrt{T})$의 기대 $1/2$-회피를 달성한다.
  • 단조화 $k$-하위모듈라 최대화의 경우, 알고리즘은 $O(nk\sqrt{T})$의 기대 $ rac{k}{2k-1}$-회피를 달성하며, 알려진 최고의 오프라인 근사 비율과 일치한다.
  • 알고리즘이 결정론적이므로, 이전 연구에서 사용된 랜덤화 대안과 달리 적응적 적대자에 대해 강건하다.
  • 블랙웰의 접근 가능성 정리를 활용함으로써, 다중 가중치 업데이트와 같은 표준 온라인 학습 알고리즘보다 더 강력한 회피 보장을 달성할 수 있다.
  • 이 방법은 이전의 온라인 하위모듈라 최대화 결과를 $k$-하위모듈라 설정으로 일반화하며, Roughgarden과 Wang(2018)의 작업을 포함한다.
  • 회피 경계는 $T$, $n$, $k$에 대한 의존성에서 날카로우며, 알려진 오프라인 알고리즘의 渐近적 근사 비율과 일치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.