Skip to main content
QUICK REVIEW

[논문 리뷰] Corruption-Tolerant Gaussian Process Bandit Optimization

Ilija Bogunovic, Andreas Krause|arXiv (Cornell University)|2020. 03. 04.
Advanced Bandit Algorithms Research참고 문헌 33인용 수 8
한 줄 요약

이 논문은 함수 평가에서 악성 오염이 존재하는 상황에서 가우시안 프로세스 밴디트 최적화를 위한 내성적 오염에 강건한 알고리즘인 Fast-Slow GP-UCB를 제안한다. 빠른 비강건한 GP-UCB 인스턴스와 느린 강건한 인스턴스(확대된 신뢰구간을 가짐) 사이를 무작위로 전환함으로써, 누적 오차 경계가 $\tilde{O}(C\sqrt{T})$로, 오염 수준 $C$에 대해 선형으로, 시간 영역 $T$에 대해 비선형으로 스케일링되며, 이는 이론적으로 $C$에 대한 의존성이 최악의 경우에서 피할 수 없고 최적임을 보여준다.

ABSTRACT

We consider the problem of optimizing an unknown (typically non-convex) function with a bounded norm in some Reproducing Kernel Hilbert Space (RKHS), based on noisy bandit feedback. We consider a novel variant of this problem in which the point evaluations are not only corrupted by random noise, but also adversarial corruptions. We introduce an algorithm Fast-Slow GP-UCB based on Gaussian process methods, randomized selection between two instances labeled "fast" (but non-robust) and "slow" (but robust), enlarged confidence bounds, and the principle of optimism under uncertainty. We present a novel theoretical analysis upper bounding the cumulative regret in terms of the corruption level, the time horizon, and the underlying kernel, and we argue that certain dependencies cannot be improved. We observe that distinct algorithmic ideas are required depending on whether one is required to perform well in both the corrupted and non-corrupted settings, and whether the corruption level is known or not.

연구 동기 및 목표

  • 함수 평가에서 악성 오염이 존재할 경우 표준 GP-UCB의 강건성 부족 문제를 해결하기 위해.
  • 오염 수준이 알려져 있지 않더라도 오염된 환경과 비오염된 환경 모두에서 성능을 유지하는 알고리즘을 개발하기 위해.
  • 오염 수준 $C$, 시간 영역 $T$, 그리고 기본 커널에 명시적으로 의존하는 이론적 오차 경계를 제공하기 위해.
  • 오차 경계에서 $C$에 대한 선형 의존성이 피할 수 없음을 입증하여 이 문제 유형의 기본 한계를 설정하기 위해.
  • 유한 액션 밴디트에서의 빠른-느린 알고리즘 패러다임을 무한 액션, 커널 기반 밴디트 설정으로 확장하기 위해.

제안 방법

  • 알고리즘은 빠른 비강건한 GP-UCB 인스턴스와 느린 강건한 인스턴스 사이에서 무작위 선택 메커니즘을 사용하여 탐색과 오염에 대한 강건성을 균형 잡는다.
  • 악성 편향이 함수 평가에 영향을 줄 수 있음을 고려해, 강건한 '느린' 인스턴스에서 확대된 신뢰구간을 사용한다.
  • 불확실성에 대한 낙관주의 원칙은 UCB 규칙을 통해 적용되며, 오염된 관측치를 처리하기 위해 동적 신뢰구간 너비 조정이 이루어진다.
  • 이론적 분석은 RKHS 노름 제약과 커널에 의존하는 정보 이득 $\gamma_T$를 활용하여 누적 오차를 경계한다.
  • 두 인스턴스 간의 탐색 균형 조정을 통해 알려지지 않은 오염 수준에 적응하며, 오염된 데이터에 과도하게 의존하는 것을 방지한다.
  • 새로운 오차 분석을 통해 누적 오차가 $\tilde{O}(C\sqrt{T})$로 스케일링됨을 입증하며, $\tilde{O}$는 $T$에 대한 로그 인자를 숨긴다.

실험 결과

연구 질문

  • RQ1악성 오염이 함수 평가에 존재할 경우, GP 기반 밴디트 알고리즘이 비선형 오차를 유지할 수 있는가?
  • RQ2커널 기반 밴디트 최적화에서 오차 경계에 대한 $C$에 대한 선형 의존성은 피할 수 없는가?
  • RQ3유한 액션 밴디트에서의 빠른-느린 패러다임을 무한 액션, 상관관계가 있는 함수 공간으로 어떻게 적응시킬 수 있는가?
  • RQ4알려지지 않은 오염 수준이 존재할 경우, 강건성과 효율성 사이의 최적의 트레이드오프는 무엇인가?
  • RQ5특성별 갭에 독립적인 오차 경계를 만들 수 있는가, 동시에 일반 커널에 대해 비트리비얼한 결과를 도출할 수 있는가?

주요 결과

  • Fast-Slow GP-UCB의 누적 오차는 $\tilde{O}(C\sqrt{T})$로 경계되며, $C$가 일정할 경우 기존의 비오염된 경계와 일치한다.
  • 최악의 경우에서 $C$에 대한 선형 의존성이 불가피함이 입증되어 이 문제에 대한 기본 하한을 설정한다.
  • 오염 수준이 알려져 있지 않더라도 오염된 환경과 비오염된 환경 모두에서 성능 균형을 달성한다.
  • 선형 커널의 경우, 갭이 일정할 경우 [Li 등, 2019]의 특성별 로그 오차 경계와 일치하지만, 최악의 갭 상황에서는 여전히 비선형이다.
  • 모든 함수 평가의 부분집합에 영향을 줄 수 있는 악성 오염에 대해 강건하며, 특히 RKHS에서 상호관계가 높은 점들을 공격하는 적대적 공격에도 강건하다.
  • 분석을 통해 함수 값 간의 상관관계는 비오염 환경에서는 유리하지만, 악성 오염 상황에서는 피해를 악화시킬 수 있음을 확인하였으며, 이는 별도의 알고리즘 설계가 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.