[논문 리뷰] Optimal Rates of (Locally) Differentially Private Heavy-tailed Multi-Armed Bandits
이 논문은 유한한 $(1+v)$-차 모멘트를 가지는 무거운 尾 꼬리 분포를 가진 보상 분포 하에서 국소적 및 중심 집중적 비밀 보장 다각도 밴딧 문제에 대해 최적의 알고리즘을 제안한다. $v \in (0,1]$이다. 비밀 보장되고 강건한 UCB 및 성공적 제거 알고리즘의 변형을 도입하여, 정보 이론적 하한선에 맞는 인스턴스에 의존하는 손실 한계를 달성하며, $\epsilon$-LDP 모델에서 높은 정밀도 $O(\frac{1}{\epsilon^2} \sum_{\Delta_a > 0} (\frac{1}{\Delta_a})^{1/v})$ 를 달성한다.
In this paper we investigate the problem of stochastic multi-armed bandits (MAB) in the (local) differential privacy (DP/LDP) model. Unlike previous results that assume bounded/sub-Gaussian reward distributions, we focus on the setting where each arm's reward distribution only has $(1+v)$-th moment with some $v\in (0, 1]$. In the first part, we study the problem in the central $ε$-DP model. We first provide a near-optimal result by developing a private and robust Upper Confidence Bound (UCB) algorithm. Then, we improve the result via a private and robust version of the Successive Elimination (SE) algorithm. Finally, we establish the lower bound to show that the instance-dependent regret of our improved algorithm is optimal. In the second part, we study the problem in the $ε$-LDP model. We propose an algorithm that can be seen as locally private and robust version of SE algorithm, which provably achieves (near) optimal rates for both instance-dependent and instance-independent regret. Our results reveal differences between the problem of private MAB with bounded/sub-Gaussian rewards and heavy-tailed rewards. To achieve these (near) optimal rates, we develop several new hard instances and private robust estimators as byproducts, which might be used to other related problems. Finally, experiments also support our theoretical findings and show the effectiveness of our algorithms.
연구 동기 및 목표
- 이전 연구에서 유한한 보상 또는 서브-가우시안 보상 분포를 가정하는 반면, 무거운 꼬리 보상 분포 하에서 비밀 보장 밴딧 학습에 대한 격차를 메우기 위해.
- $(1+v)$-차 모멘트 조건 하에서 스위치 다각도 밴딧 문제에 대해 비밀 보장되고 강건한 알고리즘을 개발하기 위해. $v \in (0,1]$이다.
- $\epsilon$-DP 및 $\epsilon$-LDP 모델 모두에서 인스턴스에 의존하는 및 인스턴스에 독립적인 손실 한계를 확립하기 위해.
- 제안된 알고리즘의 최적성을 입증하기 위해 이론적 하한선을 제공하기 위해.
- 다른 비밀 보장 학습 문제로 일반화될 수 있는 새로운 비밀 보장 강건 추정기 및 어려운 인스턴스를 설계하기 위해.
제안 방법
- $\epsilon$-DP 모델에 대해 비밀 보장되고 강건한 상한 신뢰도(UCB) 알고리즘을 제안하며, 비밀 보장성을 확보하기 위해 노이즈 주입을 통합하면서도, 무거운 꼬리 보상에 강건성을 유지한다.
- $\epsilon$-DP 모델에서 성능 향상을 위해 성공적 제거(SE) 알고리즘의 비밀 보장되고 강건한 변형을 도입한다.
- $\epsilon$-LDP 모델에서 국소적으로 비밀 보장되고 강건한 SE 알고리즘을 설계하여, 데이터 수집 수준에서의 비밀 보장을 보장한다.
- 무거운 꼬리 분포 하에서 평균을 정확히 추정하면서도 비밀 보장을 유지하기 위해 비밀 보장 강건 추정기를 활용한다.
- 정보 이론적 하한선을 입증하기 위해 새로운 어려운 인스턴스를 구축하며, 제안된 알고리즘의 최적성을 입증한다.
- $\epsilon$-LDP 설정에서 기대 손실의 하한선을 유도하기 위해 Bretagnolle-Hubert 부등식과 KL 발산 분석을 적용한다.
실험 결과
연구 질문
- RQ1무거운 꼬리 보상 분포를 가진 비밀 보장 다각도 밴딧 문제에서, 유한한 $(1+v)$-차 모멘트 조건 하에서 최적의 인스턴스에 의존하는 손실 속도는 무엇인가?
- RQ2유한하거나 서브-가우시안 가정에 비해, 무거운 꼬리 보상 하에서 비밀 보장 밴딧 알고리즘의 성능은 어떻게 저하되는가?
- RQ3UCB 및 성공적 제거 알고리즘의 비밀 보장되고 강건한 변형은 $\epsilon$-DP 및 $\epsilon$-LDP 모두에서 근사 최적의 손실을 달성할 수 있는가?
- RQ4무거운 꼬리 보상 하에서 비밀 보장 밴딧 학습의 정보 이론적 한계는 무엇이며, 실용적인 알고리즘이 이를 따라잡을 수 있는가?
- RQ5비밀 보장 조건 하에서 무거운 꼬리 보상을 다루기 위해 필요한 새로운 비밀 보장 강건 추정 기법은 무엇인가?
주요 결과
- 제안된 비밀 보장되고 강건한 UCB 알고리즘은 $\epsilon$-DP 모델에서 인스턴스에 의존하는 손실을 $O\left(\frac{1}{\epsilon} \sum_{\Delta_a > 0} \left(\frac{1}{\Delta_a}\right)^{1/v} \right)$ 으로 달성한다.
- $\epsilon$-DP 모델에서 향상된 비밀 보장되고 강건한 SE 알고리즘은 하한선 $\Omega\left(\frac{1}{\epsilon} \sum_{\Delta_a > 0} \left(\frac{1}{\Delta_a}\right)^{1/v} \right)$ 와 일치하며, 인스턴스 수준의 최적성을 입증한다.
- $\epsilon$-LDP 모델에서 제안된 알고리즘은 인스턴스에 의존하는 손실을 $O\left( \frac{1}{\epsilon^2} \sum_{\Delta_a > 0} \left(\frac{1}{\Delta_a}\right)^{1/v} \right)$ 으로 달성하며, 하한선 $\Omega\left( \frac{1}{\epsilon^2} \sum_{\Delta_a > 0} \left(\frac{1}{\Delta_a}\right)^{1/v} \right)$ 와 일치한다.
- 인스턴스에 독립적인 손실의 경우, $\epsilon$-LDP 알고리즘은 $O\left( \left(\frac{K \log T}{\epsilon^2} \right)^{v/(1+v)} T^{1/(1+v)} \right)$ 를 달성하며, 하한선 $\Omega\left( \left(\frac{K}{\epsilon^2} \right)^{v/(1+v)} T^{1/(1+v)} \right)$ 와 일치한다.
- 논문은 새로운 어려운 인스턴스와 비밀 보장 강건 추정기를 구축하였으며, 이는 하한선 입증에 핵심적인 역할을 하며, 다른 비밀 보장 학습 문제에서 재사용될 수 있다.
- 실험 결과 이론적 결과를 확인하였으며, 제안된 알고리즘이 비밀 보장 조건 하에서 무거운 꼬리 보상을 효과적으로 다룰 수 있음을 보여주며, DP 및 LDP 설정 모두에서 기준 방법보다 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.