Skip to main content
QUICK REVIEW

[論文レビュー] (Locally) Differentially Private Combinatorial Semi-Bandits

Xiaoyu Chen, Kai Zheng|arXiv (Cornell University)|Jun 1, 2020
Advanced Bandit Algorithms Research参考文献 37被引用数 4
ひとこと要約

本稿は、$B_\infty$-および$B_1$-有界滑らかさ仮定の下で、組合せ的セミバンディットに対する微分プライバシーを満たすアルゴリズムを提案し、非プライベートなレートにほぼ一致する近似的最適なレグレットバウンドを達成する。プライバシーの追加コストがこれらの設定においては発生しないことが示され、$\varepsilon$-LDP下での最適バウンドは$\Theta(\frac{mB^{2}_{\infty}\ln T}{\varepsilon^{2}\Delta})$、$\varepsilon$-DP下での最適バウンドは$\tilde{\Theta}(\frac{mB^{2}_{\infty}\ln T}{\varepsilon\Delta})$、$B_1$-有界滑らかさの下での$\varepsilon$-DP下での最適バウンドは$\tilde{\Theta}(\frac{mKB^{2}_{1}\ln T}{\varepsilon\Delta})$である。

ABSTRACT

In this paper, we study Combinatorial Semi-Bandits (CSB) that is an extension of classic Multi-Armed Bandits (MAB) under Differential Privacy (DP) and stronger Local Differential Privacy (LDP) setting. Since the server receives more information from users in CSB, it usually causes additional dependence on the dimension of data, which is a notorious side-effect for privacy preserving learning. However for CSB under two common smoothness assumptions \cite{kveton2015tight,chen2016combinatorial}, we show it is possible to remove this side-effect. In detail, for $B_{\infty}$-bounded smooth CSB under either $\varepsilon$-LDP or $\varepsilon$-DP, we prove the optimal regret bound is $Θ(\frac{mB^2_{\infty}\ln T } {Δε^2})$ or $ ildeΘ(\frac{mB^2_{\infty}\ln T} { Δε})$ respectively, where $T$ is time period, $Δ$ is the gap of rewards and $m$ is the number of base arms, by proposing novel algorithms and matching lower bounds. For $B_1$-bounded smooth CSB under $\varepsilon$-DP, we also prove the optimal regret bound is $ ildeΘ(\frac{mKB^2_1\ln T} {Δε})$ with both upper bound and lower bound, where $K$ is the maximum number of feedback in each round. All above results nearly match corresponding non-private optimal rates, which imply there is no additional price for (locally) differentially private CSB in above common settings.

研究の動機と目的

  • ローカルおよびグローバルな微分プライバシー(LDPおよびDP)設定下での組合せ的セミバンディット(CSB)に対する微分プライバシーを満たすアルゴリズムの設計を目的とする。
  • 一般的な滑らかさ仮定($B_\infty$-有界および$B_1$-有界滑らかさ)の下でのプライベートCSBのレグレットバウンドの分析を目的とする。
  • CSBにおいて、プライバシーが非プライベートな最適レートを超えて追加のレグレットコストをもたらすかどうかを特定することを目的とする。
  • さまざまなプライバシーおよび滑らかさ条件の下で、レグレットの上界と下界がほぼ一致することを確立することを目的とする。

提案手法

  • プライベート合計およびツリー型集約技術を用いて、$\varepsilon$-LDPおよび$\varepsilon$-DP下での$B_\infty$-有界滑らかさCSBに対する新しいプライベートアルゴリズムを提案する。
  • $\varepsilon$-DP下での$B_1$-有界滑らかさCSBに対して、新たなアルゴリズムを導入し、$\mathcal{O}(\frac{mK^{2}B^{2}_{1}\ln T}{\Delta\varepsilon^{2}})$のレグレット上界を達成する。
  • Karwa & Vadhan (2017) に基づくカップリング論法を用いて、非最適なスーパー アームの選択回数の下界を導出する。
  • 最適、パブリック、補助的セットに分割された$m$個の基本アームを含む困難なインスタンスを構築し、$\varepsilon$-DP下での$B_1$-有界滑らかさCSBに対して$\Omega(\frac{mKB_{1}\ln T}{\varepsilon\Delta})$のレグレット下界を証明する。
  • スパースベクトル技法と逐次的に除外されるアームを用いて、プライベートCSBにおけるレグレットを低減する。非プライベートなSuccessive Eliminationにインspiredされている。
  • 滑らかさを活用して次元依存のレグレットの増大を回避する、プライベートMAB(構造的フィードバックあり)への新しい還元を適用する。

実験結果

リサーチクエスチョン

  • RQ1組合せ的セミバンディットに対する微分プライバシーを満たすアルゴリズムは、非プライベートな最適レートに一致するレグレットバウンドを達成できるか?
  • RQ2フィードバックの次元(すなわち、$K$)は、$B_\infty$-有界滑らかさの下でのプライベートCSBにおいて避けられないレグレットペナルティをもたらすか?
  • RQ3$B_1$-有界滑らかさCSBの$\varepsilon$-DP下での最適レグレットバウンドは何か? また、$K$に追加的な依存なしに達成可能か?
  • RQ4$B_1$-有界滑らかさCSBの$\varepsilon$-DP下でのレグレット下界はタイトか? それとも、現在の下界に改善の余地があるか?

主な発見

  • $B_\infty$-有界滑らかさCSBの$\varepsilon$-LDP下での最適レグレットは$\Theta(\frac{mB^{2}_{\infty}\ln T}{\varepsilon^{2}\Delta})$であり、非プライベートレートに対数的要因を除いて一致する。
  • $\varepsilon$-DP下での$B_\infty$-有界滑らかさCSBの最適レグレットは$\tilde{\Theta}(\frac{mB^{2}_{\infty}\ln T}{\varepsilon\Delta})$であり、非プライベートバウンドにほぼ一致する。
  • $\varepsilon$-DP下での$B_1$-有界滑らかさCSBの最適レグレットは$\tilde{\Theta}(\frac{mKB^{2}_{1}\ln T}{\varepsilon\Delta})$であり、上界と下界が対数的要因を除いて一致する。
  • $\varepsilon$-DP下での$B_1$-有界滑らかさCSBのレグレット下界は$\Omega(\frac{mKB_{1}\ln T}{\varepsilon\Delta})$であり、対数的要因を除いてタイトである。
  • 提案された$\varepsilon$-DP下での$B_1$-有界滑らかさCSBのアルゴリズムは$\mathcal{O}(\frac{mK^{2}B^{2}_{1}\ln T}{\Delta\varepsilon^{2}})$のレグレットを達成しており、$K$依存性において上界と下界の間のギャップが示唆される。
  • 本稿は、下界が緩く、アルゴリズムが近似的に最適であると予想しており、$K$依存性のギャップは未解決の問題のまま残っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。