Skip to main content
QUICK REVIEW

[논문 리뷰] Generalized Linear Bandits with Local Differential Privacy

Yuxuan Han, Zhipeng Liang|arXiv (Cornell University)|2021. 06. 07.
Advanced Bandit Algorithms Research참고 문헌 32인용 수 6
한 줄 요약

이 논문은 일반화된 선형 밴디트 문제에 대해 국소적 미분적 보안(Loacl Differential Privacy, LDP) 알고리즘을 제안하며, 비공개 설정과 동일한 리그레트 한계를 달성한다. 확률적 경사 하강법(Stochastic Gradient Descent, SGD)과 일반 최소 제곱 추정기(Ordinary Least Squares, OLS)를 활용하여 프라이버시를 보장하는 업데이트 방식을 도입함으로써, LDP 하에서 최적의 리그레트 속도를 확립하였으며, 합성 데이터와 실제 자동 대출 데이터 모두에서 강력한 프라이버시 파rameter를 갖는 강력한 경험적 성능을 입증하였다.

ABSTRACT

Contextual bandit algorithms are useful in personalized online decision-making. However, many applications such as personalized medicine and online advertising require the utilization of individual-specific information for effective learning, while user's data should remain private from the server due to privacy concerns. This motivates the introduction of local differential privacy (LDP), a stringent notion in privacy, to contextual bandits. In this paper, we design LDP algorithms for stochastic generalized linear bandits to achieve the same regret bound as in non-privacy settings. Our main idea is to develop a stochastic gradient-based estimator and update mechanism to ensure LDP. We then exploit the flexibility of stochastic gradient descent (SGD), whose theoretical guarantee for bandit problems is rarely explored, in dealing with generalized linear bandits. We also develop an estimator and update mechanism based on Ordinary Least Square (OLS) for linear bandits. Finally, we conduct experiments with both simulation and real-world datasets to demonstrate the consistently superb performance of our algorithms under LDP constraints with reasonably small parameters $(\varepsilon, δ)$ to ensure strong privacy protection.

연구 동기 및 목표

  • 서버에서 사용자 데이터가 항상 비공개여야 하는 개인화된 온라인 의사결정 문제에서의 프라이버시 문제를 해결하기 위해.
  • 국소적 미분적 보안(LDP) 하에서 비공개 및 공개적 맥락 기반 밴디트 알고리즘 간의 리그레트 격차를 해소하기 위해.
  • 비공개 성능에 맞추어 효율적이고 프라이버시를 보장하는 일반화된 선형 밴디트 문제를 위한 학습 알고리즘을 설계하기 위해.
  • 강력한 프라이버시 제약 조건 하에서 시뮬레이션 및 실제 데이터 세트에서 제안된 방법을 검증하기 위해.

제안 방법

  • 일반화된 선형 밴디트 문제에서 국소적 미분적 보안(LDP)을 보장하기 위해 확률적 경사 기반 추정기와 업데이트 메커니즘을 개발한다.
  • 이론적 유연성을 활용하여, 일반화된 선형 밴디트 문제에 대해 프라이버시 보장을 갖춘 확률적 경사 하강법(SGD)을 적응적으로 적용한다.
  • LDP 하에서 선형 밴디트 문제에 대해 OLS 기반 추정기와 업데이트 메커니즘을 설계하여, 프라이버시를 확보하면서도 정확한 매개변수 추정을 보장한다.
  • 탐색, 이용, 프라이버시를 균형 잡기 위해 게리 알고리즘을 프라이빗 OLS 및 SGD 추정기와 통합한다.
  • KL 발산의 사슬 법칙과 농도 불등식을 활용하여 이론적 리그레트 한계를 유도한다.
  • 각 사용자의 맥락과 행동이 $(\varepsilon,\delta)$-LDP 하에서 보호되도록 보장하는 프라이빗 추정 프레임워크를 활용한다.

실험 결과

연구 질문

  • RQ1일반화된 선형 밴디트 문제에 대해 비공개 설정에서의 리그레트 속도와 동일한 리그레트 속도를 달성하는 LDP 알고리즘을 설계할 수 있는가?
  • RQ2밴디트 학습에서 강력한 국소적 미분적 보안을 확보하면서도 추정 정확도를 유지할 수 있는 방법은 무엇인가?
  • RQ3스토케스틱 일반화된 선형 밴디트 문제에서 프라이버시($\varepsilon$로 제어됨)와 리그레트 성능 사이의 최적의 트레이드오프는 무엇인가?
  • RQ4프라이빗 SGD와 OLS 추정기를 게리 탐색 전략과 효과적으로 통합하여 LDP 하에서 최적의 리그레트를 달성할 수 있는가?
  • RQ5제안된 프레임워크는 합성 및 실제 세계 설정 모두에서 기존의 LDP 밴디트 알고리즘을 초월하는가?

주요 결과

  • 제안된 LDP-SGD 및 LDP-GLOC 알고리즘은 단일 매개변수 스토케스틱 일반화된 선형 밴디트 설정에서 $\tilde{O}(T^{1/2}/\varepsilon)$ 리그레트를 달성하며, 비공개 설정의 한계와 동일하다.
  • 다중 매개변수 설정에서는 $\beta$-마진 조건 하에서 $\tilde{O}(T^{(1-\beta)/2}/\varepsilon^{1+\beta})$ 리그레트를 달성하며, $\beta \in [0,1)$이다.
  • $\beta = 1$ 특수 케이스에서는 리그레트 한계가 $O((\log T / \varepsilon)^2)$로 감소하며, 이는 LDP 하에서 다중 매개변수 케이스에 대해 최적이 된다.
  • 실제 자동 대출 데이터에 대한 실험 결과, $\varepsilon = 1$ 조건에서 LDP-SGD 및 LDP-GLOC가 비공개 및 이전의 LDP 기반 알고리즘보다 항상 리그레트 측면에서 뛰어난 성능을 보였다.
  • 이론적 분석을 통해 $\Omega(\sqrt{Td}/(e^{\varepsilon}-1))$의 하한선을 확립하여, 제안된 리그레트 속도의 최적성을 확인하였다.
  • 실제 적용 사례인 개인화된 대출과 같은 비선형 수익 구조(예: 로짓 수요 모델)에서도 프레임워크가 성공적으로 처리하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.