[논문 리뷰] Privacy-Preserving Contextual Bandits.
이 논문은 민감한 특성, 보상, 동작을 공유하지 않고도 다수의 당사자가 협업적으로 모델을 훈련시킬 수 있도록 보장하는 프라이버시 보장형 컨텍스트 밴디트 알고리즘을 제안한다. 보안 다자간 계산과 에프실론-그리디 탐색 기법을 조합함으로써, 분산 환경에서 누적 보상을 최대화하면서도 차별적 프라이버시를 보장하는 방법을 제공한다.
Contextual bandits are online learners that, given an input, select an arm and receive a reward for that arm. They use the reward as a learning signal and aim to maximize the total reward over the inputs. Contextual bandits are commonly used to solve recommendation or ranking problems. This paper considers a learning setting in which multiple parties aim to train a contextual bandit together in a private way: the parties aim to maximize the total reward but do not want to share any of the relevant information they possess with the other parties. Specifically, multiple parties have access to (different) features that may benefit the learner but that cannot be shared with other parties. One of the parties pulls the arm but other parties may not learn which arm was pulled. One party receives the reward but the other parties may not learn the reward value. This paper develops a privacy-preserving contextual bandit algorithm that combines secure multi-party computation with a differential private mechanism based on epsilon-greedy exploration in contextual bandits.
연구 동기 및 목표
- 민감한 특성, 동작 또는 보상을 폭 lộ하지 않고도 다수의 당사자가 컨텍스트 밴디트 모델을 협업적으로 훈련시킬 수 있도록 하는 것.
- 데이터를 공유할 수 없는 다자 환경에서 탐색 과정 동안 차별적 프라이버시를 유지하는 것.
- 어느 한 당사자도 어떤 암이 선택되었는지 또는 보상 값이 무엇인지 알 수 없도록 보장하는 것, 즉 특성을 기여한 당사자조차도 이를 알 수 없도록 하는 것.
- 분산된 당사자 간에 엄격한 프라이버시 제약 조건을 적용함에도 불구하고 높은 학습 성능(총 보상)을 유지하는 것.
- 실제 추천 및 랭킹 응용 분야에 적합한 실시간 적용을 고려하여, 보안 다자간 계산과 차별적 프라이버시를 컨텍스트 밴디트 프레임워크에 통합하는 것.
제안 방법
- 알고리즘은 보안 다자간 계산(MPC)을 사용하여 입력 또는 출력을 공유하지 않고도 모델 업데이트를 계산한다.
- 각 당사자는 모델에 특성을 기여하지만, 다른 당사자의 특성 또는 선택된 암을 알 수는 없다.
- 에프실론-그리디 탐색 전략을 적용하며, 탐색 결정은 차별적 프라이버시 메커니즘을 통해 흐리게 처리되어 행동 선택을 보호한다.
- 보상은 한 당사자가 수집하지만 다른 이들에게는 공개되지 않으며, 모델 업데이트에 사용되는 것은 오직 차별적 프라이버시 신호뿐이다.
- 이 방법은 모든 당사자의 데이터로부터 학습이 이루어지도록 하면서도, (에프실론, 델타)-차별적 프라이버시 보장을 충족한다.
- 다양한 특성 집합을 가진 다수의 당사자에게 스케일링 가능하도록 설계되었으며, 프라이버시와 유용성을 유지한다.
실험 결과
연구 질문
- RQ1다수의 당사자가 민감한 특성을 공유하지 않고도 컨텍스트 밴디트 모델을 협업적으로 훈련시킬 수 있는 방법은 무엇인가?
- RQ2어떤 메커니즘이 어느 당사자도 어떤 암이 선택되었는지 또는 보상 값이 무엇인지 알 수 없도록 보장하는가?
- RQ3컨텍스트 밴디트 환경에서 차별적 프라이버시를 보장하는 보안 다자간 계산과 효과적으로 통합될 수 있는가?
- RQ4프라이버시 보장 메커니즘이 비프라이버시 기반 모델에 비해 누적 보상에 어떤 영향을 미치는가?
- RQ5이 다자 환경에서 프라이버시(에프실론)와 학습 성능 사이의 상충 관계는 어떠한가?
주요 결과
- 제안된 방법은 모든 당사자에 대해 높은 누적 보상을 달성하면서도 차별적 프라이버시를 보장한다.
- 보안 다자간 계산의 사용으로 인해 어느 당사자도 다른 당사자의 특성, 행동 또는 보상에 대한 민감한 정보를 알 수 없게 된다.
- 에프실론-그리디 탐색과 차별적 프라이버시의 통합은 탐색 결정이 프라이버시 보장되고 통계적으로 보호됨을 보장한다.
- 특성이 공유되지 않으며 당사자 간 신뢰가 없더라도 알고리즘이 모델의 유용성을 유지한다.
- 다양한 데이터를 가진 다수의 당사자에게도 스케일링 가능하며, 학습 성능을 저하시키지 않으면서도 프라이버시를 보장한다.
- 실험 결과는 이 방법이 강력한 프라이버시 보장을 제공하면서도 경쟁 가능한 학습 성과를 달성함을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.