[논문 리뷰] Multi-party Poisoning through Generalized $p$-Tampering
이 논문은 다수의 당사자에 의한 데이터 풀링 공격을 위한 일반화된 $p$-변형 모델을 제안하며, 악성 공격자가 $m$개의 데이터 제공자 중 $k$명을 제어하고, $p$-근접성 제약 조건 내에서 그들의 데이터를 조작한다. 이 모델은 이러한 공격이 모델의 오차를 $\Omega(p \cdot k/m)$ 만큼 증가시킬 수 있음을 증명하며, 다항시간 실행이 가능하고, 데이터가 노이즈가 없을 경우 잘못된 레이블이 필요하지 않다.
In a poisoning attack against a learning algorithm, an adversary tampers with a fraction of the training data $T$ with the goal of increasing the classification error of the constructed hypothesis/model over the final test distribution. In the distributed setting, $T$ might be gathered gradually from $m$ data providers $P_1,\dots,P_m$ who generate and submit their shares of $T$ in an online way. In this work, we initiate a formal study of $(k,p)$-poisoning attacks in which an adversary controls $k\in[n]$ of the parties, and even for each corrupted party $P_i$, the adversary submits some poisoned data $T'_i$ on behalf of $P_i$ that is still $(1-p)$-close to the correct data $T_i$ (e.g., $1-p$ fraction of $T'_i$ is still honestly generated). For $k=m$, this model becomes the traditional notion of poisoning, and for $p=1$ it coincides with the standard notion of corruption in multi-party computation. We prove that if there is an initial constant error for the generated hypothesis $h$, there is always a $(k,p)$-poisoning attacker who can decrease the confidence of $h$ (to have a small error), or alternatively increase the error of $h$, by $\Omega(p \cdot k/m)$. Our attacks can be implemented in polynomial time given samples from the correct data, and they use no wrong labels if the original distributions are not noisy. At a technical level, we prove a general lemma about biasing bounded functions $f(x_1,\dots,x_n)\in[0,1]$ through an attack model in which each block $x_i$ might be controlled by an adversary with marginal probability $p$ in an online way. When the probabilities are independent, this coincides with the model of $p$-tampering attacks, thus we call our model generalized $p$-tampering. We prove the power of such attacks by incorporating ideas from the context of coin-flipping attacks into the $p$-tampering model and generalize the results in both of these areas.
연구 동기 및 목표
- 악성 공격자가 $k$명의 데이터 제공자를 제어하고, $p$-근접성 제약 조건 내에서 그들의 데이터를 변형하는 새로운 다수의 당사자에 의한 데이터 풀링 공격 모델을 체계화하는 것.
- 분산 학습 환경에서 이러한 공격이 결과로 도출된 가설의 신뢰도와 오차에 미치는 영향을 분석하는 것.
- 코인 플립핑에서 유한 함수로의 $p$-변형 모델을 일반화하여, 데이터 풀링에 더 넓은 적용 가능성을 제공하는 것.
- 각 당사자에 대한 손상이 제한되어 있음에도 불구하고(진실된 데이터로부터 $1-p$-근접), 악성 공격자가 모델 성능을 심각하게 악화시킬 수 있음을 입증하는 것.
- 원본 데이터가 깨끗할 경우 노이즈가 있는 레이블이 필요 없이도 작동하는 다항시간 공격 전략을 개발하는 것.
제안 방법
- 악성 공격자가 각 데이터 제공자 $P_i$ 를 부분적으로 제어하는 일반화된 $p$-변형 모델을 제안하며, $p$ 확률로 변형을 수행하고, $1-p$ 비율의 정직한 데이터를 유지한다.
- 모델 오차를 변형된 입력의 함수로 모델링하는 바탕이 되는 유한 함수 $f(x_1, \dots, x_n) \in [0,1]$ 에 대한 공격을 편향 기반 메커니즘으로 설정한다.
- 코인 플립핑 공격에서 유래한 기법을 활용하여, $p$-변형 제약 조건 하에서 모델 오차를 체계적으로 증가시키는 악성 변형을 구성한다.
- 기존의 $p$-변형 및 다수의 당사자 계산 분야의 결과를 확장하여, 부분적이고 온라인 제어 하에서 유한 함수의 편향을 다루는 일반 레미마를 증명한다.
- 각 변형된 당사자 $P_i$ 에 대해, $T_i$ 에 대해 $1-p$-근접한 풀링된 데이터 $T'_i$ 를 생성하는 다항시간 알고리즘을 설계한다.
- 원본 데이터 분포에 노이즈가 없더라도 공격의 효과가 유지되도록 하며, 레이블 풀링이 필요 없도록 한다.
실험 결과
연구 질문
- RQ1악성 공격자가 각 당사자가 대부분 정직한 데이터를 제출하는 $p$-근접성 제약 조건 하에서 다수의 당사자에 의한 데이터 풀링 공격을 체계화할 수 있는가?
- RQ2이러한 일반화된 $p$-변형 모델 하에서 모델 오차의 최대 증가율은 얼마인가?
- RQ3공격 강도는 변형된 당사자 수 $k$ 와 변형 확률 $p$ 에 따라 어떻게 변화하는가?
- RQ4노이즈가 있는 레이블에 의존하지 않고도 이러한 공격을 효율적으로(다항시간 내에) 구현할 수 있는가?
- RQ5코인 플립핑 공격에서 유래한 기법을 유한한 데이터 변형 하에서 학습 모델의 편향에 적용할 수 있는가?
주요 결과
- 논문은 $(k,p)$-풀링 공격자가 모델 오차를 $\Omega(p \cdot k/m)$ 만큼 증가시킬 수 있음을 증명하며, 엄격한 근접성 제약 조건 하에서도 비차별적인 공격 이점을 입증한다.
- 정확한 데이터 분포에서의 샘플에 접근할 수 있는 경우, 공격는 다항시간 내로 계산 가능하다.
- 원본 데이터에 노이즈가 없을 경우, 어떤 레이블 손상도 필요 없으며, 오직 입력 데이터 조작에 의존한다.
- 이 공격 모델은 기존의 풀링 공격과 다수의 당사자 계산에서의 $p$-변형을 모두 일반화하여, 두 연구 분야를 통합한다.
- 부분적이고 온라인 제어 하에서 유한 함수의 편향을 다루는 일반 레미마를 증명하며, 이는 악성 영향의 함수로서 모델 오차 분석을 가능하게 한다.
- 각 당사자에 대한 변형이 제한되어 있음에도 불구하고(진실된 데이터로부터 $1-p$-근접), 악성 공격자는 모델 신뢰도와 성능을 심각하게 악화시킬 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.