Skip to main content
QUICK REVIEW

[논문 리뷰] Differentially Private False Discovery Rate Control

Cynthia Dwork, Weijie Su|arXiv (Cornell University)|2018. 07. 11.
Privacy-Preserving Technologies in Data참고 문헌 71인용 수 11
한 줄 요약

이 논문은 다중 가설 검정에서 거짓 발견률(FDR)을 제어하기 위한 최초의 비밀유지적 절차인 PrivateBHq를 제안한다. 반복적으로 변환된 p-값에 노이즈를 추가하고 사전 선택 기법을 사용함으로써, 임의의 검정 통계량 간의 의존성 조건에서도 작은 곱셈 인자 이내로 FDR 제어를 유지하면서 종단 간 비밀유지성 보장이 가능하다.

ABSTRACT

Differential privacy provides a rigorous framework for privacy-preserving data analysis. This paper proposes the first differentially private procedure for controlling the false discovery rate (FDR) in multiple hypothesis testing. Inspired by the Benjamini-Hochberg procedure (BHq), our approach is to first repeatedly add noise to the logarithms of the $p$-values to ensure differential privacy and to select an approximately smallest $p$-value serving as a promising candidate at each iteration; the selected $p$-values are further supplied to the BHq and our private procedure releases only the rejected ones. Moreover, we develop a new technique that is based on a backward submartingale for proving FDR control of a broad class of multiple testing procedures, including our private procedure, and both the BHq step-up and step-down procedures. As a novel aspect, the proof works for arbitrary dependence between the true null and false null test statistics, while FDR control is maintained up to a small multiplicative factor.

연구 동기 및 목표

  • 유전체학과 같은 비밀유지가 필요한 애플리케이션에서 거짓 발견률(FDR)을 제어할 수 있는 비밀유지적 다중 가설 검정 절차를 개발하는 것.
  • 반복적 벤자민-호크베르그(BHq) 절차에 비밀유지성을 적용함에 있어 FDR 제어를 훼손하지 않도록 하는 과제를 해결하는 것.
  • 비밀유지 및 비비밀유지 버전을 포함한 광범위한 다중 가설 검정 절차에 적용 가능한 새로운 FDR 제어 증명 프레임워크를 수립하는 것.
  • 진술된 가설의 진정한 근본가설과 거짓 근본가설 간의 임의의 의존성 하에서도 FDR 제어가 유지됨을 입증하는 것 — 이는 이전의 가정보다 상당한 일반화이다.

제안 방법

  • 다중 검정 맥락에서 비밀유지성을 가능하게 하기 위해 p-값에 특화된 새로운 민감도 정의를 도입한다.
  • BHq의 단계적 상향 방식을 모방하기 위해 p-값의 로그에 반복적으로 노이즈를 추가하여 후보 임계치를 사전적으로 선택한다.
  • 일반적인 다중 가설 검정 절차(비밀유지 및 비비밀유지 버전 포함)에 대한 FDR 제어를 증명하기 위해 뒤로 향하는 하위마르팅게일 기법을 활용한다.
  • 종단 간 비밀유지 보장을 확보하기 위해 비밀유지의 구성 정리들을 적용한다.
  • 효율성을 유지하면서도 비밀성과 FDR 제어를 유지하기 위해 m′ = 100에서 잘라내기 메커니즘을 구현한다.
  • 사용자 정의된 비밀유지적 벗기기 기법을 활용하여 순차적으로 가설을 식별하고 기각함으로써 비밀 손실을 통제한다.

실험 결과

연구 질문

  • RQ1검정 통계량 간의 임의의 의존성 하에서도 FDR 제어를 유지할 수 있는 비밀유지적 다중 가설 검정 절차를 구성할 수 있는가?
  • RQ2BHq 절차의 반복적 구조를 비밀유지성 조건을 만족시키도록 어떻게 적응시킬 수 있으며, 이로 인해 통계적 능력이 손상되지 않도록 할 수 있는가?
  • RQ3기존 방법이 실패할 경우 비밀유지적 다중 가설 검정 절차의 FDR 제어를 입증하기 위해 어떤 새로운 증명 기법이 필요한가?
  • RQ4진짜 영향 요소의 수가 증가하거나 비밀 파rameter가 감소함에 따라 비밀유지 절차의 성능이 얼마나 떨어지는가?
  • RQ5진정한 근본가설과 거짓 근본가설 간의 의존성 구조가 알려지지 않거나 복잡한 경우에도 PrivateBHq의 FDR 제어가 유지되는가?

주요 결과

  • PrivateBHq는 이론적 보장이 k ≥ 2에 대해서만 적용되지만, 모든 시험 케이스에서 목표 수준 q에서 FDR를 경험적으로 제어한다.
  • 비밀 파rameter ε가 너무 작지 않고 η가 너무 크지 않은 경우, PrivateBHq의 검정 능력은 비비밀 유지 BHq와 유사하다.
  • PrivateBHq는 BHq보다 더 적은 가설을 발견하지만, 더 낮은 FDR을 유지함으로써 비밀성과 오류 제어 사이의 유리한 트레이드오프를 보여준다.
  • FWER 제어를 위한 기준선으로 사용된 PrivateBonf는 BHq와 PrivateBHq보다 항상 낮은 검정 능력을 보이며, 비밀유지 환경에서 FWER 제어의 비효율성을 확인한다.
  • 진짜 영향 요소의 수가 150을 초과할 경우, 선택 과정에서 고정된 m′ = 100에서의 잘라내기로 인해 PrivateBHq의 검정 능력이 저하된다.
  • 뒤로 향하는 하위마르팅게일 기반의 증명 기법은 진정한 근본가설과 거짓 근본가설 간의 임의의 의존성 하에서도 FDR 제어를 가능하게 하여, 이전의 가정보다 상당한 발전을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.