Skip to main content
QUICK REVIEW

[논문 리뷰] A Feasibility Study of Differentially Private Summary Statistics and Regression Analyses for Administrative Tax Data.

Andrés F. Barrientos, Aaron R. Williams|arXiv (Cornell University)|2021. 10. 22.
Privacy-Preserving Technologies in Data참고 문헌 53인용 수 6
한 줄 요약

이 논문은 민감한 행정세금 데이터를 위한 검증 서버를 구현하기 위해 차별적 비밀리성(DP) 기법을 사용할 수 있는지의 가능성을 평가한다. 요약 통계 및 회귀 분석을 위한 DP 기법을 제안하고 테스트한다. 결과적으로 DP 요약 통계는 수용할 만한 정확도로 실현 가능하지만, DP 회귀 추정치와 신뢰구간은 신뢰할 만한 사용을 위해 너무 정확도가 떨어진다.

ABSTRACT

Federal administrative tax data are invaluable for research, but because of privacy concerns, access to these data is typically limited to select agencies and a few individuals. An alternative to sharing microlevel data are validation servers, which allow individuals to query statistics without accessing the confidential data. This paper studies the feasibility of using differentially private (DP) methods to implement such a server. We provide an extensive study on existing DP methods for releasing tabular statistics, means, quantiles, and regression estimates. We also include new methodological adaptations to existing DP regression algorithms for using new data types and returning standard error estimates. We evaluate the selected methods based on the accuracy of the output for statistical analyses, using real administrative tax data obtained from the Internal Revenue Service Statistics of Income (SOI) Division. Our findings show that a validation server would be feasible for simple statistics but would struggle to produce accurate regression estimates and confidence intervals. We outline challenges and offer recommendations for future work on validation servers. This is the first comprehensive statistical study of DP methodology on a real, complex dataset, that has significant implications for the direction of a growing research field.

연구 동기 및 목표

  • 차별적 비밀리성(DP) 기법이 검증 서버를 통해 연방 행정세금 데이터에 안전하고 개인정보 보호를 고려한 접근을 가능하게 할 수 있는지 평가하기.
  • 실제 IRS SOI 데이터에 대해 표형 통계, 평균, 분위수 및 회귀 추정치를 공개하기 위한 DP 기법의 정확도 평가하기.
  • 기존 DP 회귀 알고리즘을 새 데이터 유형에 맞게 개선하고 표준 오차 추정치를 반환하도록 조정하기.
  • DP 제약 조건 하에서 정확한 회귀 출력을 달성하는 데 직면한 과제를 규명하고 향후 연구를 위한 권고안 제공하기.

제안 방법

  • 실제 행정세금 데이터 구조를 처리할 수 있도록 기존 DP 알고리즘을 표형 통계, 평균, 분위수에 맞게 수정하였다.
  • 신규 데이터 유형을 지원하고 표준 오차 추정치를 출력하도록 DP 회귀 알고리즘을 확장하여 통계적 추론의 유용성을 향상시켰다.
  • 사용자가 원시 마이크로데이터에 접근하지 않고도 DP 보호 통계를 질의할 수 있는 검증 서버 아키텍처를 구현하였다.
  • 실제 IRS 통계의 소득(SOI) 데이터를 사용하여 방법의 정확도를 평가하였으며, 요약 통계 및 회귀 출력의 오차를 측정하였다.
  • 다양한 DP 메커니즘(Laplace, Gaussian 등)과 노이즈 캘리브레이션 전략을 비교하여 비밀리성과 정확도의 균형을 확보하였다.
  • 유용성 손실을 최소화하면서도 차별적 비밀리성 보장을 확보하기 위해 프rivacy 예산(ε) 할당 전략을 사용하였다.

실험 결과

연구 질문

  • RQ1차별적 비밀리성 기법이 민감한 행정세금 데이터에 대해 정확한 요약 통계(예: 평균, 분위수, 카운트)를 생성할 수 있는가?
  • RQ2실제 IRS SOI 데이터에 적용했을 때 DP 회귀 알고리즘이 얼마나 신뢰할 수 있는 추정치와 표준 오차를 생성할 수 있는가?
  • RQ3프라이버시 예산(ε) 설정이 DP 통계 및 회귀 출력의 정확도에 어떤 영향을 미치는가?
  • RQ4세금 데이터에 대한 복잡한 통계 분석을 위한 DP 검증 서버를 구현하는 데 직면한 주요 과제는 무엇인가?
  • RQ5DP 기법이 개인의 개인정보를 유출하지 않으면서도 관리 데이터에 대한 의미 있는 통계적 추론을 지원할 수 있는가?

주요 결과

  • 차별적 비밀리성 요약 통계(예: 평균, 분위수 포함)는 수용할 수 있는 정확도로 공개할 수 있어 검증 서버에 실현 가능하다.
  • DP 회귀 추정치는 특히 작은 효과 크기와 고차원 모델에서 정확도 손실이 심각하게 나타났다.
  • DP 회귀 알고리즘에서 유도된 표준 오차 추정치는 자주 신뢰할 수 없었으며, 이는 신뢰구간의 유용성을 제한했다.
  • 프라이버시 예산(ε)이 감소할수록 DP 출력의 정확도가 심각하게 떨어졌으며, 특히 회귀 모델에서 그러한 경향이 두드러졌다.
  • DP 표형 통계는 잘 기능했지만, DP 회귀 분석의 방법론적 과제로 인해 현재 형태로는 고정밀도 추론에 적합하지 않다.
  • 이 연구는 DP 방법론에서 회귀 분석에 대한 핵심적 격차를 규명하였으며, 보호된 데이터에서 강력한 통계 분석을 가능하게 하기 위해 향후 연구가 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.