[논문 리뷰] Simultaneous Discrimination Prevention and Privacy Protection in Data Publishing and Mining
이 논문은 데이터 공개 및 마이닝에서 동시에 차별 방지와 프라이버시 보호를 위한 통합 프레임워크를 제안한다. 규칙 보호 및 전체 도메인 일반화와 같은 변환 기법을 도입하여 데이터 유용성을 유지하면서 직접적·간접적 차별을 제거하고 k-익명성을 확보하며, 프라이버시 전용 솔루션 대비 최소한의 성능 오버헤드를 유발한다.
Data mining is an increasingly important technology for extracting useful knowledge hidden in large collections of data. There are, however, negative social perceptions about data mining, among which potential privacy violation and potential discrimination. Automated data collection and data mining techniques such as classification have paved the way to making automated decisions, like loan granting/denial, insurance premium computation. If the training datasets are biased in what regards discriminatory attributes like gender, race, religion, discriminatory decisions may ensue. In the first part of this thesis, we tackle discrimination prevention in data mining and propose new techniques applicable for direct or indirect discrimination prevention individually or both at the same time. We discuss how to clean training datasets and outsourced datasets in such a way that direct and/or indirect discriminatory decision rules are converted to legitimate (non-discriminatory) classification rules. In the second part of this thesis, we argue that privacy and discrimination risks should be tackled together. We explore the relationship between privacy preserving data mining and discrimination prevention in data mining to design holistic approaches capable of addressing both threats simultaneously during the knowledge discovery process. As part of this effort, we have investigated for the first time the problem of discrimination and privacy aware frequent pattern discovery, i.e. the sanitization of the collection of patterns mined from a transaction database in such a way that neither privacy-violating nor discriminatory inferences can be inferred on the released patterns. Moreover, we investigate the problem of discrimination and privacy aware data publishing, i.e. transforming the data, instead of patterns, in order to simultaneously fulfill privacy preservation and discrimination prevention.
연구 동기 및 목표
- 데이터 마이닝 및 공개에서 프라이버시 침해와 차별적 결과라는 이중적 위협을 해결한다.
- 학습 데이터셋과 공개된 데이터에서 직접적·간접적 차별을 탐지하고 제거할 수 있는 방법을 개발한다.
- 프라이버시 보존 기법(예: k-익명성)과 차별 인지 변환 기법을 통합하여 종합적 보호를 달성한다.
- 도입된 보호 조치가 데이터 유용성 또는 성능을 크게 떨어뜨리지 않도록 보장한다.
- 기술적 보호 조치를 개인정보 보호 및 비차별 규정 기준과 일치시켜 데이터 공개의 법적·윤리적 준수를 가능하게 한다.
제안 방법
- 직접 규칙 보호(DRP)와 규칙 일반화(RG)를 제안하여 분류 규칙을 변환하고 직접적 차별을 제거한다.
- 간접 규칙 보호(IRP)를 도입하여 비차별적 속성과 보호 대상 집단 간의 상관관계를 탐지하고 완화한다.
- 직접적·간접적 차별 방지를 동시에 위한 통합 변환 파이프라인을 개발한다.
- k-익명성 원칙을 응용하여 α-보호를 구현함으로써 일반화가 프라이버시 보존과 동시에 차별 회피를 달성하도록 한다.
- α-보호 모델을 Incognito 알고리즘과 통합하여 k-익명성이며 차별 보호가 된 데이터 배포를 생성한다.
- 차별성과 프라이버시를 동시에 고려한 빈번한 패턴 탐색을 위해 미세한 차별성과 전체 도메인 일반화를 적용하여, 공개된 패턴에서 프라이버시 침해 또는 차별적 추론이 유도되지 않도록 보장한다.
실험 결과
연구 질문
- RQ1데이터 마이닝에서 직접적·간접적 차별을 동시에 탐지하고 완화하면서 데이터 유용성이 떨어지지 않도록 할 수 있는가?
- RQ2k-익명성 기반 일반화 기법을 어떻게 확장하여 공개된 데이터셋에서의 차별 방지를 동시에 달성할 수 있는가?
- RQ3프라이버시 보존 데이터 공개 기법을 어떻게 개선하여 프라이버시 유출과 차별적 추론을 동시에 방지할 수 있는가?
- RQ4단독 프라이버시 보호 대비 통합된 프라이버시 및 차별 방지 변환을 적용할 경우 성능 및 유용성 비용은 얼마나 되는가?
- RQ5공개된 출력에서 빈번한 패턴 마이닝을 어떻게 프라이버시 인지적이고 차별 인지적으로 만들 수 있는가?
주요 결과
- 제안된 α-보호 메커니즘은 k-익명성과 차별 방지를 성공적으로 통합하였으며, 표준 k-익명화 수준과 유사한 데이터 왜곡을 기록하였다.
- k-익명성의 전체 도메인 일반화 중 α-보호가 적용된 하위 집합은 표준 k-익명화와 거의 동일한 데이터 유용성을 달성하여, 오버헤드가 매우 낮음을 시사한다.
- α-보호 버전의 Incognito 알고리즘은 프라이버시 보장과 비차별성 확보가 동시에 이루어진 데이터 배포를 생성하였으며, 실행 시간은 원본 Incognito와 유사하였다.
- 빈번한 패턴 마이닝에 프라이버시 및 차별 방지 기법을 통합함으로써, 공개된 패턴에서 프라이버시 침해나 차별적 추론이 유도되지 않음을 보장하였다.
- 실험 결과, 동시에 프라이버시와 차별 방지를 적용할 경우 데이터 품질에 미치는 영향은 최소한이었으며, 프라이버시 전용 보호 대비 略로 높은 수준이었다.
- 법적으로 근거를 지닌 차별 조치를 데이터 변환에 통합함으로써, 이 프레임워크는 법적 준수를 지원하며 윤리적인 데이터 공개를 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.