[논문 리뷰] Privacy Preserving ID3 over Horizontally, Vertically and Grid Partitioned Data
이 논문은 개인정보 보호를 위한 ID3 의사결정 트리 학습을 격자형으로 분할된 데이터(수직 및 수평 분할 모두 포함)에 대해 보안 다자간 계산을 사용하여 제안한다. 두 가지 프로토콜을 도입한다: 먼저 수평으로 병합한 후 수직으로 처리하거나, 그 반대 순서로 처리하며, 복잡도 분석을 통해 수평 병합을 먼저 하는 것이 보다 효율적임을 입증한다. 이는 보다 최적화된 보안 계산과 비용이 많이 드는 회로 기반 프로토콜에 대한 의존도 감소로 인해 가능하다.
We consider privacy preserving decision tree induction via ID3 in the case where the training data is horizontally or vertically distributed. Furthermore, we consider the same problem in the case where the data is both horizontally and vertically distributed, a situation we refer to as grid partitioned data. We give an algorithm for privacy preserving ID3 over horizontally partitioned data involving more than two parties. For grid partitioned data, we discuss two different evaluation methods for preserving privacy ID3, namely, first merging horizontally and developing vertically or first merging vertically and next developing horizontally. Next to introducing privacy preserving data mining over grid-partitioned data, the main contribution of this paper is that we show, by means of a complexity analysis that the former evaluation method is the more efficient.
연구 동기 및 목표
- 데이터가 동시에 수직 및 수평으로 분할되어 있는 상황에서 개인정보 보호 의사결정 트리 유도 문제를 해결하기 위해, 현실 세계에서 흔하지만 아직 연구가 부족한 케이스를 다루기 위함.
- 기존 문헌에서 처음으로 수평 및 수직 데이터 분포를 결합한 격자형으로 분할된 데이터의 개념을 체계화하기 위함.
- 이전에 수평 또는 수직 분포에만 국한되어 있던 개인정보 보호 ID3 프로토콜을 더 복잡한 격자형으로 분할된 환경에서도 처리할 수 있도록 확장하기 위함.
- 격자형으로 분할된 데이터에 대한 두 가지 평가 전략을 비교하기 위함: 먼저 수평으로 병합하고 나서 수직으로 처리하는 것과 그 반대 순서.
- 계산 및 통신 비용 측면에서 어느 프로토콜 전략이 더 효율적인지 보여주는 복잡도 분석 제공
제안 방법
- 이 논문은 수평 분할된 데이터에 대해 두 명 이상의 당사자 간에 보안 다자간 계산 프로토콜을 도입하며, 보안 집합 합집합과 암호화된 계산을 사용한다.
- 격자형으로 분할된 데이터의 경우, 두 가지 프로토콜을 제안한다: 먼저 파티 간 수평 병합을 수행한 후 수직 계산을 수행하는 프로토콜과, 그 순서를 반대로 하는 프로토콜.
- 보안 집합 교차의 크기를 사용하여 분산된 당사자 간에 클래스 및 속성 값 별 거래 수를 계산함으로써 개인정보를 보호한다.
- 이웃 당사자 간에 공유 암호화 키를 사용하여 유니온 이후 중복된 보안 집합 교차 연산을 방지함으로써 효율성을 향상시킨다.
- 엔트로피의 보안 계산을 위해 $x\ln{x}$ 프로토콜을 사용하며, 이는 회로 기반 방법으로 근사화되며, 더 큰 그룹의 경우 보안 합계 프로토콜을 사용할 수 있다.
- 복잡도는 데이터 크기, 당사자 수, 속성 수, 클래스 수를 기반으로 계산 및 통신 비용 측면에서 분석하며, 수식을 유도한다.
실험 결과
연구 질문
- RQ1다수의 당사자 간에 수직 및 수평으로 분할된 데이터가 존재할 때, ID3를 사용하여 개인정보 보호를 위한 의사결정 트리를 안전하게 구축하는 것이 가능한가?
- RQ2먼저 수평으로 데이터를 병합하고 나서 수직으로 처리하는 것과 그 반대 순서의 경우, 계산 및 통신 비용은 어떻게 비교되는가?
- RQ3이웃 당사자 간에 암호화 키를 재사용함으로써 격자형으로 분할된 환경에서 보안 다자간 계산 기법을 최적화할 수 있는가?
- RQ4근사화된 보안 프로토콜(예: $x\ln{x}$)을 사용할 경우 개인정보 보호 의사결정 트리 유도의 정확성과 효율성에 어떤 영향을 미치는가?
- RQ5격자형으로 분할된 데이터에서 보안 계산의 복잡도는 당사자 수, 속성 수, 클래스 수에 따라 어떻게 증가하는가?
주요 결과
- 수평 분할된 데이터에 대한 개인정보 보호 ID3 프로토콜은 두 명 이상의 당사자 간에도 성공적으로 확장되었으며, 보안성과 정확성을 유지한다.
- 본 연구는 개인정보 보호 데이터 마이닝 분야에서 이전에 다루지 않은 설정이었던, 수평 및 수직 데이터 분포를 결합한 격자형으로 분할된 데이터의 개념을 공식적으로 정의하고 도입한다.
- 복잡도 분석 결과, 먼저 수평으로 데이터를 병합하고 나서 수직으로 처리하는 것이 반대 순서에 비해 더 낮은 계산 및 통신 비용을 유도한다.
- 수평 우선 접근 방식은 $x\ln{x}$와 같은 비용이 많이 드는 회로 기반 프로토콜의 사용을 줄여 실질적으로 더 효율적이다.
- 이웃 당사자 간에 암호화 키를 재사용함으로써, 유니온 이후 중복된 보안 집합 교차 연산을 방지하여 효율성이 크게 향상된다.
- 수평 우선 프로토콜의 통신 비용은 $O(|R|(v+d)(h^{2}|T|t))$이며, 계산 비용은 $O(|R|(v+d+m)(h^{2}|T|t^{3}))$로, 수직 우선 대비 모두 낮다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.