[논문 리뷰] An Improved Approach to High Level Privacy Preserving Itemset Mining
이 논문은 고수준 항목집합 마이닝에서의 프라이버시를 향상시키기 위해 가짜 거래 삽입과 거래당 항목 랜덤화를 조합한 향상된 트랜잭션 랜덤화 기법을 제안한다. 각 트랜잭션 내의 항목을 랜덤화 함수를 사용해 무작위 수로 대체하고, 합성 거래를 삽입함으로써 항목 수준의 정보를 은폐함으로써 프라이버시를 강화하면서도 정확한 빈도 높은 항목집합 및 연관 규칙 마이닝을 위한 반단조성 성질을 유지한다.
Privacy preserving association rule mining has triggered the development of many privacy preserving data mining techniques. A large fraction of them use randomized data distortion techniques to mask the data for preserving. This paper proposes a new transaction randomization method which is a combination of the fake transaction randomization method and a new per transaction randomization method. This method distorts the items within each transaction and ensures a higher level of data privacy in comparison to the previous approaches. The pertransaction randomization method involves a randomization function to replace the item by a random number guarantying privacy within the transaction also. A tool has also been developed to implement the proposed approach to mine frequent itemsets and association rules from the data guaranteeing the antimonotonic property.
연구 동기 및 목표
- 기존의 랜덤화된 데이터 왜곡 기법이 연관 규칙 마이닝 중 프라이버시를 유지하는 데 한계가 있음을 해결한다.
- 기존 방법이 트랜잭션 내 항목 수준의 프라이버시를 보호하지 못하는 취약성을 극복한다.
- 왜곡된 데이터에서 정확한 빈도 높은 항목집합 및 연관 규칙 마이닝을 가능하게 하기 위해 반단조성 성질을 유지한다.
- 제안된 프라이버시 보존 마이닝 접근법을 구현하고 평가하기 위한 실용적인 도구를 개발한다.
- 추출된 패턴의 유용성에 크게 영향을 주지 않으면서도 더 높은 수준의 프라이버시를 달성한다.
제안 방법
- 가짜 거래 삽입과 거래당 항목 랜덤화를 조합한 하이브리드 트랜잭션 랜덤화 방법을 도입한다.
- 각 트랜잭션 내의 개별 항목을 랜덤화 함수를 적용해 무작위 수로 대체하여 항목 수준의 정보를 은폐한다.
- 적용된 데이터의 패턴 재구성에 악영향을 주기 위해 데이터셋에 합성(가짜) 거래를 삽입한다.
- 랜덤화된 데이터가 반단조성 성질을 유지하도록 보장하여 유효한 빈도 높은 항목집합 마이닝을 가능하게 한다.
- 왜곡된 데이터를 처리하고 빈도 높은 항목집합 및 연관 규칙를 추출하기 위한 도구를 구현한다.
- 항목에서 수로의 매핑이 예측 불가능하도록 보장하는 제어된 랜덤화 함수를 사용한다.
실험 결과
연구 질문
- RQ1연관 규칙 마이닝 중 개별 트랜잭션 내 항목 수준의 프라이버시는 어떻게 향상시킬 수 있는가?
- RQ2가짜 거래 삽입과 거래당 항목 랜덤화를 조합함으로써 기존 방법에 비해 프라이버시는 어느 정도 향상되는가?
- RQ3제안된 랜덤화 기법을 적용한 후 반단조성 성질을 유지할 수 있는가?
- RQ4제안된 방법은 민감한 항목집합을 보호하면서도 추출된 연관 규칙의 정확성을 유지하는 데 얼마나 효과적인가?
- RQ5실제 데이터 환경에서 구현된 도구의 실용성과 성능은 어떠한가?
주요 결과
- 제안된 방법은 이전의 랜덤화된 데이터 왜곡 기법에 비해 더 높은 수준의 프라이버시를 달성한다.
- 가짜 거래와 거래당 항목 랜덤화의 통합이 적대자가 패턴을 재구성하는 것을 효과적으로 방해한다.
- 왜곡된 데이터에서 반단조성 성질이 유지되어 정확한 빈도 높은 항목집합 마이닝이 가능하다.
- 개발된 도구는 랜덤화된 데이터셋에서 빈도 높은 항목집합 및 연관 규칙를 성공적으로 추출한다.
- 랜덤화 매핑 함수를 통해 트랜잭션 내 항목 수준의 정보가 보호됨을 보장한다.
- 도구를 통한 실증 결과는 프라이버시가 유의미한 손실 없이 향상되었음을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.