Skip to main content
QUICK REVIEW

[논문 리뷰] A Survey of Privacy-Preserving Model Explanations: Privacy Risks, Attacks, and Countermeasures

Thành Tâm Nguyên, Thanh Trung Huynh|arXiv (Cornell University)|2024. 03. 31.
Privacy-Preserving Technologies in Data인용 수 4
한 줄 요약

이 종합적 리뷰는 설명 가능 인공지능(XAI)에서 모델 설명의 개인정보 위험에 대해 처음으로 종합적인 분석을 제공하며, 설명에 대한 공격(예: 구성원 식별, 익명 해제)을 분류하고, 차별적 프라이버시 및 적대적 훈련과 같은 대응 조치를 제안한다. 또한 프라이버시 보존 설명 기법의 분류 체계를 수립하고, 데이터 모odal리티, 이론적 기초, 실세계 평가 분야에서의 핵심 연구 격차를 규명한다.

ABSTRACT

As the adoption of explainable AI (XAI) continues to expand, the urgency to address its privacy implications intensifies. Despite a growing corpus of research in AI privacy and explainability, there is little attention on privacy-preserving model explanations. This article presents the first thorough survey about privacy attacks on model explanations and their countermeasures. Our contribution to this field comprises a thorough analysis of research papers with a connected taxonomy that facilitates the categorisation of privacy attacks and countermeasures based on the targeted explanations. This work also includes an initial investigation into the causes of privacy leaks. Finally, we discuss unresolved issues and prospective research directions uncovered in our analysis. This survey aims to be a valuable resource for the research community and offers clear insights for those new to this domain. To support ongoing research, we have established an online resource repository, which will be continuously updated with new and relevant findings. Interested readers are encouraged to access our repository at https://github.com/tamlhp/awesome-privex.

연구 동기 및 목표

  • 설명 가능 인공지능(XAI)에서 모델 설명과 관련된 개인정보 위험에 대한 연구 격차가 점점 커지는 데 대응하기 위해.
  • 설명 유형과 공격 목표에 따라 모델 설명을 대상으로 하는 개인정보 공격을 체계적으로 분류하기 위해.
  • 차별적 프라이버시와 적대적 훈련과 같은 기존의 대응 조치를 분석하여 설명에서의 개인정보 泄露를 완화하기 위해.
  • 공격 유형 범위의 제한, 개인정보 泄露 원인에 대한 이론적 이해 부족, 현실 조건에서의 평가 부족과 같은 해결되지 않은 과제를 규명하기 위해.
  • 앞선 연구를 위한 기초적인 분류 체계와 연구 로드맵을 제공하고, 오픈소스 레포지토리로 지원하기 위해.

제안 방법

  • 모델 해석, 기계 학습, 적대적 공격 분야에서의 개인정보 위험을 규명하기 위해 240篇 이상의 논문에 대한 체계적 문헌 리뷰를 수행하였다.
  • 대상 설명 유형(예: 국소적, 대체 조건, 특징 중요도), 공격 목표(예: 구성원 식별, 데이터 복원), 기반 메커니즘을 기반으로 다차원 분류 체계를 개발하였다.
  • 모델 아키텍처, 설명 방법 설계, 데이터 민감도 등으로 인해 발생하는 설명 내 개인정보 泄露의 근본 원인을 분석하였다.
  • 차별적 프라이버시, 적대적 훈련, 입력 흐름 왜곡과 같은 방어 기법을 설명 시스템에 맞게 조사하고 분류하였다.
  • 다양한 설명 유형과 데이터 모달리티(예: 표형, 이미지, 그래프, 오디오)에서 개인정보 보존 기법의 효과성을 평가하였다.
  • 지속적으로 업데이트되는 오픈소스 레포지토리(https://github.com/tamlhp/awesome-privex)를 구축하여 향후 연구와 커뮤니티 기여를 지원하였다.

실험 결과

연구 질문

  • RQ1모델 설명을 대상으로 하는 주요 개인정보 공격 유형은 무엇이며, LIME, SHAP, 대체 조건 등 다양한 설명 유형 간에 어떻게 다릅니까?
  • RQ2모델 설명에서 개인정보 泄露가 발생하는 근본 원인은 무엇이며, 모델 아키텍처와 설명 방법론은 이러한 위험에 어떻게 기여합니까?
  • RQ3차별적 프라이버시, 적대적 훈련, 입력 흐름 왜곡과 같은 대응 조치 중에서 설명의 정확성 유지를 유지하면서도 개인정보 보호에 가장 효과적인 것은 무엇입니까?
  • RQ4표형, 이미지, 그래프, 오디오 데이터와 같은 다양한 데이터 모달리티에서 개인정보 위험은 어떻게 달라지며, 각각 어떤 고유한 과제를 안고 있습니까?
  • RQ5특히 이론적 기초, 실세계 평가, 보다 광범위한 모델 커버리지 측면에서 개인정보 보존 모델 설명 분야에서 해결되지 않은 핵심 연구 과제는 무엇입니까?

주요 결과

  • 구성원 식별 공격는 모델 설명에서 가장 연구된 개인정보 위협으로, 특히 국소적 및 대체 조건 설명을 대상으로 한다.
  • LIME 및 SHAP와 같은 설명 방법은 국소적 대체 모델과 특징 왜곡에 의존함으로써 구성원 정보를 의도치 않게 泄露할 수 있다.
  • 특히 적응형 노이즈 주입을 포함한 차별적 프라이버시 메커니즘은 설명의 해석 가능성은 유지하면서도 개인정보 위험을 감소시킬 수 있으나, 설명의 정확성은 떨어질 수 있다.
  • 그래프 신경망(GNNs)은 개인정보 泄露의 고위험 영역으로 부상하고 있으며, GNN 설명에 대해 구성원 식별 및 익명 해제 공격가 점점 가능해지고 있다.
  • 오디오 기반 모델 설명은 개인정보 측면에서 여전히 연구가 부족한 편이며, 음성, 건강 신호 등 오디오 데이터의 높은 민감도와 의료 분야에서의 증가하는 활용에도 불구하고 그렇다.
  • 특정 설명이 개인정보 泄露에 더 취약한 이유를 설명하는 이론적 이해가 현저히 부족하며, 대규모 데이터셋, 실제 모델을 적용한 현실 조건에서의 공격 평가를 수행한 연구도 거의 없다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.