Skip to main content
QUICK REVIEW

[논문 리뷰] SalUn: Empowering Machine Unlearning via Gradient-based Weight Saliency in Both Image Classification and Generation

Chongyu Fan, Jiancheng Liu|arXiv (Cornell University)|2023. 10. 19.
COVID-19 diagnosis using AI인용 수 5
한 줄 요약

SalUn은 기울기 기반 가중치 중요도를 활용하여 영향력 있는 모델 가중치만을 선택적으로 대상으로 삼고 업데이트하는 새로운 기계 학습 지우기 프레임워크를 제안한다. 이는 이미지 분류 및 텍스트-이미지 생성 모두에서 지우기 정확도와 안정성을 크게 향상시킨다. 특히, 확산 모델에서 유해한 개념 생성을 제거할 때 거의 완벽한 지우기 정확도(99.74%)를 달성하며, Erased Stable Diffusion 및 Forget-Me-Not과 같은 최첨단 기준보다 뛰어나다.

ABSTRACT

With evolving data regulations, machine unlearning (MU) has become an important tool for fostering trust and safety in today's AI models. However, existing MU methods focusing on data and/or weight perspectives often suffer limitations in unlearning accuracy, stability, and cross-domain applicability. To address these challenges, we introduce the concept of 'weight saliency' for MU, drawing parallels with input saliency in model explanation. This innovation directs MU's attention toward specific model weights rather than the entire model, improving effectiveness and efficiency. The resultant method that we call saliency unlearning (SalUn) narrows the performance gap with 'exact' unlearning (model retraining from scratch after removing the forgetting data points). To the best of our knowledge, SalUn is the first principled MU approach that can effectively erase the influence of forgetting data, classes, or concepts in both image classification and generation tasks. As highlighted below, For example, SalUn yields a stability advantage in high-variance random data forgetting, e.g., with a 0.2% gap compared to exact unlearning on the CIFAR-10 dataset. Moreover, in preventing conditional diffusion models from generating harmful images, SalUn achieves nearly 100% unlearning accuracy, outperforming current state-of-the-art baselines like Erased Stable Diffusion and Forget-Me-Not. Codes are available at https://github.com/OPTML-Group/Unlearn-Saliency. (WARNING: This paper contains model outputs that may be offensive in nature.)

연구 동기 및 목표

  • 기존의 근사 기계 학습 지우기 방법의 불안정성과 제한된 다중 도메인 적용 가능성을 해결하기 위해.
  • 이미지 분류 및 생성 모델 모두에 효과적인 원칙 기반의 지우기 접근법을 개발하기 위해.
  • 근사 지우기와 정확한 재학습(즉, 처음부터 완전한 피팅) 간의 성능 격차를 줄이기 위해.
  • 확산 모델에서 특정 데이터, 클래스 또는 유해한 개념을 효과적으로 지우기 위해.
  • 기존의 기계 학습 지우기 패러다임으로서의 '가중치 중요도' 개념을 도입하고 검증하기 위해.

제안 방법

  • 이 방법은 '가중치 중요도'를 도입한다. 이는 기울기 기반 분석을 통해 각 모델 가중치가 지우기 데이터 포인트에 대한 예측에 얼마나 기여하는지를 측정하는 척도이다.
  • SalUn은 전체 모델을 재학습하는 대신, 지우기 데이터와 관련된 가장 중요한 가중치만을 식별하고 업데이트한다.
  • 가중치 중요도 점수에 기반해 소프트 또는 하드 임계값 처리 기법을 적용하여 영향력 있는 가중치를 선택함으로써 효율적이고 정밀한 지우기를 가능하게 한다.
  • 이 방법은 분류 기반 및 분류 없이 작동하는 확산 모델 모두에 적용되며, 수정된 손실 함수에 대한 피팅을 통해 지우기를 수행한다.
  • 이 방법은 다양한 지우기 기준 기반 방법들과 호환되며, 영향력 있는 가중치에 집중함으로써 그 성능을 향상시킨다.
  • 전체 재학습이나 복잡한 인증이 필요 없이 기울기 기반 影향 추정을 사용해 중요도 점수를 계산한다.

실험 결과

연구 질문

  • RQ1가중치 중요도는 분류 및 생성 작업 모두에서 기계 학습 지우기 성능을 향상시키는 원칙적인 메커니즘으로 활용될 수 있는가?
  • RQ2정확한 지우기(처음부터 재학습)와 비교할 때 성능 및 안정성 측면에서 SalUn은 어떻게 성과를 내는가?
  • RQ3SalUn은 텍스트-이미지 확산 모델에서 유해하거나 민감한 개념을 효과적으로 지울 수 있는가?
  • RQ4가중치 중요도가 기존의 근사 지우기 방법에서 관찰되는 성능 변동성을 줄이는가?
  • RQ5SalUn은 랜덤 데이터 지우기 및 특정 클래스의 삭제와 같은 다양한 지우기 시나리오에 적응 가능한가?

주요 결과

  • 고분산 랜덤 지우기 조건에서 CIFAR-10에서 정확한 재학습과의 성능 격차를 0.2%로 줄여 매우 뛰어난 안정성을 보였다.
  • 조건부 확산 모델에서 클래스 조건부 생성에 대해 SalUn은 97.95%의 지우기 정확도를 달성했으며, Erased Stable Diffusion 및 Forget-Me-Not를 모두 능가했다.
  • 텍스트-이미지 생성에서 개념 제거에 대해 SalUn은 NSFW 개념 프롬프트에서 99.74%의 지우기 정확도를 기록했으며, 기준 기반 방법들보다 뚜렷이 뛰어났다.
  • 여러 랜덤 시드와 지우기 클래스에 걸쳐도 높은 지우기 정확도를 유지하여 강건성과 낮은 변동성을 입증했다.
  • 확산 모델에서 '고양이' 클래스에 대해 SalUn은 39.41%의 지우기 정확도를 달성했으며, 잔여 영향력은 0.27%에 불과해 강력한 개념 제거 능력을 보였다.
  • 제거 실험 결과, 가중치 중요도가 핵심 요소임을 확인했다. 이 요소를 제거할 경우 전체 SalUn 방법 대비 성능 저하가 20% 이상 발생했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.