[논문 리뷰] Targeted Attack Improves Protection against Unauthorized Diffusion Customization
이 논문은 라틴 디퓨전 모델(Latent Diffusion Models, LDMs)에 대한 메모리 효율적인 적대적 공격인 개선된 타겟 공격(Improved Targeted Attack, ITA)을 제안한다. 이 공격는 LoRA 및 SDEdit와 같은 최신 소수 샘플 생성 방법에 대해 상당한 효과를 발휘하며, 새로운 타겟 공격 목적 함수와 세 가지 메모리 절약 기법을 도입함으로써 GPU 메모리 사용량을 6GB 이하로 줄여 소비자용 하드웨어에서도 구동이 가능하게 하면서도 일반적인 노이즈 제거 방어 기법에 대해 강력한 저항성을 유지한다.
Diffusion models build a new milestone for image generation yet raising public concerns, for they can be fine-tuned on unauthorized images for customization. Protection based on adversarial attacks rises to encounter this unauthorized diffusion customization, by adding protective watermarks to images and poisoning diffusion models. However, current protection, leveraging untargeted attacks, does not appear to be effective enough. In this paper, we propose a simple yet effective improvement for the protection against unauthorized diffusion customization by introducing targeted attacks. We show that by carefully selecting the target, targeted attacks significantly outperform untargeted attacks in poisoning diffusion models and degrading the customization image quality. Extensive experiments validate the superiority of our method on two mainstream customization methods of diffusion models, compared to existing protections. To explain the surprising success of targeted attacks, we delve into the mechanism of attack-based protections and propose a hypothesis based on our observation, which enhances the comprehension of attack-based protections. To the best of our knowledge, we are the first to both reveal the vulnerability of diffusion models to targeted attacks and leverage targeted attacks to enhance protection against unauthorized diffusion customization. Our code is available on GitHub: https://github.com/psyker-team/mist-v2.
연구 동기 및 목표
- LoRA 및 SDEdit와 같은 현대적인 LDM 기반 소수 샘플 생성 파이프라인에 대한 기존 적대적 공격의 제한된 효과성을 해결하기 위해.
- 현재 공격의 높은 GPU 메모리 비용으로 인해 고성능 하드웨어를 보유한 사용자 외에는 사용이 제한되는 문제를 해결하기 위해.
- 불허가된 LDM 기반 이미지 생성으로 인한 저작권 및 개인정보 위협에 노출된 개인을 위한 실용적인 방어 도구를 개발하기 위해.
- JPEG 압축 및 크기 조정과 같은 일반적인 노이즈 제거 기반 적대적 방어 기법에 대해 공격의 강건성을 확보하기 위해.
- 모델 액세스가 제한된 실세계 상황에서의 블랙박스 적용 가능성을 보장하기 위해.
제안 방법
- 공격는 참조 이미지의 특징 공간을 타겟으로 삼는 새로운 타겟 공격 목적 함수를 사용하여, 소수 샘플 이미지 생성에서 실패를 최대화하도록 변형을 최적화한다.
- 기울기 체크포인팅, 혼합 정밀도 추론, 선택적 활성화 저장을 통해 메모리 효율성을 확보하여 GPU 메모리 소비량을 6GB 이하로 감소시킨다.
- 공격는 LDM의 잠재 공간에 변형을 적용하여, 인식이 어려운 상태를 유지하면서도 디퓨전 과정에서 최대한의 혼란을 유도한다.
- 공격는 스테이블 디퓨전, SDXL 등의 다양한 백본 모델과 SDEdit, LoRA 등의 피해자 모델을 대상으로 평가되어 강력한 모델 간 전이 가능성을 입증한다.
- 노이즈 제거 방어 기법인 가우시안 노이즈, JPEG 압축, 크기 조정(2배 및 0.5배), 슈퍼해상도에 대해 공격의 강건성을 시험하였으며, 생성된 출력에서 일관된 성능 저하가 관찰되었다.
- 공격는 4/255의 변형 예산 하에서 수행되었으며, 생성 품질 저하 정도를 측정하기 위해 MS-SSIM, CLIP-SIM, CLIPIQA 지표를 사용하여 평가되었다.
실험 결과
연구 질문
- RQ1기존 방법에 비해 LDM 기반 소수 샘플 생성에서 더 높은 실패율을 달성할 수 있는 타겟 공격 적대적 공격가 존재하는가?
- RQ2메모리 효율 기법을 통해 LDM에 대한 적대적 공격의 GPU 메모리 사용량을 효과성에 손상 없이 얼마나 줄일 수 있는가?
- RQ3일반적인 노이즈 제거 기반 방어 기법에 대해 제안된 공격의 강건성은 어떠한가?
- RQ4공격는 다양한 LDM 백본 및 피해자 모델 간에 강력한 성능을 유지하는가? 이는 모델 간 전이 가능성을 시사한다.
- RQ5입력과 출력만 접근 가능한 블랙박스 환경에서도 공격가 효과적으로 구현될 수 있는가?
주요 결과
- 8/255의 변형 예산 하에서 ITA는 LoRA에서 CLIPIQA 점수 39.63, SDEdit에서 0.45를 기록하여, 적대적 변형 이후 이미지 품질이 심각하게 악화됨을 시사한다.
- SDEdit 및 LoRA와 같은 다양한 피해자 모델에서 강력한 성능을 유지하며, MS-SSIM 점수는 0.5 이하, CLIP-SIM 점수는 0.1 이하로 유지되어 콘텐츠 전달의 효과적인 방해를 보여준다.
- 가우시안 노이즈(σ=8), JPEG 압축(Q=20, 70), 크기 조정(2배, 0.5배), 슈퍼해상도를 적용한 후에도 ITA는 여전히 출력 품질을 저하시키며, CLIPIQA 점수는 낮게 유지된다.
- 특히 고품질 JPEG 및 크기 조정과 같은 실세계 이미지 처리 파이프라인에서 흔히 사용되는 방어 기법에 대해 저항력이 뛰어나, 공격의 효과성이 유지된다.
- 기울기 체크포인팅, 혼합 정밀도 추론, 선택적 활성화 저장을 통해 메모리 사용량을 6GB 이하로 줄여 소비자용 GPU에서도 구동이 가능해졌다.
- 시각화 및 정량적 결과는 ITA가 생성한 적대적 예제가, 방어 기법이 적용된 경우에도 SDEdit 및 LoRA 파이프라인에서 의미 있는 출력을 생성하지 못함을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.