Skip to main content
QUICK REVIEW

[논문 리뷰] On the Robustness of Latent Diffusion Models

Jianping Zhang, Zhuoer Xu|arXiv (Cornell University)|2023. 06. 14.
Adversarial Robustness in Machine Learning인용 수 6
한 줄 요약

이 논문은 흰상자 및 검은상자 공격을 통해 잠재 확산 모델(LDM)의 강건성에 대해 조사하며, 특히 ResNet 모듈을 포함한 노이즈 제거 과정이 가장 취약한 구성요소임을 규명한다. 이미지 변형 및 인painting LDM용 자동화된 데이터셋 구축 파이프라인을 제안하고, 1,000개의 테스트 케이스로 구성된 벤치마크를 공개하며, 최신 모델인 SD-v2가 이전 모델보다 더 취약하다는 것을 발견한다. 또한, 전이 공격을 통해 서로 다른 버전의 모델 간에 오염된 예측을 유도하는 데 성공한다.

ABSTRACT

Latent diffusion models achieve state-of-the-art performance on a variety of generative tasks, such as image synthesis and image editing. However, the robustness of latent diffusion models is not well studied. Previous works only focus on the adversarial attacks against the encoder or the output image under white-box settings, regardless of the denoising process. Therefore, in this paper, we aim to analyze the robustness of latent diffusion models more thoroughly. We first study the influence of the components inside latent diffusion models on their white-box robustness. In addition to white-box scenarios, we evaluate the black-box robustness of latent diffusion models via transfer attacks, where we consider both prompt-transfer and model-transfer settings and possible defense mechanisms. However, all these explorations need a comprehensive benchmark dataset, which is missing in the literature. Therefore, to facilitate the research of the robustness of latent diffusion models, we propose two automatic dataset construction pipelines for two kinds of image editing models and release the whole dataset. Our code and dataset are available at \url{https://github.com/jpzhang1810/LDM-Robustness}.

연구 동기 및 목표

  • 이전 연구가 인코더 또는 출력 공격에만 집중한 데 비해, 잠재 확산 모델(LDM)의 강건성을 체계적으로 평가하는 것을 목표로 한다.
  • 실제 세계의 위협 모델을 반영하기 위해 흰상자 및 검은상자 강건성, 특히 프롬프트 전이 및 모델 전이 공격 시나리오를 조사한다.
  • LDM 강건성에 대한 공개적이고 고품질의 벤치마크가 부족한 문제를 해결하기 위해, 두 가지 이미지 편집 LDM 유형에 대한 자동화된 데이터셋 구축 파이프라인을 제안한다.
  • 기하학적 변환, 압축, 노이즈와 같은 방어 기법이 적대적 영향을 완화하는 데 얼마나 효과적인지 평가한다.
  • 향후 LDM 강건성 연구를 가속화하기 위해 오픈소스 코드와 데이터셋을 제공한다.

제안 방법

  • 이미지 변형 모델(이미지 + 프롬프트 쌍)용, 이미지 인painting 모델(이미지 + 프롬프트 + 마스크 트리플렛)용 자동화된 데이터셋 구축 파이프라인 두 가지를 제안하며, 각각 500개의 테스트 케이스를 생성한다.
  • LDM의 핵심 구성요소인 인코더, U-Net(노이즈 제거 네트워크), 디코더에 대해 흰상자 적대적 공격를 적용하여 취약도를 측정한다.
  • 두 가지 설정에서 전이 기반 검은상자 공격를 수행한다: 프롬프트 전이(동일한 프롬프트로 다른 모델 공격) 및 모델 전이(동일한 적대적 예제로 다른 모델 공격).
  • 적대적 예제의 강건성을 테스트하기 위해 랜덤 리사이징 및 패딩(R&P), JPEG 압축, 가우시안 노이즈와 같은 방어 기법을 평가한다.
  • 공격 성공도 및 방어 효과를 정량적으로 평가하기 위해 CLIP 점수, PSNR, SSIM, MSSSIM, FID, IS를 사용한다.
  • 재현 가능성과 향후 벤치마킹을 위해 코드와 데이터셋을 https://github.com/jpzhang1810/LDM-Robustness 에 공개한다.

실험 결과

연구 질문

  • RQ1잠재 확산 모델 아키텍처 내에서 적대적 공격에 가장 취약한 구성요소는 무엇인가?
  • RQ2흰상자 및 검은상자 공격 설정에서 이미지 변형 모델과 이미지 인painting 모델의 강건성에는 어떤 차이가 있는가?
  • RQ3적대적 예제가 서로 다른 LDM들 간, 특히 Stable Diffusion의 서로 다른 버전 간에 얼마나 효과적으로 전이되는가?
  • RQ4R&P, JPEG 압축, 가우시안 노이즈와 같은 일반적인 방어 기법이 LDM에 대한 적대적 공격을 완화하는 데 얼마나 효과적인가?
  • RQ5모델 진화(예: SD-v1에서 SD-v2로의 전이)가 적대적 강건성과 유전된 취약성에 어떤 영향을 미치는가?

주요 결과

  • 흰상자 공격 하에서 노이즈 제거 과정, 특히 ResNet 기반의 U-Net 모듈이 잠재 확산 모델에서 가장 취약한 구성요소이다.
  • CLIP 점수 측정 결과에 따르면, 지시 기반 피크스투픽스(Instruct-pix2pix)는 표준 스테이블 디퓨전 모델보다 흰상자 공격에서 더 높은 강건성을 보인다.
  • SD-v1 모델(예: SD-v1-4, SD-v1-5)에서 생성된 적대적 예제는 SD-v2-1로 효과적으로 전이되지만, 반대 방향 전이는 제한적이며, 이는 SD-v2-1 모델이 더 취약하다는 것을 시사한다.
  • 전이 공격 성능 분석 결과, SD-v1 모델의 결함이 SD-v2 모델로 이관되며, SD-v2 모델는 그 이전의 SD-v1 모델보다 적대적 편향에 더 취약하다.
  • 기하학적 변환(Random Resizing and Padding)은 적대적 예제의 강건성을 크게 향상시키며, U-Net 모듈에서 CLIP 점수를 3.95 포인트 상승시킨다. 다만, 기능은 여전히 손상된다.
  • JPEG 압축과 가우시안 노이즈와 같은 방어 조치를 적용한 후에도, 적대적 예제는 여전히 예상되는 이미지 편집 기능을 오도하므로, 실제 환경에서는 제한된 내성 강건성을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.