Skip to main content
QUICK REVIEW

[논문 리뷰] Image Synthesis with a Single (Robust) Classifier

Shibani Santurkar, Dimitris Tsipras|arXiv (Cornell University)|2019. 06. 06.
Adversarial Robustness in Machine Learning참고 문헌 50인용 수 47
한 줄 요약

이 논문은 단일 강인한 분류기를 사용하여 특정 작업별 모델 없이도 그래디언트 상승을 통해 클래스 점수를 최대화함으로써 다재다능한 이미지 합성 작업에 보편적인 도구로 활용할 수 있음을 보여준다. 한 가지 강인한 분류기로 생성, 인페인팅, 번역, 초해상도, 인터랙티브 조작을 수행한다.

ABSTRACT

We show that the basic classification framework alone can be used to tackle some of the most challenging tasks in image synthesis. In contrast to other state-of-the-art approaches, the toolkit we develop is rather minimal: it uses a single, off-the-shelf classifier for all these tasks. The crux of our approach is that we train this classifier to be adversarially robust. It turns out that adversarial robustness is precisely what we need to directly manipulate salient features of the input. Overall, our findings demonstrate the utility of robustness in the broader machine learning context. Code and models for our experiments can be found at https://git.io/robust-apps.

연구 동기 및 목표

  • 단일 강인한 분류기가 분류를 넘는 다양한 이미지 합성 작업을 다룰 수 있음을 시연한다.
  • 강인한 모델에서 클래스 점수를 최대화하는 것이 현실적이고 의미론적으로 의미 있는 입력을 산출함을 보인다.
  • 다양한 작업에 걸쳐 시맨틱한 이미지 조작의 기본 원리로서 어드버서리 로버스트니스의 역할을 강조한다.
  • 이 최소 도구 키트의 한계와 대용량 데이터셋에서의 확장성을 탐구한다.

제안 방법

  • 각 데이터셋에 대해 적대적 로버스트니스를 가진 ResNet-50 분류기를 훈련한다.
  • 클래스-조건 시드에서 시작하여 목표 클래스 점수의 그래디언트 상승으로 샘플을 생성한다(PGD 사용).
  • 인페인팅의 경우 손상된 영역 밖의 변화를 벌점하면서 진짜 클래스 점수를 최대화하도록 이미지를 최적화한다.
  • 이미지 대 이미지 번역의 경우 소스/대상 도메인에 대해 분류기를 훈련하고 대상 클래스 점수를 최대화하여 번역한다.
  • 초해상도의 경우 업샘플링된 저해상도 입력에 대한 변화를 제약하면서 고수준 클래스 점수를 최대화한다.
  • 인터랙티브 조작의 경우 선택적으로 표현 계층의 활성화를 최대화하여 특정 특징을 PGD로 페인팅한다.
  • 시드 분포, 강인성 설정 및 필요한 최소 조정에 대해 논의한다.

실험 결과

연구 질문

  • RQ1단일 강인한 분류기가 다수의 이미지 합성 작업에 대한 일반 원시기로 작용할 수 있는가?
  • RQ2강인한 모델의 그래디언트 기반 조작이 품질과 다양성 면에서 작업별 생성 방법과 어떻게 비교되는가?
  • RQ3생성, 인페인팅, 번역, 초해상도에 대한 클래스 점수 최대화를 사용하는 능력과 한계는 무엇인가?
  • RQ4로버스트니스가 합성 이미지의 시맨틱 콘텐츠와 제어 가능성에 어떤 영향을 미치는가?

주요 결과

  • 단일 강인한 분류기가 표적 PGD를 사용하여 많은 클래스에 대해 현실적이고 다양한 이미지를 생성할 수 있다.
  • CIFAR-10에서 제안 방법의 Inception Score는 8.4±0.1이며(BigGAN 11.2±0.2, WGAN-GP 9.22에 비해)
  • ImageNet(전체 데이터)에서 이 방법은 Inception Score 259.0±4를 달성하며 이 설정에서 BigGAN의 331.9±4.9 및 WGAN-GP의 233.1±1을 능가한다.
  • 메서드는 지각적으로 그럴듯한 인페인팅 결과와 의미 있는 이미지-대-이미지 번역(예: 말↔지브라, 사과↔오렌지, 여름↔겨울)을 산출한다.
  • 강인 모델의 그래디언트를 통한 초해상도는 더 선명하고 의미론적으로 의미 있는 재구성을 생성하며, 제한된 ImageNet 작업에서 PSNR이 일반 업샘플링보다 좋다(21.53 대 21.30).
  • 인터랙티브 스케치-투-이미지 및 특징 페인팅 도구는 강인한 모델의 클래스 점수 또는 활성화를 최적화해 구축할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.