Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarially-Trained Deep Nets Transfer Better: Illustration on Image Classification

Francisco Utrera, Evan Kravitz|arXiv (Cornell University)|2020. 07. 11.
Adversarial Robustness in Machine Learning인용 수 12
한 줄 요약

이 논문은 적대적 훈련을 거친 딥 네ural 네트워크가 표준 비적대적 훈련 모델보다 새로운 이미지 분류 작업으로 더 효과적으로 전이됨을 보여준다. 특히 타겟 데이터가 제한된 경우에 더욱 두드러진다. 이 개선 효과는 적대적 훈련이 표현을 무늬보다 형태 특징 쪽으로 편향시키기 때문에 발생하며, 이는 더 인간이 인지할 수 있고 의미적으로 유의미한 특징을 만들어내어 전이 능력을 향상시킨다.

ABSTRACT

Transfer learning has emerged as a powerful methodology for adapting pre-trained deep neural networks on image recognition tasks to new domains. This process consists of taking a neural network pre-trained on a large feature-rich source dataset, freezing the early layers that encode essential generic image properties, and then fine-tuning the last few layers in order to capture specific information related to the target situation. This approach is particularly useful when only limited or weakly labeled data are available for the new task. In this work, we demonstrate that adversarially-trained models transfer better than non-adversarially-trained models, especially if only limited data are available for the new domain task. Further, we observe that adversarial training biases the learnt representations to retaining shapes, as opposed to textures, which impacts the transferability of the source models. Finally, through the lens of influence functions, we discover that transferred adversarially-trained models contain more human-identifiable semantic information, which explains -- at least partly -- why adversarially-trained models transfer better.

연구 동기 및 목표

  • 적대적 훈련 모델이 전이 학습 설정에서 도메인 간 일반화 능력이 더 뛰어나지 않는지 조사하기 위해.
  • 저자기 정확도는 낮지만 강건한 모델이 더 뛰어난 전이 성능을 보이는 이유를 이해하기 위해.
  • 적대적 훈련이 무늬 대비 형태 편향 측면에서 학습된 특징 표현에 어떤 영향을 미치는지 분석하기 위해.
  • 영향 함수를 사용하여 인간이 인지할 수 있는 의미 정보가 전이성에 어떤 역할을 하는지 탐색하기 위해.
  • 자료 부족과 피니팅 전략이 강건 모델과 자연 모델의 전이 성능에 어떤 영향을 미치는지 평가하기 위해.

제안 방법

  • ImageNet-1K에서 적대적(정규화된 PGD 및 가우시안 공격 사용) 및 비적대적(자연스럽게)으로 사전 훈련된 ResNet-50 모델을 사용하였다.
  • 다양한 타겟 데이터셋에 대해 레이어의 초기 부분을 고정하고 마지막 몇 개의 레이어만 피니팅하여 전이 학습을 수행하였다. 데이터 레이블 수는 다양하게 설정되었다.
  • 적대적 훈련은 ℓ₂ 및 ℓ∞ 제약 조건을 각각 PGD 및 가우시안 노이즈 편향과 함께 사용하였으며, 고정된 편향 예산 내에서 수행되었다.
  • 영향 함수를 적용하여 소스 도메인에서의 어떤 학습 예제가 타겟 도메인의 예측에 가장 큰 영향을 미쳤는지 분석하였다.
  • 활성화 맵과 특징 유사도 분석을 통해 시각화 및 비교하여 무늬 대비 형태 편향을 평가하였다.
  • 다양한 데이터셋, 피니팅 블록 수, 서브셋 크기를 대상으로 광범위한 아블레이션 연구를 수행하여 결과의 강건성을 검증하였다.

실험 결과

연구 질문

  • RQ1제한된 데이터로 새로운 이미지 분류 작업에 피니팅할 때, 적대적 훈련 모델이 표준 모델보다 더 높은 정확도를 달성하는가?
  • RQ2적대적 훈련은 학습된 표현의 인도크티브 편향에 어떤 영향을 미치는가? 특히 형태 또는 무늬 특징 중 어떤 쪽을 선호하는가?
  • RQ3영향 함수로 측정했을 때, 강건 모델이 인간이 인지할 수 있는 의미 정보를 어느 정도 유지하는가?
  • RQ4소스 데이터셋과 타겟 데이터셋 간의 유사도가 최적의 피니팅 레이어 수와 적대적 제약 조건 선택에 어떤 영향을 미치는가?
  • RQ5강건 모델의 향상된 전이 능력이 더 의미 있는 특징 표현 덕분인가?

주요 결과

  • 10% 미만의 훈련 데이터만 사용하는 타겟 데이터셋에 대해, 적대적 훈련 모델이 자연 모델보다 유의미하게 높은 테스트 정확도를 달성하였다.
  • 강건 모델은 특히 자료가 부족한 조건에서 더 빠르게 수렴하고 더 높은 정확도에 도달하였다.
  • 적대적 훈련은 형태 정보를 더 강하게 유지하는 표현을 만들어내어 데이터세트 특화 패턴에 대한 의존도를 감소시켰다.
  • 영향 함수 분석 결과, 적대적 훈련 모델은 학습된 특징에 더 인간이 인지할 수 있는 의미 정보를 포함하고 있었다.
  • 도메인 이탈이 크고 자료가 부족한 데이터셋에서 강건 모델과 자연 모델 간의 성능 격차가 가장 두드러졌다.
  • 강건 모델의 전이 능력 우월성은 여러 타겟 데이터셋과 피니팅 설정에서 일관되게 관찰되어 광범위한 적용 가능성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.