Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding and Improving Robustness of Vision Transformers through Patch-based Negative Augmentation

Yao Qin, Chiyuan Zhang|arXiv (Cornell University)|2021. 10. 15.
Advanced Neural Network Applications참고 문헌 37인용 수 12
한 줄 요약

이 논문은 비전 트랜스포머(ViTs)가 의미를 파괴하는 변환에도 불구하고 지속되는 비로버스트, 패치 기반 특징에 의존하고 있으며, 이러한 특징은 진정한 클래스 의미를 나타내지 않는다는 점을 규명한다. 패치 기반의 부정적 증강—공간적 및 의미적 구조를 손상시키는 변환—을 도입함으로써 저자들은 ViT가 이러한 특징을 피하도록 정규화하여, 20개 이상의 설정에서 분포 외부 일반화 성능을 크게 향상시키지만, 분포 내 정확도에는 손해를 입히지 않는다.

ABSTRACT

We investigate the robustness of vision transformers (ViTs) through the lens of their special patch-based architectural structure, i.e., they process an image as a sequence of image patches. We find that ViTs are surprisingly insensitive to patch-based transformations, even when the transformation largely destroys the original semantics and makes the image unrecognizable by humans. This indicates that ViTs heavily use features that survived such transformations but are generally not indicative of the semantic class to humans. Further investigations show that these features are useful but non-robust, as ViTs trained on them can achieve high in-distribution accuracy, but break down under distribution shifts. From this understanding, we ask: can training the model to rely less on these features improve ViT robustness and out-of-distribution performance? We use the images transformed with our patch-based operations as negatively augmented views and offer losses to regularize the training away from using non-robust features. This is a complementary view to existing research that mostly focuses on augmenting inputs with semantic-preserving transformations to enforce models' invariance. We show that patch-based negative augmentation consistently improves robustness of ViTs across a wide set of ImageNet based robustness benchmarks. Furthermore, we find our patch-based negative augmentation are complementary to traditional (positive) data augmentation, and together boost the performance further.

연구 동기 및 목표

  • 비전 트랜스포머(ViTs)가 글로벌 어텐션 메커니즘을 갖추고 있음에도 불구하고 분포 이동에 여전히 취약한 이유를 탐구하기 위해.
  • 의미를 파괴하는 패치 기반 변환에 견딜 수 있는 비로버스트 특징을 식별하고 분석하기 위해.
  • ViT가 이러한 비로버스트 특징에 의존하는 것을 줄이기 위한 훈련 정규화 방법을 개발하여 분포 이동 하에서의 일반화 능력을 향상시키기 위해.
  • 패치 기반의 부정적 증강이 기존의 양성 데이터 증강 및 대비 학습 기법과 상호보완적인지 확인하기 위해.
  • 의도적이고 의미를 파괴하는 변환을 통해 ViTs에서의 강건성 실패를 진단하고 완화하기 위한 새로운 프레임워크를 제공하기 위해.

제안 방법

  • 공간적 및 의미적 관계를 파괴하지만 국소 패치 통계는 유지하는 패치 기반 변환(예: 무작위 패치 회전, 재배열, 배경 채우기 등)을 설계하고 적용하기 위해.
  • 훈련 중에 변환된 이미지를 부정적 증강된 시각으로 사용하여, 모델이 원본 입력과 다른 표현을 생성하도록 유도하기 위해.
  • 원본 이미지와 그 패치 기반 변환된 버전을 각각 양성 및 부정성 쌍으로 간주하는 대비 손실을 도입하여, 모델이 비로버스트 특징에서 멀어지도록 정규화하기 위해.
  • 제안된 부정적 증강을 표준 양성 데이터 증강(예: mixup, Cutout) 및 대비 학습에서의 배치 기반 부정 예시와 결합하여 강건성을 향상시키기 위해.
  • 기존 아키텍처 수정 없이 표준 지도 학습을 사용하여 새로운 손실 목표를 기반으로 ViT를 훈련시키며, 추가 추론 비용 없이 수행하기 위해.
  • 분포 이동 하에서 표준 ImageNet 기반 벤치마크(예: ImageNet-R, ImageNet-A, ImageNet-V2)를 대상으로 강건성 평가하기 위해.

실험 결과

연구 질문

  • RQ1비전 트랜스포머(ViTs)가 글로벌 어텐션 메커니즘을 갖추고 있음에도 불구하고 분포 이동에 여전히 취약한 이유는 무엇인가?
  • RQ2패치 기반 변환에 대해 비로버스트인 특징은 무엇이며, 이러한 특징은 어떤 유형의 패턴을 따르는가?
  • RQ3패치 기반의 부정적 증강을 통한 훈련이 비로버스트 특징에 대한 의존도를 줄이고 분포 외부 일반화 능력을 향상시킬 수 있는가?
  • RQ4패치 기반의 부정적 증강은 기존의 양성 데이터 증강 및 대비 학습 방법과 어떻게 비교되거나 상호보완적인가?
  • RQ5제안된 방법은 표준 벤치마크에서 분포 내 정확도를 떨어뜨리지 않으면서도 강건성을 향상시킬 수 있는가?

주요 결과

  • ViTs는 분포 내 정확도가 매우 높지만, 의미를 파괴하는 패치 기반 변환을 적용한 경우 강건성 벤치마크에서 성능이 크게 떨어진다.
  • 패치 기반 변환 후 ViT가 의존하는 특징들은 분포 내 성능에는 유용하지만, 인간이 이해할 수 있는 의미적 단서와는 관련이 없어 비로버스트이다.
  • 패치 기반의 부정적 증강은 ImageNet 기반의 강건성 벤치마크(예: ImageNet-R, ImageNet-A, ImageNet-V2)에서 20여 개 이상의 실험 설정에서 일관되게 ViT의 강건성을 향상시킨다.
  • 표준 양성 데이터 증강 및 대비 학습에서의 배치 기반 부정 예시와 결합했을 때도 강건성 향상 효과가 나타나, 상호보완적인 성과를 보였다.
  • 제안된 방법은 비로버스트 특징에 대한 의존도를 크게 줄이며, 주의 시각화 및 특징 기여도 분석을 통해 확인된 바, 분포 내 정확도는 유지하거나 略로 향상시킨다.
  • 연구 결과, ViT가 객체에 주의를 기울일 수는 있지만, 예측이 비로버스트인 패치 수준의 아티팩트에 의존할 경우, 전반적인 의미적 구조에 기반한 일반화 능력은 상실된다는 점을 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.