Skip to main content
QUICK REVIEW

[논문 리뷰] Improve Vision Transformers Training by Suppressing Over-smoothing

Chengyue Gong, Dilin Wang|arXiv (Cornell University)|2021. 04. 26.
Advanced Neural Network Applications참고 문헌 4인용 수 22
한 줄 요약

이 논문은 아키텍처 수정 없이 시각 트랜스포머의 학습 안정화 기법을 제안하며, 자기주의층에서의 과도한 평균화로 인한 특징 붕괴와 성능 저하 문제를 해결한다. 컷믹스와 함께 패치 분류 헤드와 다양성 촉진 손실 함수를 도입함으로써, 추가 파rameter나 교사 모델 없이도 더 깊고 넓은 시각 트랜스포머가 ImageNet에서 85.0%의 top-1 정확도를 달성할 수 있도록 한다.

ABSTRACT

Introducing the transformer structure into computer vision tasks holds the promise of yielding a better speed-accuracy trade-off than traditional convolution networks. However, directly training vanilla transformers on vision tasks has been shown to yield unstable and sub-optimal results. As a result, recent works propose to modify transformer structures by incorporating convolutional layers to improve the performance on vision tasks. This work investigates how to stabilize the training of vision transformers \emph{without} special structure modification. We observe that the instability of transformer training on vision tasks can be attributed to the over-smoothing problem, that the self-attention layers tend to map the different patches from the input image into a similar latent representation, hence yielding the loss of information and degeneration of performance, especially when the number of layers is large. We then propose a number of techniques to alleviate this problem, including introducing additional loss functions to encourage diversity, prevent loss of information, and discriminate different patches by additional patch classification loss for Cutmix. We show that our proposed techniques stabilize the training and allow us to train wider and deeper vision transformers, achieving 85.0\% top-1 accuracy on ImageNet validation set without introducing extra teachers or additional convolution layers. Our code will be made publicly available at this https URL .

연구 동기 및 목표

  • 기본 시각 트랜스포머의 학습에서의 불안정성과 최적 성능 달성 실패 문제를 해결하기 위해.
  • 깊은 트랜스포머에서 특징 붕괴와 성능 저하의 근본 원인으로 자기주의층의 과도한 평균화를 특정하기 위해.
  • 트랜스포머 아키텍처를 수정하거나 컨볼루션 레이어를 추가하지 않고도 학습 안정성과 모델 용량을 향상시키기 위해.
  • 특징 다양성과 정보를 유지함으로써 더 깊고 넓은 시각 트랜스포머의 학습을 가능하게 하기 위해.
  • 오직 손실 기반 정규화 기법을 사용하여 ImageNet에서 최신 기술 수준의 정확도를 달성하기 위해.

제안 방법

  • Cutmix 증강 동안 특징의 구분 능력을 향상시키기 위해 보조 패치 분류 헤드를 도입한다.
  • 이미지 패치 간의 표현이 서로 다를 수 있도록 유도하기 위해 다양성 촉진 손실 함수를 적용한다.
  • 패치 간의 차이를 유지함으로써 특징 붕괴를 방지하기 위해 대비 유사한 손실을 사용한다.
  • 패치 분류 손실을 컷믹스 데이터 증강과 통합하여 일반화 성능을 향상시킨다.
  • 이러한 손실 구성 요소를 통해 표준 자기주의 메커니즘을 사용하면서도 학습을 안정화시킨다.
  • 잔차 연결이나 컨볼루션 인덕티브 바이어스와 같은 아키텍처 변경을 피한다.

실험 결과

연구 질문

  • RQ1자기주의 메커니즘만을 사용할 때 시각 트랜스포머에서 학습 불안정성이 발생하는 원인은 무엇인가?
  • RQ2자기주의층에서의 과도한 평균화가 특징 표현과 모델 정확도에 미치는 영향은 무엇인가?
  • RQ3시각 트랜스포머의 아키텍처 수정 없이도 학습 안정성을 향상시킬 수 있는가?
  • RQ4오직 손실 기반 정규화 기법을 사용할 때 얼마나 깊고 넓은 트랜스포머를 학습시킬 수 있는가?
  • RQ5추가 파arameter나 지식 정복 없이도 ImageNet에서 높은 정확도를 달성할 수 있는가?

주요 결과

  • 제안된 방법은 아키텍처 수정 없이도 시각 트랜스포머의 학습을 안정화시켜 더 깊고 넓은 모델의 신뢰성 있는 학습을 가능하게 한다.
  • 모델은 ImageNet 검증 세트에서 85.0%의 top-1 정확도를 달성했으며, 지식 정복이나 추가 파arameter 없이 최신 기술 수준의 성능을 달성한다.
  • 패치 분류 헤드와 다양성 손실의 추가로 과도한 평균화가 크게 감소하고 특징의 구분 능력이 향상된다.
  • 모델은 깊이와 넓이가 증가함에도 불구하고 성능 향상을 유지하며, 아키텍처 스케일링에 대해 강건함을 보여준다.
  • 기본 시각 트랜스포머보다 우수한 성능을 보이며, 잔차 연결이나 컨볼루션 인덕티브 바이어스에 의존하는 모델과도 동등한 성능을 달성한다.
  • 코드가 공개되어 재현 가능성과 안정적인 시각 트랜스포머 학습에 대한 향후 연구를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.