Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Exit Vision Transformer for Dynamic Inference

Arian Bakhtiarnia, Qi Zhang|arXiv (Cornell University)|2021. 06. 29.
Advanced Neural Network Applications인용 수 8
한 줄 요약

이 논문은 빠른 샘플에 대해 더 빠른 예측을 가능하게 하면서 정확도를 유지하기 위해 비전 트랜스포머(Vision Transformers)에 대한 일곱 가지 새로운 초기 종료 브랜치 아키텍처를 제안한다. 이미지 분류 및 회귀 작업에서 광범위한 실험을 통해 ViT-EE 및 MLP-EE 브랜치가 종단 간 훈련에서 속도와 정확도 사이의 최적 균형을 달성했으며, ViT-EE는 CIFAR-100에서 초기 종료 시 97.33%의 정확도를 기록했고, 전체 추론 대비 최대 67%의 FLOPS 감소를 이룬다.

ABSTRACT

Deep neural networks can be converted to multi-exit architectures by inserting early exit branches after some of their intermediate layers. This allows their inference process to become dynamic, which is useful for time critical IoT applications with stringent latency requirements, but with time-variant communication and computation resources. In particular, in edge computing systems and IoT networks where the exact computation time budget is variable and not known beforehand. Vision Transformer is a recently proposed architecture which has since found many applications across various domains of computer vision. In this work, we propose seven different architectures for early exit branches that can be used for dynamic inference in Vision Transformer backbones. Through extensive experiments involving both classification and regression problems, we show that each one of our proposed architectures could prove useful in the trade-off between accuracy and speed.

연구 동기 및 목표

  • 지연 시간이 제한된 엣지 및 IoT 응용 분야에서 계산 예산이 변동하는 조건에서도 비전 트랜스포머의 동적 추론을 가능하게 하기 위해.
  • 성능을 유지하면서 추론 시간을 단축하는 다양한 초기 종료 브랜치 아키텍처를 설계하고 평가하기 위해.
  • 주의 메커니즘, 정규화, 백본 레이어와의 유사성과 같은 아키텍처 선택이 초기 종료 성능에 미치는 영향을 조사하기 위해.
  • 다중 종료 ViT에 대한 세 가지 훈련 전략(종단 간, 계층별, 분류기별)을 비교하고 최적의 구성 요건을 규명하기 위해.

제안 방법

  • 다양한 아키텍처 특성을 지닌 일곱 가지 별도의 초기 종료 브랜치 아키텍처를 제안: MLP-EE, CNN-Ignore-EE, CNN-Add-EE, CNN-Project-EE, ViT-EE, MLP-Mixer-EE, ResMLP-EE.
  • 이 브랜치들을 비전 트랜스포머 백본의 중간 레이어에 통합하여 전체 순방향 전파 완료 이전에 초기 예측을 가능하게 한다.
  • 세 가지 훈련 전략을 적용: 종단 간(통합 최적화), 계층별(진행적 미세조정), 분류기별(브랜치 훈련 중 백본 고정).
  • 다양한 종료 위치와 데이터셋에서 속도와 성능 간의 상호 교환 관계를 평가하기 위해 FLOPS 및 정확도 지표를 사용한다.
  • 이미지 분류(CIFAR-10, CIFAR-100, Fashion-MNIST) 및 회귀(DISCO 군중 수세기) 작업에서 모델을 평가한다.
  • 수용 영역, 주의 유형, 정규화, 백본과의 아키텍처 유사성 등의 아키텍처 영향을 분석한다.

실험 결과

연구 질문

  • RQ1비전 트랜스포머에서 동적 추론을 위한 초기 종료 브랜치 아키텍처 중에서 가장 우수한 정확도-속도 균형을 달성하는 것은 무엇인가?
  • RQ2다른 훈련 전략(종단 간, 계층별, 분류기별)이 다중 종료 ViT 모델의 성능에 어떤 영향을 미치는가?
  • RQ3초기 종료 성능 향상에 있어 브랜치와 백본 레이어 간의 아키텍처 유사도는 어느 정도의 기여를 하는가?
  • RQ4주의 메커니즘, 정규화, 수용 영역 크기와 같은 아키텍처 구성 요소가 초기 종료 정확도에 어떤 영향을 미치는가?
  • RQ5다중 종료 ViT 아키텍처는 초기 레이어에서 높은 성능을 달성하면서도 계산 비용을 크게 줄일 수 있는가?

주요 결과

  • ViT-EE 브랜치는 모든 아키텍처 중에서 가장 높은 정확도를 기록했으며, 최종 종료 시 CIFAR-100에서 97.33%의 정확도를 달성했고, 백본 파라미터의 열화가 최소한이었다.
  • MLP-EE 및 ViT-EE 브랜치는 가장 유리한 정확도-속도 균형을 보였으며, 전체 추론 대비 최대 67%의 FLOPS 감소를 이끌었고, 높은 정확도를 유지했다.
  • 종단 간 훈련 전략이 계층별 및 분류기별 전략보다 우수했으며, 특히 백본 성능 유지와 효과적인 다중 종료 학습을 가능하게 했다.
  • 백본과 아키텍처적 차이가 있는 CNN 기반 브랜치(예: CNN-Ignore-EE)는 유사도가 높은 브랜치(예: ViT-EE)보다 성능이 열 劣했으며, 아키텍처 일관성의 중요성을 강조했다.
  • 후기 레이어에 배치된 브랜치(예: Early@9)는 더 높은 정확도를 기록했지만, 아키텍처와 훈련 전략이 잘 맞아떨어질 때에만 가능했다.
  • 계층별 훈련 전략은 초반 미세조정 후 사전 훈련 가중치 손실로 인해 후기 단계에서 높은 정확도를 달성하지 못했으며, 실용성에 제한이 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.