Skip to main content
QUICK REVIEW

[논문 리뷰] TokenMixup: Efficient Attention-guided Token-level Data Augmentation for Transformers

Hyeong Kyu Choi, Joonmyung Choi|arXiv (Cornell University)|2022. 10. 14.
Advanced Neural Network Applications인용 수 14
한 줄 요약

TokenMixup는 계산 비용이 높은 기울기 기반의 중요도 탐지 대신 자기주의 맵을 활용하여 효율적이고 주의력에 기반한 토큰 수준의 데이터 증강 방법을 제안한다. 이는 성능 향상과 함께 ×15의 속도 향상을 이룬다. ScoreNet을 통한 커리큘럼 학습과 다중 척도 변형인 Vertical TokenMixup를 도입하여, 처음부터 학습한 모델에서 CIFAR-100에서 최고 성능을 달성한다.

ABSTRACT

Mixup is a commonly adopted data augmentation technique for image classification. Recent advances in mixup methods primarily focus on mixing based on saliency. However, many saliency detectors require intense computation and are especially burdensome for parameter-heavy transformer models. To this end, we propose TokenMixup, an efficient attention-guided token-level data augmentation method that aims to maximize the saliency of a mixed set of tokens. TokenMixup provides x15 faster saliency-aware data augmentation compared to gradient-based methods. Moreover, we introduce a variant of TokenMixup which mixes tokens within a single instance, thereby enabling multi-scale feature augmentation. Experiments show that our methods significantly improve the baseline models' performance on CIFAR and ImageNet-1K, while being more efficient than previous methods. We also reach state-of-the-art performance on CIFAR-100 among from-scratch transformer models. Code is available at https://github.com/mlvlab/TokenMixup.

연구 동기 및 목표

  • 매개변수 수가 많은 비전 트랜스포머에 적용되는 믹스업 방법에서 기울기 기반 중요도 탐지의 높은 계산 비용을 해결하기 위해.
  • 토큰 수준의 데이터 증강을 위한 효율적이고 내재된 중요도 탐지기로 자기주의 맵을 활용하기 위해.
  • ScoreNet을 통해 샘플의 어려움을 추정하고 적응적으로 믹스업 적용을 유도하는 커리큘럼 학습 접근법을 도입하기 위해.
  • 단일 샘플 내에서 트랜스포머 레이어 간의 토큰을 수직적으로 혼합함으로써 다중 척도 특징 학습을 가능하게 하기 위해.
  • 초기 학습된 모델에서 CIFAR-100에서 최고 성능을 달성하면서, CIFAR-10과 ImageNet-1K에서도 일반화 성능을 향상시키기 위해.

제안 방법

  • TokenMixup는 기울기 기반 중요도 추정을 대체하기 위해 자기주의 맵을 신속하고 미분 가능한 대체 척도로 사용하여 믹스업에 적합한 중요한 토큰을 식별한다.
  • 배치 수준의 중요도를 최대화하기 위해 최적의 인스턴스 쌍을 할당하기 위해 허긴거 매칭을 사용하여 할당 문제를 정확히 해결한다.
  • 가벼운 ScoreNet 모듈은 샘플의 어려움을 추정하고 적응적인 믹스업 적용을 유도하며, 커리큘럼 학습 전략을 구현한다.
  • 수직 토큰 믹스업(VTM)은 단일 입력의 서로 다른 레이어에서 온 토큰을 조합하여 샘플 내 혼합을 수행함으로써 다중 척도 특징 증강을 가능하게 한다.
  • 기존의 믹스업 기법들(예: 입력 믹스업, CutMix)과 병렬적으로 적용 가능하여 전체 성능을 향상시킨다.
  • 중요도 기반 레이블 재할당은 혼합된 토큰의 비율을 계산하여 소프트 레이블을 생성함으로써 의미 일관성을 유지한다.

실험 결과

연구 질문

  • RQ1자기주의 맵이 기울기 기반 중요도 탐지 대체로 효과적으로 기능할 수 있으며, 계산 비용을 줄일 수 있는가?
  • RQ2ScoreNet을 통한 커리큘럼 학습이 토큰 수준 믹스업의 효과를 향상시키는가?
  • RQ3트랜스포머 레이어 간의 샘플 내 혼합이 다중 척도 특징 표현과 모델 일반화를 향상시키는가?
  • RQ4기존 믹스업 기법들과 TokenMixup를 조합했을 때 이미지 분류 벤치마크에 어떤 영향을 미치는가?
  • RQ5주의력에 기반한 토큰 혼합이 Manifold Mixup와 같은 소프트 혼합 방법보다 성능과 강건성 면에서 뛰어나게 되는가?

주요 결과

  • TokenMixup는 기울기 기반 방법 대비 중요도 탐지에서 ×15의 속도 향상을 달성했으며, CIFAR-100에서 정확도가 향상되었다.
  • 이 방법은 처음부터 학습한 비전 트랜스포머 모델 중에서 CIFAR-100에서 최고 성능인 83.57%의 상위-1 정확도를 달성했다.
  • TokenMixup를 입력 믹스업 및 CutMix와 조합하면 CIFAR-100에서 83.57%의 정확도를 기록했으며, 원본 CCT 기준선보다 6个百分点 이상 높였다.
  • 수직 토큰 믹스업은 효과적인 다중 척도 특징 학습을 가능하게 하여 다른 믹스업 기법과 조합했을 때 성능 향상에 기여했다.
  • 절단 실험 결과, 최적의 할당, 중요도 기반 레이블 재할당, ScoreNet 기반 커리큘럼 학습이 모두 성능 향상에 기여한다는 것이 확인되었다.
  • Manifold Mixup는 중간 토큰에 적용했을 때 성능 저하를 초래하는 것으로 나타나, TokenMixup와 같이 하드 토큰 교체 방식이 자기주의 메커니즘에 더 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.