Skip to main content
QUICK REVIEW

[논문 리뷰] SoT: Delving Deeper into Classification Head for Transformer

Jiangtao Xie, Ruiren Zeng|arXiv (Cornell University)|2021. 04. 22.
Multimodal Machine Learning Applications인용 수 11
한 줄 요약

이 논문은 분류 토큰과 고수준 단어 토큰을 다중두부 전역 상호공분산 풀링과 특이값 거듭제곱 정규화를 통해 동시에 활용함으로써 분류 헤드를 향상시키는 새로운 Transformer 기반 모델 SoT를 제안한다. 이 방법은 전역적 맥락과 국소적 분류 기능 간의 보완 정보를 활용하여 비전 및 언어 작업에서 성능을 크게 향상시키며, ImageNet, ImageNet-A, CoLA 및 RTE 벤치마크에서 최신 기준 성능을 달성한다.

ABSTRACT

Transformer models are not only successful in natural language processing (NLP) but also demonstrate high potential in computer vision (CV). Despite great advance, most of works only focus on improvement of architectures but pay little attention to the classification head. For years transformer models base exclusively on classification token to construct the final classifier, without explicitly harnessing high-level word tokens. In this paper, we propose a novel transformer model called second-order transformer (SoT), exploiting simultaneously the classification token and word tokens for the classifier. Specifically, we empirically disclose that high-level word tokens contain rich information, which per se are very competent with the classifier and moreover, are complementary to the classification token. To effectively harness such rich information, we propose multi-headed global cross-covariance pooling with singular value power normalization, which shares similar philosophy and thus is compatible with the transformer block, better than commonly used pooling methods. Then, we study comprehensively how to explicitly combine word tokens with classification token for building the final classification head. For CV tasks, our SoT significantly improves state-of-the-art vision transformers on challenging benchmarks including ImageNet and ImageNet-A. For NLP tasks, through fine-tuning based on pretrained language transformers including GPT and BERT, our SoT greatly boosts the performance on widely used tasks such as CoLA and RTE. Code will be available at https://peihuali.org/SoT

연구 동기 및 목표

  • Transformer 모델에서 분류 토큰에만 의존하는 데서 비롯하는 한계를 해결하기 위해, 고수준 단어 토큰에 담긴 풍부한 보완 정보를 간과하지 않도록 하는 것.
  • 단어 토큰 자체가 강력한 분류기로 기능할 수 있는지, 그리고 어떻게 분류 토큰과 효과적으로 융합할 수 있는지 탐구하는 것.
  • 단어 토큰으로부터 이차 상호공분산 표현을 캡처할 수 있는 새로운, 호환 가능한 풀링 기법을 설계하여, 효율성과 Transformer 아키텍처와의 호환성을 유지하는 것.
  • 분류 토큰과 단어 토큰 표현을 명시적으로 융합하는 데 중점을 둔 다양한 초기 융합 전략을 개발하고 평가하여 분류 성능 향상을 도모하는 것.

제안 방법

  • 모든 단어 토큰 간의 이차 상호공분산 표현을 학습함으로써 풍부한 고수준 의미 정보를 캡처하는 다중두부 전역 상호공분산 풀링(MGCrP)을 제안한다.
  • MGCrP가 생성하는 비대칭 행렬을 위한 특화된 정규화 기법인 특이값 거듭제곱 정규화(svPN)를 도입하여 안정적이고 효과적인 표현 학습을 보장한다.
  • 분류 토큰과 MGCrP 처리된 단어 토큰 표현을 명시적으로 융합하기 위한 세 가지 초기 융합 전략(연결, 합산, 원소별 곱셈)을 설계한다.
  • 완전한 정규화의 통계적 성질을 유지하면서도 계산 효율성을 확보하기 위해, svPN의 빠른 근사 알고리즘을 적용한다.
  • 간편성과 효율성을 확보하기 위해 단일두부 MGCrP를 사용하며, 미세조정 중에 사전 정의된 집합(예: 4K, 6K)에서 표현 크기를 선택한다.
  • 과적합 방지를 위해 미세조정 중 MGCrP 레이어에 드롭아웃을 적용하여 일반화 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1고수준 단어 토큰만으로도 기존의 분류 토큰보다 우수하거나 보완적으로 기능할 수 있는 강력한 분류기로 기능할 수 있는가?
  • RQ2Transformer 아키텍처와의 호환성을 해치지 않으면서도, 단어 토큰에서 유도된 이차 상호공분산 표현을 효과적이고 효율적으로 집계하는 방법은 무엇인가?
  • RQ3딥러닝 환경에서 상호공분산 풀링에 의해 생성된 비대칭 행렬에 적합한 정규화 전략은 무엇인가?
  • RQ4다양한 초기 융합 전략(예: 합산, 연결)이 분류 토큰과 단어 토큰 표현을 융합할 때 분류 성능 향상에 얼마나 기여하는가?
  • RQ5제안된 SoT 모델이 표준 Transformer 분류기 대비 다양한 비전 및 언어 벤치마크에서 얼마나 성능 향상을 이룰 수 있는가?

주요 결과

  • ImageNet에서 SoT는 DeiT-Tiny를 기준으로 6.4% 향상된 정확도(78.6%)를 기록했으며, T2T-14는 2.8% 향상된 74.5%를 달성했다.
  • ImageNet-A에서 SoT는 ClassT 대비 10.2% 향상된 17.5%를 기록했고, 이전 SoT 최고 기록 대비 3.2% 향상된 27.1%를 달성했다.
  • NLP 분야에서 SoT는 CoLA에서 BERT-base 성능을 3.2% 향상시켜 58.0%로 개선했으며, RTE에서는 2.1% 향상된 69.3%를 기록했다.
  • 분류 토큰과 단어 토큰의 조합(ClassT+WordT)는 개별 구성 요소를 모두 초월하는 일관된 성능 향상을 보이며, 강력한 상호보완성을 입증했다.
  • Grad-CAM 및 어텐션 맵 시각화 결과, ClassT는 전역적 맥락에 집중하는 반면 WordT는 국소적 분류 기능 영역을 강조하며, 이들의 융합은 양쪽 요소를 효과적으로 포괄함을 확인했다.
  • svPN 정규화를 적용한 MGCrP는 전역 평균 풀링 및 전역 공분산 풀링보다 더 뛰어난 성능을 보였으며, 특히 복잡한 고수준 표현을 캡처하는 데 뛰어난 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.