Skip to main content
QUICK REVIEW

[논문 리뷰] TVT: Training-Free Vision Transformer Search on Tiny Datasets

Zimian Wei, Hengyue Pan|arXiv (Cornell University)|2023. 11. 24.
Advanced Neural Network Applications인용 수 6
한 줄 요약

TVT는 희소 데이터셋에서 지식 정복을 위한 훈련 없이 사용자 정의된 비전 트랜스포머 아키텍처 검색 프레임워크를 제안하며, 주어진 어텐션 맵 유사도 기반의 티처 인식 메트릭과 L2 정규화된 가중치를 이용한 학습자 능력 메트릭을 활용한다. 이는 훈련이 전혀 필요 없이 교사 지도를 통합한 제로비용 프록시 평가를 통해 최신 기술 수준의 순서 일致성과 정복 정확도를 달성한다.

ABSTRACT

Training-free Vision Transformer (ViT) architecture search is presented to search for a better ViT with zero-cost proxies. While ViTs achieve significant distillation gains from CNN teacher models on small datasets, the current zero-cost proxies in ViTs do not generalize well to the distillation training paradigm according to our experimental observations. In this paper, for the first time, we investigate how to search in a training-free manner with the help of teacher models and devise an effective Training-free ViT (TVT) search framework. Firstly, we observe that the similarity of attention maps between ViT and ConvNet teachers affects distill accuracy notably. Thus, we present a teacher-aware metric conditioned on the feature attention relations between teacher and student. Additionally, TVT employs the L2-Norm of the student's weights as the student-capability metric to improve ranking consistency. Finally, TVT searches for the best ViT for distilling with ConvNet teachers via our teacher-aware metric and student-capability metric, resulting in impressive gains in efficiency and effectiveness. Extensive experiments on various tiny datasets and search spaces show that our TVT outperforms state-of-the-art training-free search methods. The code will be released.

연구 동기 및 목표

  • 소규모 데이터셋에서 비전 트랜스포머에 대한 기존 제로비용 프록시가 지식 정복 시나리오에서 일반화 능력이 떨어지는 문제를 해결한다.
  • 검색 중에 교사 모델 정보를 활용하지 못하는 현재의 훈련 없이 사용자 정의된 아키텍처 검색 방법의 한계를 극복한다.
  • 교사-학습자 특징 정렬과 학습자 모델 용량을 모두 통합하여 검색 효율성을 향상시킬 수 있는 제로비용 프록시를 설계한다.
  • 소규모 데이터셋에서 높은 정복 정확도를 달성하면서도 최소한의 계산 비용으로 훈련 없이 효율적인 ViT 아키텍처 검색을 가능하게 한다.

제안 방법

  • 교사 인식 메트릭($\mathcal{M}_t$)과 학습자 능력 메트릭($\mathcal{M}_s$)으로 구성된 새로운 제로비용 프록시를 도입한다.
  • $\mathcal{M}_t$는 학습자 ViT와 컨볼루션 네트워크 교사 간의 공간 어텐션 맵 간의 L2 거리를 계산하여 특징 표현 유사도를 측정한다.
  • $\mathcal{M}_s$는 학습자 모델의 가중치 L2 노름을 사용하여 그 표현 용량을 추정한다.
  • $\mathcal{M}_t$와 $\mathcal{M}_s$를 학습 가능한 가중치 $\alpha$와 $\beta$를 사용하여 복합 점수로 조합하여 교사 지도와 학습자 능력 간의 균형을 맞춘다.
  • 초기화 단계에서 단일 순방향 전파만을 사용하여 복합 TVT 프록시 점수에 기반해 후보 ViT를 순위 매겨 아키텍처 검색을 수행한다.
  • 사전 정의된 컨볼루션 네트워크 교사 모델을 사용하여 로지트 활성화를 통한 국소성 유도 지식 정복을 적용하여 검색된 ViT를 미세 조정한다.

실험 결과

연구 질문

  • RQ1기존 제로비용 프록시는 소규모 데이터셋에서 비전 트랜스포머에 대한 지식 정복 시나리오에서 왜 일반화 성능이 떨어지는가?
  • RQ2훈련 없이 사용자 정의된 아키텍처 검색에 효과적으로 교사 모델 정보를 통합하여 정복 성능을 향상시킬 수 있는 방법은 무엇인가?
  • RQ3학습자 모델 용량은 정복 정확도에 어떤 역할을 하는가? 그리고 훈련 없이 이를 어떻게 정량화할 수 있는가?
  • RQ4교사-학습자 어텐션 정렬과 학습자 가중치 크기를 통합한 하이브리드 프록시는 순서 일치성과 검색 정확도를 향상시킬 수 있는가?

주요 결과

  • CIFAR-100에서 TVT는 최고의 켄달 순서 상관관계(0.76)를 기록했으며, Flowers에서는 0.84를 기록하여 NWOT(0.46 및 0.57)와 DSS(0.74 및 0.72)를 크게 앞서나갔다.
  • 초양 데이터셋에서 TVT는 85.83%의 정복 정확도를 달성하여 DSS(85.13%)와 NWOT(85.13%)를 초월하여 뛰어난 검색 효율성을 입증했다.
  • 절단 실험을 통해 어텐션 맵 기반의 $\mathcal{M}_t$가 가장 높은 성능을 보였으며(켄달 0.46), MMD 및 샘플 관계 방법보다 뛰어났다.
  • 최적의 초모수 $\alpha = 2$, $\beta = -3$는 최고의 순서 일치성(켄달 0.67)을 제공하여 교사 및 학습자 신호 간 균형 조절의 중요성을 입증했다.
  • TVT는 기존의 순수 ViT 대비 최대 10%까지 정복 정확도를 향상시켜 검색된 아키텍처를 활용한 지식 정복의 효과성을 확인했다.
  • TVT는 후보 모델당 단일 순방향 전파만을 요구하여 훈련이나 슈퍼넷 계산을 전혀 피하므로 높은 효율성을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.