Skip to main content
QUICK REVIEW

[논문 리뷰] Visual Transformer for Task-aware Active Learning

Razvan Caramalau, Binod Bhattarai|arXiv (Cornell University)|2021. 06. 07.
Machine Learning and Algorithms참고 문헌 19인용 수 5
한 줄 요약

이 논문은 레이블이 부여된 예제와 레이블이 미부여된 예제 간의 비국소적 종속성을 모델링하기 위해 시각적 트랜스포머(VT)를 액티브 러닝에 통합하는 새로운 작업 인식 통합 학습 프레임워크를 제안한다. 레이블이 부여된 대비 레이블이 미부여된 판별자와 작업별 손실을 함께 사용하여 학습자와 샘플러를 공동으로 훈련시킴으로써, 이미지 분류 및 객체 검출 벤치마크 전반에서 최신 기술 수준의 성능을 달성하며, 이전 방법들보다 뚜렷한 성능 향상을 보였다.

ABSTRACT

Pool-based sampling in active learning (AL) represents a key framework for an-notating informative data when dealing with deep learning models. In this paper, we present a novel pipeline for pool-based Active Learning. Unlike most previous works, our method exploits accessible unlabelled examples during training to estimate their co-relation with the labelled examples. Another contribution of this paper is to adapt Visual Transformer as a sampler in the AL pipeline. Visual Transformer models non-local visual concept dependency between labelled and unlabelled examples, which is crucial to identifying the influencing unlabelled examples. Also, compared to existing methods where the learner and the sampler are trained in a multi-stage manner, we propose to train them in a task-aware jointly manner which enables transforming the latent space into two separate tasks: one that classifies the labelled examples; the other that distinguishes the labelling direction. We evaluated our work on four different challenging benchmarks of classification and detection tasks viz. CIFAR10, CIFAR100,FashionMNIST, RaFD, and Pascal VOC 2007. Our extensive empirical and qualitative evaluations demonstrate the superiority of our method compared to the existing methods. Code available: https://github.com/razvancaramalau/Visual-Transformer-for-Task-aware-Active-Learning

연구 동기 및 목표

  • 초기 훈련 단계에서 레이블이 부여되지 않은 데이터를 활용하여 액티브 러닝의 콜드 스타트 문제를 해결한다.
  • 레이블이 부여된 예제와 레이블이 미부여된 예제 간의 비국소적 시각적 종속성을 모델링하여 풀 기반 액티브 러닝에서의 샘플 선택을 향상시킨다.
  • 최종 작업 성능과 정보성 있는 샘플 선택을 동시에 최적화하는 통합 학습 프레임워크를 개발한다.
  • 시각적 트랜스포머를 액티브 러닝에 처음으로 적용하여 국소적 특징을 초월한 장거리 시각적 개념 모델링을 가능하게 한다.
  • 분류 및 객체 검출 작업 모두에 걸쳐 다양한 벤치마크(실제 및 합성 데이터 포함)에서의 일반화 능력을 입증한다.

제안 방법

  • 배치 내 레이블이 부여된 예제와 레이블이 미부여된 예제 간의 비국소적 상호작용을 모델링하기 위해, 컨볼루션 특징 추출기와 최종 분류기 사이에 시각적 트랜스포머(VT) 모듈을 통합한다.
  • 최종 작업 손실(예: 분류의 경우 교차 엔트로피, 검출의 경우 SSD 손실)과 레이블이 부여된 대비 레이블이 미부여된 판별자 손실을 모두 최소화하는 공동 학습 목표를 사용한다.
  • 레이블이 부여된 예제와 레이블이 미부여된 예제의 각 특징 표현을 VT 입력의 별개 토큰으로 간주하여 배치 전체에 걸친 크로스-예제 어텐션을 가능하게 한다.
  • VT 처리된 특징 공간에서의 불확실성 추정을 활용하여, 시각적으로 구별되며 정보가 풍부한 레이블이 미부여된 예제를 선별한다.
  • 객체 검출에 맞게 아키텍처를 변형하여 VT 버팀목을 SSD 신뢰도 헤드에 배치하고, SSD 손실을 작업별 목표 함수로 사용한다.
  • 증강된 실제(RaFD) 및 합성(StarGAN 생성) 얼굴 표정 데이터를 기반으로 한 합성 데이터 서브샘플링에 프레임워크를 확장한다.

실험 결과

연구 질문

  • RQ1시각적 트랜스포머가 레이블이 부여된 예제와 레이블이 미부여된 예제 간의 비국소적 시각적 종속성을 효과적으로 모델링하여 액티브 러닝 성능을 향상시킬 수 있는가?
  • RQ2공동 목표를 통해 학습자와 샘플러를 함께 훈련하는 것이 다단계 훈련에 비해 더 나은 샘플 선택과 모델 일반화를 이끌어내는가?
  • RQ3제안된 방법은 이미지 분류 및 객체 검출 작업 모두에 걸쳐 다양한 벤치마크에서 어떻게 성능을 발휘하는가?
  • RQ4합성 데이터 서브샘플링에 일반화할 수 있으며, 이러한 환경에서 기존 방법들보다 뛰어난 성능을 보이는가?
  • RQ5배치 크기와 VT 깊이와 같은 아키텍처 선택의 영향은 프레임워크의 확장성과 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법인 TJLS(Task-aware Joint Learning with Visual Transformer)는 CIFAR10, CIFAR100, FashionMNIST, RaFD, Pascal VOC 2007에서 최신 기술 수준의 성능을 달성한다.
  • Pascal VOC 2007 객체 검출에서, TJLS는 7개의 선택 단계 후 76% 이상의 mAP를 기록하며, 이전 최신 기술 수준 방법인 Learning Loss 및 CDAL을 능가한다.
  • StarGAN으로 생성된 합성 얼굴 표정 데이터에서의 서브샘플링 과정에서, 기존 베이스라인에 비해 상당한 성능 향상을 보이며, 합성 데이터 증강에 대한 강력한 일반화 능력을 입증한다.
  • VT 기반 샘플링을 통한 공동 학습 프레임워크는 기존 방법들에 비해 초기 단계에서 성능 포화 현상을 줄여주며, 특히 데이터가 부족한 경우에 두드러진다.
  • 제한된 데이터 조건에서도 강인한 성능을 유지하며, 냉각 시작 문제에도 불구하고 여러 벤치마크에서 일관된 성능 향상을 보인다.
  • 모든 벤치마크에서 TJLS는 VT 없이 구현된 JLS보다 뛰어난 성능을 보이며, 시각적 트랜스포머를 통한 비국소적 종속성 모델링의 유용성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.