Skip to main content
QUICK REVIEW

[논문 리뷰] Revitalizing CNN Attentions via Transformers in Self-Supervised Visual Representation Learning

Chongjian Ge, Youwei Liang|arXiv (Cornell University)|2021. 10. 11.
Domain Adaptation and Few-Shot Learning참고 문헌 46인용 수 6
한 줄 요약

이 논문은 자기지도 학습 시각 표현 학습에서 CNN의 주의 메커니즘을 새롭게 활성화하기 위해 병렬 트랜스포머 스트림을 통해 CNN 인코더 학습을 안내하는 새로운 프레임워크 CARE를 제안한다. 트랜스포머가 추출한 시각적 주의를 이용해 CNN 특징을 감독함으로써, CARE는 최소한의 계산 부담으로도 이미지 분류, 객체 검출, 세분화 벤치마크에서 최고 수준의 성능을 달성한다.

ABSTRACT

Studies on self-supervised visual representation learning (SSL) improve encoder backbones to discriminate training samples without labels. While CNN encoders via SSL achieve comparable recognition performance to those via supervised learning, their network attention is under-explored for further improvement. Motivated by the transformers that explore visual attention effectively in recognition scenarios, we propose a CNN Attention REvitalization (CARE) framework to train attentive CNN encoders guided by transformers in SSL. The proposed CARE framework consists of a CNN stream (C-stream) and a transformer stream (T-stream), where each stream contains two branches. C-stream follows an existing SSL framework with two CNN encoders, two projectors, and a predictor. T-stream contains two transformers, two projectors, and a predictor. T-stream connects to CNN encoders and is in parallel to the remaining C-Stream. During training, we perform SSL in both streams simultaneously and use the T-stream output to supervise C-stream. The features from CNN encoders are modulated in T-stream for visual attention enhancement and become suitable for the SSL scenario. We use these modulated features to supervise C-stream for learning attentive CNN encoders. To this end, we revitalize CNN attention by using transformers as guidance. Experiments on several standard visual recognition benchmarks, including image classification, object detection, and semantic segmentation, show that the proposed CARE framework improves CNN encoder backbones to the state-of-the-art performance.

연구 동기 및 목표

  • 자기지도 시각 표현 학습에서 CNN 인코더 내에서 다루어지지 않은 시각적 주의 문제를 해결하기 위해.
  • 핵심 SSL 프레임워크를 변경하지 않고 시각 트랜스포머의 주의 메커니즘을 활용해 CNN 인코더 성능을 향상시키기 위해.
  • 트랜스포머의 주의 특징과 유사한 주의 특징을 학습할 수 있는 학습 체계를 개발하여, 추론 비용을 낮게 유지하기 위해.
  • 트랜스포머 지도 주의 감독이 다운스트림 시각 인식 작업을 위한 CNN의 특징 품질을 향상시킨다는 것을 검증하기 위해.

제안 방법

  • CARE는 이중 스트림 아키텍처를 사용한다: CNN 스트림(C-스트림)과 병렬된 트랜스포머 스트림(T-스트림)으로, 둘 다 인코더, 프로젝터, 예측기와 함께 대비 SSL 파이프라인을 따르고 있다.
  • T-스트림은 CNN 인코더의 특징을 입력으로 받아 멀티헤드 자기주도 주의를 적용하여 향상된 주의 특징 표현을 생성한다.
  • T-스트림의 출력은 주의 인식 특징에 대한 대비 손실을 통해 C-스트림을 감독하는 데 사용되며, 이는 CNN이 유사한 주의 특징을 학습하도록 유도한다.
  • 초파rameter λ를 가진 원래 SSL 대비 손실과 주의 감독 손실의 가중 조합을 사용하여 두 스트림을 함께 최적화한다.
  • T-스트림은 주의 학습을 향상시키기 위해 학습 가능한 상대적 위치 인코딩을 사용하며, 고정된 사인파형 또는 위치 인코딩 없이 사용하는 것보다 성능이 뛰어나다.
  • 프레임워크는 병렬 학습 설계를 사용하여 두 스트림을 동시에 업데이트함으로써 CNN 인코더에 효과적인 주의 안내를 보장한다.

실험 결과

연구 질문

  • RQ1시각 트랜스포머가 학습한 시각적 주의가 자기지도 학습에서 CNN 인코더 특징 향상에 효과적으로 전이될 수 있는가?
  • RQ2CNN 학습을 위해 병렬 트랜스포머 스트림을 사용하는 것이 표준 SSL 학습만으로는 달성할 수 없는 더 나은 특징 표현을 제공하는가?
  • RQ3위치 인코딩의 선택과 트랜스포머 블록 수가 감독된 CNN 인코더 성능에 미치는 영향은 어떠한가?
  • RQ4CARE 프레임워크에서 대비 SSL 손실과 주의 감독 손실 간의 최적 균형은 무엇인가?

주요 결과

  • ResNet-50를 사용하여 100개의 학습 에포크 동안 ImageNet에서 CARE는 상위 1 정확도 72.06%를 달성하여 표준 SSL 방법을 능가한다.
  • 주의 손실 가중치 λ = 100으로 설정할 경우 최고 성능을 기록하며, λ = 0일 때(70.52%)보다 1.54% 향상된다.
  • T-스트림에서 다섯 개의 트랜스포머 블록(n = 5)을 사용할 경우 최적의 성능을 기록하며, 여섯 개로 늘일 경우 손실 균형이 깨지면서 성능이 저하된다.
  • T-스트림에서 학습 가능한 상대적 위치 인코딩을 사용할 경우 상위 1 정확도 72.06%를 기록하며, 고정된 사인파형 인코딩(66.68%)과 위치 인코딩 없이 사용할 경우(69.49%)보다 뚜렷이 뛰어나다.
  • T-스트림의 병렬 설계는 순차적 학습(72.02% 대비 69.32%)보다 성능이 뛰어나며, 이는 공동 최적화가 효과적인 주의 안내를 위해 필수적임을 시사한다.
  • 다운스트림 작업에서 CARE는 ResNet-50 성능을 객체 검출(COCO AP: 57.2)과 세분화(PASCAL VOC mIoU: 38.8)에서 최고 수준으로 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.