Skip to main content
QUICK REVIEW

[논문 리뷰] Attention mechanisms and deep learning for machine vision: A survey of the state of the art

Abdul Mueed Hafiz, Shabir A. Parah|arXiv (Cornell University)|2021. 06. 03.
Advanced Neural Network Applications인용 수 5
한 줄 요약

이 종합 검토는 기계 시각 분야에서 주의 메커니즘과 딥 러닝에 대해 포괄적인 개요를 제공하며, 특히 비전 트랜스포머(ViTs)와 합성곱 신경망(CNNs)의 하이브리드화에 중점을 둡니다. 자기주의(self-attention), 마스크된 주의(masks attention), 다중 헤드 주의(multi-head attention) 메커니즘을 분석하고, 이미지 분류 및 객체 검출과 같은 작업에서 ViT의 성능을 평가하며, 데이터 수요와 높은 계산 비용과 같은 주요 과제를 밝히고, 효율성과 정확성의 균형을 이루기 위해 하이브리드 CNN-ViT 아키텍처를 지지합니다.

ABSTRACT

With the advent of state of the art nature-inspired pure attention based models i.e. transformers, and their success in natural language processing (NLP), their extension to machine vision (MV) tasks was inevitable and much felt. Subsequently, vision transformers (ViTs) were introduced which are giving quite a challenge to the established deep learning based machine vision techniques. However, pure attention based models/architectures like transformers require huge data, large training times and large computational resources. Some recent works suggest that combinations of these two varied fields can prove to build systems which have the advantages of both these fields. Accordingly, this state of the art survey paper is introduced which hopefully will help readers get useful information about this interesting and potential research area. A gentle introduction to attention mechanisms is given, followed by a discussion of the popular attention based deep architectures. Subsequently, the major categories of the intersection of attention mechanisms and deep learning for machine vision (MV) based are discussed. Afterwards, the major algorithms, issues and trends within the scope of the paper are discussed.

연구 동기 및 목표

  • 기계 시각 분야에서 주의 메커니즘과 딥 러닝 통합에 대한 체계적인 검토를 제공하기 위해.
  • 기존의 CNN 기반 모델과 비교하여 비전 트랜스포머(ViTs)의 강점과 한계를 분석하기 위해.
  • CNN과 트랜스포머를 융합하여 두 접근법의 장점을 살린 하이브리드 아키텍처를 탐색하기 위해.
  • ViT의 훈련에 있어 데이터 효율성, 훈련 시간, 계산 자원 요구 사항과 같은 열린 연구 과제를 특정하기 위해.
  • 연구자들과 실무자들이 기계 시각 응용 분야에서 주의 기반 모델을 효과적으로 활용할 수 있도록 안내하기 위해.

제안 방법

  • 기계 시각 분야에서 주의 메커니즘과 딥 러닝 적용에 대한 분석을 위해 110篇 이상의 연구 논문을 검토하였습니다.
  • 질의, 키, 값의 사용을 통해 시퀀스 내 모든 요소 간의 관련성 점수를 계산하는 자기주의(self-attention)를 도입하였습니다.
  • 자기적 모델링에서 정보 泄漏를 방지하기 위해 삼각형 마스크 행렬을 사용하는 마스크된 자기주의(masks self-attention)를 설명하였습니다.
  • 다중 주의 헤드를 동시에 적용하여 다양한 종속성을 모델링할 수 있는 다중 헤드 주의(multi-head attention) 메커니즘을 기술하였습니다.
  • 세 가지 주요 유형의 하이브리드 모델을 검토하였습니다: 주의 강화 CNNs(CBAM 등), CNN-선생/트랜스포머-학생 파ipeline, 엔드 투 엔드 CNN-트랜스포머 아키텍처.
  • 네트워크 아키텍처 탐색(NAS)이 하이브리드 CNN-트랜스포머 탐색 공간을 최적화하는 데 기여하는 바를 평가하였지만, 계산 비용이 높다는 점을 언급하였습니다.

실험 결과

연구 질문

  • RQ1비전 트랜스포머에서 자기주의 메커니즘은 CNN의 국소 수용장( receptive fields)과 비교해 어떻게 전역적 특징 모델링을 가능하게 하는가?
  • RQ2기계 시각 작업에서 순수한 비전 트랜스포머와 CNN 기반 모델 간의 주요 성능 및 효율성 트레이드오프는 무엇인가?
  • RQ3CNN과 트랜스포머를 융합한 하이브리드 아키텍처는 성능 향상을 이끌어내면서도 데이터 및 계산 요구량을 어떻게 줄일 수 있는가?
  • RQ4ViT 훈련에서 주요한 열린 과제들, 예를 들어 데이터 수요와 장시간 훈련은 무엇인가?
  • RQ5기존의 딥 러닝 파이프라인에 주의 메커니즘을 효과적으로 통합하여 기계 시각 시스템 설계를 향상시킬 수 있는 방법은 무엇인가?

주요 결과

  • 비전 트랜스포머(ViTs)는 이미지 분류, 객체 검출, 세그멘테이션, 영상 이해 작업에서 CNN과 동등하거나 더 뛰어난 성능을 달성합니다.
  • ViTs는 대규모 데이터셋인 JFT-300M에서 사전 훈련을 거친 후 ImageNet-1K에서 미세조정을 거쳐 강력한 성능을 내기 위해 매우 많은 데이터가 필요로 합니다.
  • 성능가치는 높지만, ViTs는 훨씬 더 긴 훈련 시간과 높은 계산 자원을 요구하여 자원 제약이 있는 환경에서는 실용성이 떨어집니다.
  • CNN에 주의 메커니즘을 통합한 하이브리드 모델(CBAM 등)은 최소한의 계산 오버헤드로 성능 향상을 보이며, 점진적 향상 잠재력을 보여줍니다.
  • CNN을 특징 추출기로 사용하고 트랜스포머를 분류기로 사용하는 이중 단계 파이프라인은 CNN의 특징 표현 품질에 강하게 의존하며, 이는 백본 설계의 중요성을 강조합니다.
  • NAS를 통해 CNN과 트랜스포머를 통합한 엔드 투 엔드 하이브리드 아키텍처는 유망하지만 여전히 계산 비용이 높고, 광범위한 배포를 위해 추가 최적화가 필요합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.