[논문 리뷰] Vision Transformer with Convolutions Architecture Search
이 논문은 복잡한 시각 작업에서 노이즈, 스케일, 이동에 대한 불변성을 요구하는 순수한 비전 트랜스포머의 한계를 해결하기 위해 컨볼루션 인덕티브 바이어스를 비전 트랜스포머에 통합한 신경망 아키텍처 탐색 방법인 '비전 트랜스포머 컨볼루션 아키텍처 탐색(VTCAS)'을 제안한다. 다중 헤드 어텐션과 컨볼루션 연산을 동시에 최적화함으로써, VTCAS는 ImageNet-1K에서 82.0%의 top-1 정확도와 COCO2017에서 50.4%의 mAP를 달성하는 하이브리드 백본을 발견하여 저조도 및 복잡한 시각 작업에서 향상된 강건성을 입증한다.
Transformers exhibit great advantages in handling computer vision tasks. They model image classification tasks by utilizing a multi-head attention mechanism to process a series of patches consisting of split images. However, for complex tasks, Transformer in computer vision not only requires inheriting a bit of dynamic attention and global context, but also needs to introduce features concerning noise reduction, shifting, and scaling invariance of objects. Therefore, here we take a step forward to study the structural characteristics of Transformer and convolution and propose an architecture search method-Vision Transformer with Convolutions Architecture Search (VTCAS). The high-performance backbone network searched by VTCAS introduces the desirable features of convolutional neural networks into the Transformer architecture while maintaining the benefits of the multi-head attention mechanism. The searched block-based backbone network can extract feature maps at different scales. These features are compatible with a wider range of visual tasks, such as image classification (32 M parameters, 82.0% Top-1 accuracy on ImageNet-1K) and object detection (50.4% mAP on COCO2017). The proposed topology based on the multi-head attention mechanism and CNN adaptively associates relational features of pixels with multi-scale features of objects. It enhances the robustness of the neural network for object recognition, especially in the low illumination indoor scene.
연구 동기 및 목표
- 노이즈, 스케일, 이동에 대한 불변성을 요구하는 복잡한 시각 작업을 다룰 때 순수한 비전 트랜스포머의 한계를 해결하기 위해.
- 컨볼루션 신경망(CNN)의 인덕티브 바이어스를 트랜스포머 아키텍처에 통합하여 특징 표현을 향상시키기 위해.
- 어텐션과 컨볼루션 연산을 동시에 최적화하는 연속 가능한 아키텍처 탐색 프레임워크를 개발하기 위해.
- 이미지 분류 및 객체 검출과 같은 다양한 시각 작업에 대응할 수 있는 다중 척도 특징 추출 백본을 설계하기 위해.
- 특히 저조도 실내 환경에서의 도전적인 조건에서 모델의 강건성을 향상시키기 위해.
제안 방법
- 블록 기반 탐색 파라다임 내에서 다중 헤드 자기어텐션과 디프웨이즈 분리형 컨볼루션을 조합한 연속 가능한 아키텍처 탐색 공간을 제안한다.
- 어텐션과 컨볼루션 연산 간의 균형을 고려하여 최적의 아키텍처를 샘플링할 수 있도록 학습하는 탐색 컨트롤러를 도입한다.
- 다양한 수신장 영역에서 특징을 처리하는 탐색된 블록을 활용한 다중 척도 특징 추출 전략을 적용한다.
- 탐색 과정 중 후보 아키텍처를 효율적으로 평가하기 위해 ImageNet-1K에서 프록시 학습 전략을 활용한다.
- 이산적인 아키텍처 선택을 통해 순환 역전파를 가능하게 하기 위해 아키텍처 샘플링 과정을 연속화한 허용을 적용한다.
- 트랜스포머의 글로벌 모델링 능력을 유지하면서도 CNN의 국소적 인덕티브 바이어스를 통합한 하이브리드 백본을 설계한다.
실험 결과
연구 질문
- RQ1컨볼루션 인덕티브 바이어스를 다중 헤드 어텐션 메커니즘과 조합함으로써 복잡한 시각 작업에서 성능 향상을 이룰 수 있는가?
- RQ2통합된 탐색 공간 내에서 어텐션과 컨볼루션 연산을 효과적으로 균형 잡는 신경망 아키텍처 탐색 프레임워크는 어떻게 설계할 수 있는가?
- RQ3저조도 및 혼잡한 실내 환경에서의 강건성을 향상시키는 데 기여하는 아키텍처 설계는 무엇인가?
- RQ4탐색된 하이브리드 아키텍처는 이미지 분류 및 객체 검출과 같은 다양한 시각 작업에 얼마나 넓게 일반화될 수 있는가?
- RQ5다중 척도 특징 학습 통합이 비전 트랜스포머의 표현 품질을 향상시키는 데 기여하는가?
주요 결과
- VTCAS가 식별한 백본은 오직 3200만 파라미터로만 ImageNet-1K에서 82.0%의 top-1 정확도를 달성하여 많은 기존 비전 트랜스포머를 능가한다.
- COCO2017 객체 검출 벤치마크에서 탐색된 모델은 50.4%의 mAP를 기록하여 조밀한 예측 작업으로의 강력한 일반화 능력을 입증한다.
- 하이브리드 아키텍처는 저조도 실내 환경에서 뛰어난 강건성을 보이며 조명 변화에 대한 향상된 불변성을 나타낸다.
- 컨볼루션 연산의 통합은 글로벌 컨텍스트 모델링을 포기하지 않은 채 스케일 및 이동 불변성을 위한 특징 학습을 향상시킨다.
- 탐색 과정은 국소적 및 글로벌 특징 추출을 균형 잡은 블록 기반 아키텍처를 성공적으로 식별하여 다양한 작업에서 성능 향상을 이룬다.
- 제안된 방법은 프록시 학습 전략을 통해 효율적인 아키텍처 탐색을 가능하게 하여 계산 비용을 줄이면서도 높은 정확도를 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.