Skip to main content
QUICK REVIEW

[논문 리뷰] DeMT: Deformable Mixer Transformer for Multi-Task Learning of Dense Prediction

Yangyang Xu, Yibo Yang|arXiv (Cornell University)|2023. 01. 09.
Domain Adaptation and Few-Shot Learning인용 수 6
한 줄 요약

DeMT는 다중 작업 밀도 예측을 위한 새로운 하이브리드 아키텍처를 제안하며, 태스크 쿼리로 탈형 변형 특징을 활용하여 태스크 인식 능력을 향상시키고 계산량을 줄입니다. 변형된 특징을 사용함으로써 전역 모델링과 태스크 간 상호작용을 개선하고, 경쟁 모델보다 더 적은 GFLOPs로 NYUD-v2 및 PASCAL-Context에서 최신 기술 수준의 성능을 달성합니다.

ABSTRACT

Convolution neural networks (CNNs) and Transformers have their own advantages and both have been widely used for dense prediction in multi-task learning (MTL). Most of the current studies on MTL solely rely on CNN or Transformer. In this work, we present a novel MTL model by combining both merits of deformable CNN and query-based Transformer for multi-task learning of dense prediction. Our method, named DeMT, is based on a simple and effective encoder-decoder architecture (i.e., deformable mixer encoder and task-aware transformer decoder). First, the deformable mixer encoder contains two types of operators: the channel-aware mixing operator leveraged to allow communication among different channels ($i.e.,$ efficient channel location mixing), and the spatial-aware deformable operator with deformable convolution applied to efficiently sample more informative spatial locations (i.e., deformed features). Second, the task-aware transformer decoder consists of the task interaction block and task query block. The former is applied to capture task interaction features via self-attention. The latter leverages the deformed features and task-interacted features to generate the corresponding task-specific feature through a query-based Transformer for corresponding task predictions. Extensive experiments on two dense image prediction datasets, NYUD-v2 and PASCAL-Context, demonstrate that our model uses fewer GFLOPs and significantly outperforms current Transformer- and CNN-based competitive models on a variety of metrics. The code are available at https://github.com/yangyangxu0/DeMT .

연구 동기 및 목표

  • CNN 기반 모델의 전역 모델링 및 태스크 간 상호작용에 한계가 있으며, 트랜스포머 기반 모델은 태스크 인식 특징 분리 및 계산 비용에 문제가 있다는 점을 해결하기 위해.
  • 탈형 CNN의 국소 인덕티브 바이어스와 트랜스포머의 전역 모델링 능력을 효과적으로 융합하는 통합 프레임워크를 개발하기 위해.
  • 탈형 특징을 쿼리로 사용하는 쿼리 기반 어텐션 메커니즘을 도입하여 다중 작업 밀도 예측에서 효율적이고 태스크 인식 특징 학습을 가능하게 하기 위해.
  • 여러 개의 밀도 예측 작업에서 성능을 유지하거나 향상시키면서도 계산 오버헤드를 줄이기 위해.

제안 방법

  • DeMT 모델은 채널 인식 혼합과 공간 인식 탈형 컨볼루션을 적용하여 태스크별 탈형 특징을 생성하는 탈형 믹서 인코더를 사용합니다.
  • 태스크 인식 트랜스포머 디코더는 융합된 특징에서 태스크 간 종속성을 모델링하기 위해 다중 헤드 자기 어텐션을 사용하는 태스크 상호작용 블록을 포함합니다.
  • 태스크 쿼리 블록은 탈형 특징을 쿼리로 사용하고, 태스크 상호작용 특징을 키/값으로 사용하여 쿼리 기반 어텐션을 통해 태스크별 출력 특징을 생성합니다.
  • 모델은 백본에서 유도된 다중 스케일 특징을 통합하고 단순하고 경량의 설계를 통해 효율성을 유지합니다.
  • 모델은 세분화, 깊이 추정, 시각적 강조 추정과 같은 다중 밀도 예측 작업에서 엔드 투 엔드로 훈련됩니다.
  • 절단 실험은 탈형 믹서, 태스크 상호작용, 태스크 쿼리 블록 등 각 구성 요소의 필요성을 확인합니다.

실험 결과

연구 질문

  • RQ1탈형 CNN과 쿼리 기반 트랜스포머를 융합하면 계산 비용을 줄이면서도 다중 작업 밀도 예측 성능을 향상시킬 수 있는가?
  • RQ2트랜스포머 디코더에서 탈형 특징을 쿼리로 사용할 경우 태스크 인식 특징 학습에 어떤 영향을 미치는가?
  • RQ3태스크 상호작용 블록과 다중 스케일 특징 융합과 같은 아키텍처 구성 요소가 모델 성능에 미치는 영향은 무엇인가?
  • RQ4정확도와 효율성 측면에서 DeMT는 최신 기술 수준의 CNN 및 트랜스포머 기반 MTL 모델과 비교해 어떻게 성능을 내는가?

주요 결과

  • DeMT는 세분화, 깊이 추정, 인간 부분 세분화와 같은 여러 밀도 예측 작업에서 NYUD-v2 및 PASCAL-Context에서 최신 기술 수준의 성능을 달성합니다.
  • Swin-B 백본을 사용할 경우 DeMT는 NYUD-v2에서 모든 지표에서 최고 성능을 기록하여 강력한 일반화 능력과 확장성을 입증합니다.
  • 경쟁 기반 트랜스포머 및 CNN 모델보다 더 적은 GFLOPs를 사용하면서도 모든 평가 지표에서 승리합니다.
  • 절단 실험 결과 태스크 상호작용 블록이 성능 향상에 가장 중요한 역할을 하며, 탈형 믹서의 깊이 d=4가 최적임을 확인했지만, 효율성을 고려해 d=1을 사용합니다.
  • 사용된 네 가지 스케일 특징은 성능 향상에 크게 기여하여 다중 스케일 표현 학습의 중요성을 입증합니다.
  • 정성적 결과는 DeMT가 Swin 기준 모델과 ATRC 모델보다 더 높은 품질과 정확도를 가진 예측을 생성함을 보여주며, 특히 SemSeg 및 인간 부분 세분화 작업에서 두드러진 성능을 보입니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.