[논문 리뷰] DeMT: Deformable Mixer Transformer for Multi-Task Learning of Dense Prediction
DeMT는 다중 작업 밀도 예측을 위한 새로운 하이브리드 아키텍처를 제안하며, 태스크 쿼리로 탈형 변형 특징을 활용하여 태스크 인식 능력을 향상시키고 계산량을 줄입니다. 변형된 특징을 사용함으로써 전역 모델링과 태스크 간 상호작용을 개선하고, 경쟁 모델보다 더 적은 GFLOPs로 NYUD-v2 및 PASCAL-Context에서 최신 기술 수준의 성능을 달성합니다.
Convolution neural networks (CNNs) and Transformers have their own advantages and both have been widely used for dense prediction in multi-task learning (MTL). Most of the current studies on MTL solely rely on CNN or Transformer. In this work, we present a novel MTL model by combining both merits of deformable CNN and query-based Transformer for multi-task learning of dense prediction. Our method, named DeMT, is based on a simple and effective encoder-decoder architecture (i.e., deformable mixer encoder and task-aware transformer decoder). First, the deformable mixer encoder contains two types of operators: the channel-aware mixing operator leveraged to allow communication among different channels ($i.e.,$ efficient channel location mixing), and the spatial-aware deformable operator with deformable convolution applied to efficiently sample more informative spatial locations (i.e., deformed features). Second, the task-aware transformer decoder consists of the task interaction block and task query block. The former is applied to capture task interaction features via self-attention. The latter leverages the deformed features and task-interacted features to generate the corresponding task-specific feature through a query-based Transformer for corresponding task predictions. Extensive experiments on two dense image prediction datasets, NYUD-v2 and PASCAL-Context, demonstrate that our model uses fewer GFLOPs and significantly outperforms current Transformer- and CNN-based competitive models on a variety of metrics. The code are available at https://github.com/yangyangxu0/DeMT .
연구 동기 및 목표
- CNN 기반 모델의 전역 모델링 및 태스크 간 상호작용에 한계가 있으며, 트랜스포머 기반 모델은 태스크 인식 특징 분리 및 계산 비용에 문제가 있다는 점을 해결하기 위해.
- 탈형 CNN의 국소 인덕티브 바이어스와 트랜스포머의 전역 모델링 능력을 효과적으로 융합하는 통합 프레임워크를 개발하기 위해.
- 탈형 특징을 쿼리로 사용하는 쿼리 기반 어텐션 메커니즘을 도입하여 다중 작업 밀도 예측에서 효율적이고 태스크 인식 특징 학습을 가능하게 하기 위해.
- 여러 개의 밀도 예측 작업에서 성능을 유지하거나 향상시키면서도 계산 오버헤드를 줄이기 위해.
제안 방법
- DeMT 모델은 채널 인식 혼합과 공간 인식 탈형 컨볼루션을 적용하여 태스크별 탈형 특징을 생성하는 탈형 믹서 인코더를 사용합니다.
- 태스크 인식 트랜스포머 디코더는 융합된 특징에서 태스크 간 종속성을 모델링하기 위해 다중 헤드 자기 어텐션을 사용하는 태스크 상호작용 블록을 포함합니다.
- 태스크 쿼리 블록은 탈형 특징을 쿼리로 사용하고, 태스크 상호작용 특징을 키/값으로 사용하여 쿼리 기반 어텐션을 통해 태스크별 출력 특징을 생성합니다.
- 모델은 백본에서 유도된 다중 스케일 특징을 통합하고 단순하고 경량의 설계를 통해 효율성을 유지합니다.
- 모델은 세분화, 깊이 추정, 시각적 강조 추정과 같은 다중 밀도 예측 작업에서 엔드 투 엔드로 훈련됩니다.
- 절단 실험은 탈형 믹서, 태스크 상호작용, 태스크 쿼리 블록 등 각 구성 요소의 필요성을 확인합니다.
실험 결과
연구 질문
- RQ1탈형 CNN과 쿼리 기반 트랜스포머를 융합하면 계산 비용을 줄이면서도 다중 작업 밀도 예측 성능을 향상시킬 수 있는가?
- RQ2트랜스포머 디코더에서 탈형 특징을 쿼리로 사용할 경우 태스크 인식 특징 학습에 어떤 영향을 미치는가?
- RQ3태스크 상호작용 블록과 다중 스케일 특징 융합과 같은 아키텍처 구성 요소가 모델 성능에 미치는 영향은 무엇인가?
- RQ4정확도와 효율성 측면에서 DeMT는 최신 기술 수준의 CNN 및 트랜스포머 기반 MTL 모델과 비교해 어떻게 성능을 내는가?
주요 결과
- DeMT는 세분화, 깊이 추정, 인간 부분 세분화와 같은 여러 밀도 예측 작업에서 NYUD-v2 및 PASCAL-Context에서 최신 기술 수준의 성능을 달성합니다.
- Swin-B 백본을 사용할 경우 DeMT는 NYUD-v2에서 모든 지표에서 최고 성능을 기록하여 강력한 일반화 능력과 확장성을 입증합니다.
- 경쟁 기반 트랜스포머 및 CNN 모델보다 더 적은 GFLOPs를 사용하면서도 모든 평가 지표에서 승리합니다.
- 절단 실험 결과 태스크 상호작용 블록이 성능 향상에 가장 중요한 역할을 하며, 탈형 믹서의 깊이 d=4가 최적임을 확인했지만, 효율성을 고려해 d=1을 사용합니다.
- 사용된 네 가지 스케일 특징은 성능 향상에 크게 기여하여 다중 스케일 표현 학습의 중요성을 입증합니다.
- 정성적 결과는 DeMT가 Swin 기준 모델과 ATRC 모델보다 더 높은 품질과 정확도를 가진 예측을 생성함을 보여주며, 특히 SemSeg 및 인간 부분 세분화 작업에서 두드러진 성능을 보입니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.