[论文解读] DeMT: Deformable Mixer Transformer for Multi-Task Learning of Dense Prediction
DeMT 提出了一种新颖的混合架构,结合可变形卷积神经网络与基于查询的 Transformer,用于多任务密集预测,利用形变特征作为任务查询以增强任务感知能力并减少计算量。该方法在 NYUD-v2 和 PASCAL-Context 数据集上实现了最先进性能,且所需 GFLOPs 数量少于现有竞争模型。
Convolution neural networks (CNNs) and Transformers have their own advantages and both have been widely used for dense prediction in multi-task learning (MTL). Most of the current studies on MTL solely rely on CNN or Transformer. In this work, we present a novel MTL model by combining both merits of deformable CNN and query-based Transformer for multi-task learning of dense prediction. Our method, named DeMT, is based on a simple and effective encoder-decoder architecture (i.e., deformable mixer encoder and task-aware transformer decoder). First, the deformable mixer encoder contains two types of operators: the channel-aware mixing operator leveraged to allow communication among different channels ($i.e.,$ efficient channel location mixing), and the spatial-aware deformable operator with deformable convolution applied to efficiently sample more informative spatial locations (i.e., deformed features). Second, the task-aware transformer decoder consists of the task interaction block and task query block. The former is applied to capture task interaction features via self-attention. The latter leverages the deformed features and task-interacted features to generate the corresponding task-specific feature through a query-based Transformer for corresponding task predictions. Extensive experiments on two dense image prediction datasets, NYUD-v2 and PASCAL-Context, demonstrate that our model uses fewer GFLOPs and significantly outperforms current Transformer- and CNN-based competitive models on a variety of metrics. The code are available at https://github.com/yangyangxu0/DeMT .
研究动机与目标
- 为解决基于 CNN 的模型在全局建模与跨任务交互方面的局限性,以及基于 Transformer 的模型在任务感知特征解耦与计算成本方面的不足。
- 开发一种统一框架,有效结合可变形 CNN 的局部归纳偏置与 Transformer 的全局建模能力。
- 通过引入基于形变特征的查询注意力机制,实现在多任务密集预测中高效且任务感知的特征学习。
- 在保持或提升多个密集预测任务性能的同时,减少计算开销。
提出的方法
- DeMT 模型采用可变形混合编码器,通过通道感知混合与空间感知可变形卷积生成特定任务的形变特征。
- 任务感知的 Transformer 解码器采用任务交互模块,利用多头自注意力机制建模融合特征中的跨任务依赖关系。
- 任务查询模块将形变特征作为查询,将任务交互后的特征作为键和值,通过基于查询的注意力机制生成特定任务的输出特征。
- 该架构整合主干网络的多尺度特征,并采用简单轻量的设计以保持高效性。
- 模型在多个密集预测任务(包括语义分割、深度估计与显著性预测)上进行端到端训练。
- 消融实验验证了各组件的必要性,包括可变形混合模块、任务交互模块与任务查询模块。
实验结果
研究问题
- RQ1将可变形 CNN 与基于查询的 Transformer 相结合,是否能在降低计算成本的同时提升多任务密集预测性能?
- RQ2在 Transformer 解码器中使用形变特征作为查询,如何增强任务感知的特征学习?
- RQ3诸如任务交互模块与多尺度特征聚合等架构组件对模型性能有何影响?
- RQ4DeMT 在准确率与效率方面相较于最先进基于 CNN 与 Transformer 的多任务学习模型表现如何?
主要发现
- DeMT 在 NYUD-v2 与 PASCAL-Context 上多个密集预测任务(包括语义分割、深度估计与人体部位分割)中均实现了最先进性能。
- 采用 Swin-B 主干网络时,DeMT 在 NYUD-v2 所有指标上均表现最佳,展现出强大的泛化能力与可扩展性。
- 该模型在参数量与计算量方面均少于竞争的 Transformer 与 CNN 模型,同时在所有评估指标上均表现更优。
- 消融实验表明,任务交互模块对性能影响最大,且可变形混合模块的深度 d=4 为最优,尽管为追求效率实际采用 d=1。
- 使用四尺度特征显著提升了性能,表明多尺度表征学习的重要性。
- 定性结果表明,DeMT 在语义分割与人体部位任务上生成的预测结果质量更高、更准确,优于 Swin 基线与 ATRC 模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。