[论文解读] MulT: An End-to-End Multitask Learning Transformer
MulT 提出了一种端到端的多任务 Transformer 框架,通过共享的 Swin Transformer 编码器和任务特定的解码器头,结合一种新颖的跨任务共享注意力机制,联合学习六项高层次视觉任务——深度估计、语义分割、重光照、表面法线估计、2D 关键点检测和边缘检测。该模型在性能上优于单任务 Transformer 模型和当前最优的多任务 CNN 模型,展现出更优的性能和对未见领域的泛化能力。
We propose an end-to-end Multitask Learning Transformer framework, named MulT, to simultaneously learn multiple high-level vision tasks, including depth estimation, semantic segmentation, reshading, surface normal estimation, 2D keypoint detection, and edge detection. Based on the Swin transformer model, our framework encodes the input image into a shared representation and makes predictions for each vision task using task-specific transformer-based decoder heads. At the heart of our approach is a shared attention mechanism modeling the dependencies across the tasks. We evaluate our model on several multitask benchmarks, showing that our MulT framework outperforms both the state-of-the art multitask convolutional neural network models and all the respective single task transformer models. Our experiments further highlight the benefits of sharing attention across all the tasks, and demonstrate that our MulT model is robust and generalizes well to new domains. Our project website is at https://ivrl.github.io/MulT/.
研究动机与目标
- 开发一种基于 Transformer 的端到端多任务学习框架,用于多样化高层次视觉任务。
- 通过共享注意力机制显式建模 2D、3D 和语义视觉任务之间的任务间依赖关系。
- 提升模型在单任务模型和现有多任务 CNN 基线上的性能与泛化能力。
- 评估框架在新分布外领域下的鲁棒性与适应能力。
- 证明在任务特定解码器之间共享注意力可增强特征学习与模型泛化能力。
提出的方法
- 模型使用 Swin Transformer 编码器从输入图像中提取共享潜在表征。
- 每个视觉任务通过一个任务特定的 Transformer 解码器头进行预测,该头关注共享编码器特征。
- 在不同任务的解码器之间引入共享的交叉注意力机制,实现任务间的特征交互。
- 整个模型通过加权多任务损失函数进行端到端训练,综合所有任务特定损失。
- 该框架支持使用单一紧凑模型联合训练和推理多个任务。
- 通过在分布外数据(如模糊化的 Taskonomy 图像和 CocoDoom 数据集)上微调,评估领域泛化能力。
实验结果
研究问题
- RQ1基于 Transformer 的模型能否在性能上优于单任务模型,联合学习多个高层次视觉任务?
- RQ2通过共享注意力机制显式建模任务间依赖关系,能否提升所有任务的性能?
- RQ3所提出的多任务 Transformer 是否比现有多任务 CNN 基线在未见领域上泛化能力更强?
- RQ4共享注意力对多任务视觉学习中的性能与参数效率有何影响?
- RQ5该模型能否在包括 2D、3D 和语义理解在内的多样化任务中保持强性能?
主要发现
- MulT 在 Taskonomy、Replica、NYU 和 CocoDoom 等标准基准上,优于所有单任务 Swin Transformer 模型和当前最优的多任务 CNN 基线(Taskgrouping [42])。
- 在存在领域偏移(高斯模糊)的 Taskonomy 数据集中,MulT 在表面法线预测任务上分别实现 12.6% 的误差(微调后)和 27.0% 的误差(未微调),显著优于 Cross-task [54] 基线(17.4% 和 46.2%)以及 Taskgrouping [42](21.9% 和 55.1%)。
- 在 CocoDoom 数据集中,MulT 在重光照任务上分别实现 13.3% 的误差(微调后)和 39.3% 的误差(未微调),优于 Cross-task [54](18.5% 和 54.3%)以及 Taskgrouping [42](25.3% 和 67.7%)。
- 消融研究证实,共享注意力显著提升了性能,尤其在低数据或分布外设置下。
- 即使未进行微调,MulT 在新领域上的泛化能力也优于现有多任务模型,展现出鲁棒性与领域自适应能力。
- 该模型通过单一共享编码器和任务特定解码器,在六项多样化视觉任务中均保持高性能,相比训练独立模型显著降低了计算成本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。