[论文解读] Open Vocabulary Multi-Label Classification with Dual-Modal Decoder on Aligned Visual-Textual Features
本文提出 ADDS,一种新颖的开放词汇多标签分类框架,采用双模态解码器(DM-Decoder)融合对齐的视觉与文本特征,实现了在开放词汇、单标签到多标签以及传统多标签分类任务上的最先进性能。该方法通过利用视觉-文本对齐、用于高分辨率适应的金字塔前向传播(Pyramid-Forwarding)以及选择性语言监督,实现了在 NUS-WIDE、ImageNet-1k、ImageNet-21k 和 MS-COCO 基准上的最先进结果。
In computer vision, multi-label recognition are important tasks with many real-world applications, but classifying previously unseen labels remains a significant challenge. In this paper, we propose a novel algorithm, Aligned Dual moDality ClaSsifier (ADDS), which includes a Dual-Modal decoder (DM-decoder) with alignment between visual and textual features, for open-vocabulary multi-label classification tasks. Then we design a simple and yet effective method called Pyramid-Forwarding to enhance the performance for inputs with high resolutions. Moreover, the Selective Language Supervision is applied to further enhance the model performance. Extensive experiments conducted on several standard benchmarks, NUS-WIDE, ImageNet-1k, ImageNet-21k, and MS-COCO, demonstrate that our approach significantly outperforms previous methods and provides state-of-the-art performance for open-vocabulary multi-label classification, conventional multi-label classification and an extreme case called single-to-multi label classification where models trained on single-label datasets (ImageNet-1k, ImageNet-21k) are tested on multi-label ones (MS-COCO and NUS-WIDE).
研究动机与目标
- 为解决在多标签图像识别中对训练期间未见过的标签进行分类的挑战,特别是在测试标签在训练阶段未出现的开放词汇设置下。
- 通过利用具有对齐视觉与文本嵌入的预训练视觉-语言模型,提升对已见标签之外的泛化能力。
- 通过一种分辨率自适应的推理机制,在无需微调的情况下实现对高分辨率图像的有效多标签分类。
- 通过选择性语言监督提升模型性能,尤其在低资源或单标签到多标签迁移场景中。
提出的方法
- 该方法的核心是双模态解码器(DM-Decoder),一种基于 Transformer 的解码器,通过逐步融合视觉特征与文本嵌入,提升语义理解能力。
- 在预训练过程中,通过对比学习目标对齐视觉与文本特征,确保语义相似的图像-文本对在共享嵌入空间中彼此靠近。
- 金字塔前向传播(Pyramid-Forwarding)通过在多尺度处理特征图,实现高分辨率推理,保留空间细节并提升大输入下的性能。
- 选择性语言监督通过在微调过程中聚焦于相关标签,提升模型对未见标签的泛化能力。
- 该框架在 ImageNet-1k 和 ImageNet-21k 上进行训练,并在 NUS-WIDE 和 MS-COCO 上进行评估,同时实现零样本迁移至多标签和开放词汇设置。
- 模型使用 ViT-L-336 作为图像编码器,并通过在来自预训练文本编码器的标签嵌入上使用交叉熵损失进行微调。
实验结果
研究问题
- RQ1是否双模态解码器通过融合视觉与文本特征,能够在零样本和开放词汇多标签分类任务上超越现有方法?
- RQ2在低分辨率预训练模型中,金字塔前向传播在无需微调的情况下,对实现高分辨率推理的有效性如何?
- RQ3通过选择性语言监督增加训练类别数量,是否能提升单标签到多标签分类任务中的性能?
- RQ4在开放词汇设置中,视觉-文本对齐(而非仅图像或文本编码器)对性能提升的贡献有多大?
- RQ5所提出方法与 SOTA 模型(如 ML-Decoder 和 Q2L)在包括 NUS-WIDE、ImageNet-1k、ImageNet-21k 和 MS-COCO 在内的多样化基准上的表现如何比较?
主要发现
- ADDS 在使用 ViT-L-336 的 DM-Decoder 时,于 NUS-WIDE 上实现了 39.28% 的 mAP,达到开放词汇多标签分类的最先进性能,优于先前最先进方法。
- 与 ML-Decoder 基线相比,DM-Decoder 将 mAP 提升了 2.5 个百分点,当使用三层堆叠的解码器层时,mAP 达到 38.68%。
- 在 1344×1344 分辨率下,金字塔前向传播将 MS-COCO 上的 mAP 从 91.76% 提升至 93.54%,证明其在高分辨率推理中的有效性。
- 在 ImageNet-21k 上训练 15,000 个类别(而非 ImageNet-1k 的 1,000 个类别)时,NUS-WIDE 上的 mAP 从 31.02% 提升至 37.92%,表明更多训练类别具有显著优势。
- 未进行视觉-文本对齐的模型(如未使用对比损失微调的 BLIP 模型)mAP 仅降至 2.52%,证明对齐对性能至关重要。
- 该方法在所有三项任务中均达到最先进水平:开放词汇多标签分类、传统多标签分类以及单标签到多标签分类,展现出广泛的适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。