[论文解读] Deep Multimodal Neural Architecture Search
本文提出了一种广义的深度多模态神经架构搜索(MMnas)框架,通过可微分神经架构搜索(differentiable NAS),自动发现适用于多样化多模态任务(如视觉问答、图文匹配和视觉定位)的最优神经架构。该方法采用统一的编码器-解码器主干网络,在五个基准数据集上实现了最先进的性能,显著优于现有方法,尤其在目标计数和跨模态检索任务中表现突出。
Designing effective neural networks is fundamentally important in deep multimodal learning. Most existing works focus on a single task and design neural architectures manually, which are highly task-specific and hard to generalize to different tasks. In this paper, we devise a generalized deep multimodal neural architecture search (MMnas) framework for various multimodal learning tasks. Given multimodal input, we first define a set of primitive operations, and then construct a deep encoder-decoder based unified backbone, where each encoder or decoder block corresponds to an operation searched from a predefined operation pool. On top of the unified backbone, we attach task-specific heads to tackle different multimodal learning tasks. By using a gradient-based NAS algorithm, the optimal architectures for different tasks are learned efficiently. Extensive ablation studies, comprehensive analysis, and comparative experimental results show that the obtained MMnasNet significantly outperforms existing state-of-the-art approaches across three multimodal learning tasks (over five datasets), including visual question answering, image-text matching, and visual grounding.
研究动机与目标
- 为解决多模态学习中任务特定、手工设计的神经架构的局限性,实现自动架构发现。
- 开发一种统一框架,可在无需任务特定架构重新设计的情况下泛化至多种多模态任务。
- 通过神经架构搜索学习任务特定架构,相比大规模预训练多模态-BERT模型,提升性能与参数效率。
- 证明NAS能够有效捕捉多模态理解任务中的任务特定表征需求。
提出的方法
- 定义一组原始操作作为神经架构搜索的构建模块,包括残差连接、自注意力机制和特征融合等操作。
- 构建一个统一的编码器-解码器主干网络,其中每个编码器或解码器模块均来自预定义操作池中搜索得到的操作。
- 使用基于梯度的单次神经架构搜索(NAS)算法,联合优化每个任务的架构与模型权重。
- 在共享主干网络之上附加任务特定的头(例如用于视觉问答、图文匹配、视觉定位),以适应不同的下游任务。
- 利用可微分搜索实现跨多个数据集和任务的高效端到端训练与架构优化。
- 将所提出的 MMnasNet 与预训练策略结合,以进一步提升性能,尽管其核心框架无需大规模预训练即可运行。
实验结果
研究问题
- RQ1一个单一的广义框架能否自动发现适用于多样化多模态学习任务的最优神经架构?
- RQ2基于NAS的架构搜索在性能与参数效率方面,相较于手工设计或预训练多模态模型表现如何?
- RQ3不同多模态任务(如视觉问答与视觉定位)的最优架构在结构与操作构成上是否存在显著差异?
- RQ4所提出的 MMnas 框架能否在无需任务特定架构工程的情况下,在多个基准上实现最先进性能?
- RQ5引入一种新操作(RSA)在如视觉问答中的目标计数等挑战性子任务上,性能提升程度如何?
主要发现
- MMnasNet 在 VQA-v2 数据集上达到新的最先进性能,所有答案类型均优于先前方法,尤其在‘数字’类型(目标计数)上实现 5.5% 的显著提升。
- 在 Flickr30K 数据集上,MMnasNet 在文本到图像检索任务中达到 78.3% Recall@1 和 97.4% Recall@10,较之前最先进方法(CAMP:68.1% 和 95.2%)提升超过 10 个百分点。
- 在 Flickr30K 的图像到文本检索任务中,MMnasNet 达到 60.7% Recall@1、85.1% Recall@5 和 90.5% Recall@10,显著优于 CAMP(51.5%、77.1%、85.3%)。
- 在 RefCOCO、RefCOCO+ 和 RefCOCOg 数据集上,MMnasNet 使用标准特征实现 75.6% 的准确率,使用更强的 FRCN 特征时达到 80.1%,较 MAttNet 提升超过 5%。
- 消融实验表明,不同任务的搜索架构存在显著差异,验证了该框架的适应性与任务特定优化能力。
- 引入 RSA(残差自注意力)操作被证明对性能提升至关重要,尤其在目标计数等复杂推理任务中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。