[论文解读] OmniNet: A unified architecture for multi-modal multi-task learning
OmniNet 提出了一种统一的神经网络架构,通过集成时空缓存和基于注意力的中央处理单元,支持文本、图像和视频等多种输入模态的多模态、多任务学习。在联合训练 POS 标注、图像字幕、视觉问答和视频动作识别四项任务时,模型参数量减少三倍,同时保持性能不变;此外,该模型在未见过的任务(如视频字幕和视频问答)上实现了零样本迁移。
Transformer is a popularly used neural network architecture, especially for language understanding. We introduce an extended and unified architecture that can be used for tasks involving a variety of modalities like image, text, videos, etc. We propose a spatio-temporal cache mechanism that enables learning spatial dimension of the input in addition to the hidden states corresponding to the temporal input sequence. The proposed architecture further enables a single model to support tasks with multiple input modalities as well as asynchronous multi-task learning, thus we refer to it as OmniNet. For example, a single instance of OmniNet can concurrently learn to perform the tasks of part-of-speech tagging, image captioning, visual question answering and video activity recognition. We demonstrate that training these four tasks together results in about three times compressed model while retaining the performance in comparison to training them individually. We also show that using this neural network pre-trained on some modalities assists in learning unseen tasks such as video captioning and video question answering. This illustrates the generalization capacity of the self-attention mechanism on the spatio-temporal cache present in OmniNet.
研究动机与目标
- 解决缺乏一种原生支持多种输入模态(如文本、图像、视频)和多种任务同时进行的统一深度学习架构的问题。
- 实现异步多任务学习,使单个模型能够在不重新配置架构的情况下,对具有不同输入模态的多样化任务进行训练。
- 探索跨模态学习到的共享表征在未见任务(如视频字幕和视频问答)上的泛化能力。
- 通过任务和模态之间的参数共享,减少模型大小和参数数量,提升效率而不损失性能。
提出的方法
- OmniNet 采用基于 Transformer 架构的中央神经处理器(CNP),用于处理来自多个外围网络的时空表征。
- 每个外围网络(如用于图像、文本、视频的网络)将其模态特定的输入编码为形状为 $ t \times s \times d_{\text{model}} $ 的时空张量,其中 $ t $、$ s $ 和 $ d_{\text{model}} $ 分别表示时间维度、空间维度和模型维度。
- 提出一种新型的时空缓存机制,用于存储空间和时间表征,使模型能够通过自注意力机制在两个维度上进行注意力计算。
- 引入链接数组组件,通过聚焦显著帧和空间区域来提升视频输入的注意力效率,降低计算负担。
- CNP 使用广义的 encode() 函数处理并存储所有模态的表征,随后通过 decode() 函数生成多个任务的预测结果。
- 该模型支持具有不同输入模态和输出格式的任务端到端训练,实现联合优化。
实验结果
研究问题
- RQ1单一神经网络架构是否能够有效学习并共享多种模态(文本、图像、视频)和多种任务之间的表征?
- RQ2集成时空缓存机制是否能提升多模态、多任务学习中的性能和效率?
- RQ3在多种任务组合上预训练的模型在未见任务(如视频字幕或视频问答)上的泛化能力有多强?
- RQ4与独立训练各模型相比,跨任务的参数共享如何影响模型大小和性能?
主要发现
- 使用 OmniNet 联合训练四项不同任务(POS 标注、图像字幕、视觉问答、视频动作识别)可使模型大小减少约三倍,同时保持或略微提升性能。
- 消融实验表明,若移除空间缓存,图像字幕性能几乎完全崩溃(BLEU-4 从 28.9 降至 0),凸显其在空间表征中的关键作用。
- 链接数组组件对基于视频的任务影响最大:移除后 HMDB 准确率从 55.29% 降至 45.94%,证明其在管理时空复杂性方面的价值。
- OmniNet 在无需任何视频特定数据微调的情况下,实现了对视频字幕和视频问答的零样本迁移,充分利用了图像字幕和 VQA 的预训练知识。
- 即使在移除空间缓存或链接数组等组件后,POS 标注任务的准确率仍保持在 95.61% 的高水平,证实时间仅任务不受空间或时空修改的影响。
- 在多任务训练中,即使在空间缓存被移除后,字幕任务仍保持 11.9 的 BLEU-4 分数,表明时间缓存通过存储图像级特征在一定程度上实现了补偿。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。