[论文解读] Semantic Regularisation for Recurrent Image Annotation
本文通过使用卷积神经网络(CNN)预测的语义概念作为卷积神经网络与循环神经网络(RNN)之间的图像嵌入接口,提出了一种用于循环神经网络图像标注的语义正则化方法,将标签预测与相关性建模解耦。该方法实现了更快、更稳定的端到端训练,并在无需模型集成或辅助数据的情况下,在多标签分类和图像字幕生成任务上均取得了当前最优性能。
The "CNN-RNN" design pattern is increasingly widely applied in a variety of image annotation tasks including multi-label classification and captioning. Existing models use the weakly semantic CNN hidden layer or its transform as the image embedding that provides the interface between the CNN and RNN. This leaves the RNN overstretched with two jobs: predicting the visual concepts and modelling their correlations for generating structured annotation output. Importantly this makes the end-to-end training of the CNN and RNN slow and ineffective due to the difficulty of back propagating gradients through the RNN to train the CNN. We propose a simple modification to the design pattern that makes learning more effective and efficient. Specifically, we propose to use a semantically regularised embedding layer as the interface between the CNN and RNN. Regularising the interface can partially or completely decouple the learning problems, allowing each to be more effectively trained and jointly training much more efficient. Extensive experiments show that state-of-the art performance is achieved on multi-label classification as well as image captioning.
研究动机与目标
- 解决CNN-RNN模型在图像标注任务中端到端训练缓慢且不稳定的挑战。
- 通过引入语义上有意义的接口层,将RNN的双重负担——预测视觉概念与建模其相关性——进行解耦。
- 通过CNN预测层的语义正则化实现深度监督,从而提升训练稳定性与收敛速度。
- 在无需模型集成或辅助训练数据的情况下,实现在图像字幕生成与多标签分类任务上的当前最优性能。
提出的方法
- 在CNN与RNN之间引入一个语义正则化的嵌入层,使用CNN预测的语义概念(而非原始特征)作为图像嵌入。
- 执行多任务学习,使CNN联合学习预测视觉概念(语义监督)与编码图像表征。
- 使用CNN最终预测层的输出(而非特征图)作为RNN的初始隐藏状态输入,确保语义上的合理性。
- 通过端到端训练CNN直接预测真实标签,实现梯度稳定与特征学习的改进,即通过语义正则化实现深度监督。
- 通过反向传播同时优化RNN与正则化的CNN,实现端到端训练,显著加快收敛速度。
- 采用Inception-V3作为CNN主干网络,LSTM作为RNN,未使用模型集成或外部字幕数据。
实验结果
研究问题
- RQ1CNN预测层的语义正则化是否能提升CNN-RNN图像标注模型的训练效率与性能?
- RQ2使用CNN预测的语义概念作为图像嵌入接口,是否能减轻RNN的负担并改善结构化预测?
- RQ3与基于特征的接口相比,通过语义正则化实现的深度监督在收敛速度与最终性能方面表现如何?
- RQ4采用语义正则化的单模型架构是否能在图像字幕生成基准上超越基于模型集成的模型?
主要发现
- 所提模型在MS-COCO数据集上达到当前最优性能,在全部14项评估指标上均优于五个强基线模型,包括CIDEr、METEOR、ROUGE和B-4。
- 在COCO验证集上,该模型的CIDEr得分达到1.054,相比基线模型NIC-F(0.932)提升了7%,凸显了语义正则化的关键作用。
- 该模型仅用单张Titan X GPU训练两天即完成收敛,远快于NICv2每个集成成员需20余天的训练时间,显著提升了训练效率。
- 即使不使用模型集成或辅助数据,该模型在官方MS-COCO评估服务器上39个提交结果中位列第5,表明其具备强大的泛化能力与鲁棒性。
- 消融实验表明,语义正则化对性能有显著贡献,CIDEr指标上NIC-F与完整模型之间的差距达7%,且使用预测层作为嵌入是获得最优结果的关键。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。