[论文解读] ContCap: A scalable framework for continual image captioning
ContCap 是一种可扩展的框架,通过伪标签、选择性权重冻结(编码器或解码器)以及特征蒸馏,将持续学习整合到图像字幕生成中,以减轻灾难性遗忘。与标准微调相比,其性能显著更优,尤其在顺序添加类别时表现突出:在逐个添加五个类别时,旧任务上的 CIDEr 得分达到 15.1(而微调仅为 4.8)。
While advanced image captioning systems are increasingly describing images coherently and exactly, recent progress in continual learning allows deep learning models to avoid catastrophic forgetting. However, the domain where image captioning working with continual learning has not yet been explored. We define the task in which we consolidate continual learning and image captioning as continual image captioning. In this work, we propose ContCap, a framework generating captions over a series of new tasks coming, seamlessly integrating continual learning into image captioning besides addressing catastrophic forgetting. After proving forgetting in image captioning, we propose various techniques to overcome the forgetting dilemma by taking a simple fine-tuning schema as the baseline. We split MS-COCO 2014 dataset to perform experiments in class-incremental settings without revisiting dataset of previously provided tasks. Experiments show remarkable improvements in the performance on the old tasks while the figures for the new surprisingly surpass fine-tuning. Our framework also offers a scalable solution for continual image or video captioning.
研究动机与目标
- 解决在逐步引入新视觉类别时,图像字幕生成中灾难性遗忘的问题。
- 开发一种可扩展的、无需回放旧数据的非重演式持续图像字幕方法。
- 评估正则化技术(伪标签、权重冻结、特征蒸馏)在保持旧任务与新任务性能方面的有效性。
- 研究顺序类别添加中的失败模式,识别出‘阶段灾难性遗忘’为关键挑战。
- 证明多模态生成模型可从专为单模态任务设计的持续学习技术中获益。
提出的方法
- 提出 ContCap 框架,结合编码器-解码器图像字幕模型与基于正则化的持续学习技术。
- 利用伪标签技术,通过前序模型的输出作为监督信号,稳定新任务上的预测结果。
- 应用选择性权重冻结(仅冻结编码器或解码器),在增量训练过程中保留先前任务的知识。
- 实施特征蒸馏,对齐旧模型与新模型之间的隐藏表征,保持语义一致性。
- 在无数据回放的情况下,通过将 MS-COCO 2014 按类别增量划分为连续任务流,实现增量训练。
- 使用标准图像字幕评估指标(BLEU、CIDEr、ROUGE)在不同设置下评估旧任务与新任务的性能。
实验结果
研究问题
- RQ1标准微调能否在不产生灾难性遗忘的情况下有效应用于持续图像字幕?
- RQ2在多模态、顺序字幕生成设置中,基于正则化的持续学习技术(伪标签、冻结、蒸馏)表现如何?
- RQ3顺序类别添加中的性能崩溃由何原因引起,能否被缓解?
- RQ4在持续图像字幕中,冻结编码器还是解码器能获得更好的性能保留?
- RQ5ContCap 在旧任务上的泛化能力与遗忘情况方面,与标准微调相比表现如何?
主要发现
- 灾难性遗忘会严重降低图像字幕生成性能:在新类别(如‘person’)上微调后,模型会将一张‘dog’图像错误描述为‘一个小孩正站在草地上拿着飞盘’。
- 当逐个添加五个类别时,旧任务上的 CIDEr 得分从基线的 47.1 降至微调的 4.5 和使用特征蒸馏的 4.8,表明存在极端遗忘现象。
- 在顺序添加设置中,伪标签实现最佳性能(旧任务上 CIDEr 得分为 15.1),优于微调和特征蒸馏,表明其对累积噪声具有更强鲁棒性。
- 在顺序设置中,冻结编码器的性能(15.6 CIDEr)优于冻结解码器(10.0 CIDEr),表明编码器在长期知识保留中起更大作用。
- 同时添加多个类别可实现更好的泛化与更高性能(如使用伪标签时 BLEU1 达 53.4,CIDEr 达 15.1),而顺序添加因‘阶段灾难性遗忘’导致性能下降。
- 该框架在类别增量设置中展现出良好的可扩展性与有效性,在保持旧任务强性能的同时,对新任务也实现了高精度,尤其在使用伪标签与编码器冻结时表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。