[论文解读] Visually Grounded Continual Learning of Compositional Phrases
该论文提出了 VisCOLL,一个用于从流式视觉-语言数据中进行组合短语习得的视觉对齐持续学习基准,模型在对象分布不断变化的设定下学习预测图像字幕中的掩码词。尽管采用了最先进持续学习方法,模型的性能提升有限,且在新组合短语上的泛化能力较差,凸显了在持续学习设置下组合泛化所面临的巨大搜索空间挑战。
Humans acquire language continually with much more limited access to data samples at a time, as compared to contemporary NLP systems. To study this human-like language acquisition ability, we present VisCOLL, a visually grounded language learning task, which simulates the continual acquisition of compositional phrases from streaming visual scenes. In the task, models are trained on a paired image-caption stream which has shifting object distribution; while being constantly evaluated by a visually-grounded masked language prediction task on held-out test sets. VisCOLL compounds the challenges of continual learning (i.e., learning from continuously shifting data distribution) and compositional generalization (i.e., generalizing to novel compositions). To facilitate research on VisCOLL, we construct two datasets, COCO-shift and Flickr-shift, and benchmark them using different continual learning methods. Results reveal that SoTA continual learning approaches provide little to no improvements on VisCOLL, since storing examples of all possible compositions is infeasible. We conduct further ablations and analysis to guide future work.
研究动机与目标
- 通过在具有不断变化对象分布的流式视觉-语言数据上训练模型,模拟人类般的持续语言习得。
- 研究视觉语言理解中持续学习与组合泛化双重挑战。
- 构建真实、持续变化的数据集(COCO-shift 和 Flickr-shift),以基准化这些挑战。
- 评估现有持续学习算法在内存受限条件下学习新组合短语的有效性。
- 通过分析失败模式并识别当前方法的关键局限,为未来研究提供指导。
提出的方法
- 任务涉及在图像-字幕配对数据流上进行在线训练,对象分布随时间逐渐变化。
- 通过在保留的测试集上进行掩码词预测来评估模型,测试集包含已见和新组合的短语。
- 通过在对象频率和组合上引入受控分布偏移,构建了两个数据集:COCO-shift 和 Flickr-shift。
- 该基准使用从随机初始化开始训练的多模态 Transformer 模型,结合持续学习算法,包括基于记忆、正则化和回放的方法。
- 引入了内存管理策略,如 Balanced-sqrt 和 Balanced-forget,以优化存储多样化或高遗忘风险样本。
- 通过旧组合的困惑度和新组合的准确率来衡量性能,以评估遗忘和组合泛化能力。
实验结果
研究问题
- RQ1最先进持续学习算法能否在视觉对齐、流式语言学习设置中有效防止灾难性遗忘?
- RQ2当在持续变化的数据流上训练时,模型在新组合短语(如未见过的名词-形容词或名词-动词对)上的泛化能力如何?
- RQ3不同的内存管理策略在大规模组合短语学习任务中的性能和遗忘影响如何?
- RQ4为何即使增加了内存容量,现有持续学习方法在 VisCOLL 上仍无法提升性能?
- RQ5与在线持续学习相比,对完整数据分布进行离线训练是否在组合泛化方面表现更优?
主要发现
- 即使增加内存容量,最先进持续学习方法在 VisCOLL 上的性能提升微乎其微,原因在于无法存储所有可能的短语组合。
- 所有模型在新组合上的表现均显著下降,表明组合泛化仍是主要挑战。
- 出人意料的是,离线训练(单次遍历)在新组合上的表现优于在线持续学习,表明在线设置中存在对已见样本的过拟合。
- 优先考虑多样性的内存策略(如 Balanced-sqrt)虽能提升初期性能,但无法改善长期表现;而优先考虑遗忘风险的策略(如 Balanced-forget)则未见任何优势。
- 在预测掩码词时的性能下降高度依赖于所用的原子词,高频词如 'black' 的遗忘程度低于稀有词如 'big'。
- 结果表明,当前持续学习方法在视觉对齐语言学习的组合泛化任务中并不适用,原因在于可能的短语组合存在指数级庞大的搜索空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。