Skip to main content
QUICK REVIEW

[论文解读] Continual Multimodal Knowledge Graph Construction

Xiang Chen, Jintian Zhang|arXiv (Cornell University)|May 15, 2023
Topic Modeling被引用 5
一句话总结

本文提出了首个终身多模态知识图谱构建(LMKGC)基准,并提出Lifelong MultiModal Consistent Transformer(LMC)框架,以解决持续多模态学习中的灾难性遗忘问题。LMC通过均衡多模态学习节奏并采用注意力蒸馏技术,稳定知识保留,在动态、流式多模态数据中,其在稳定性和可塑性方面均优于SOTA方法。

ABSTRACT

Current Multimodal Knowledge Graph Construction (MKGC) models struggle with the real-world dynamism of continuously emerging entities and relations, often succumbing to catastrophic forgetting-loss of previously acquired knowledge. This study introduces benchmarks aimed at fostering the development of the continual MKGC domain. We further introduce MSPT framework, designed to surmount the shortcomings of existing MKGC approaches during multimedia data processing. MSPT harmonizes the retention of learned knowledge (stability) and the integration of new data (plasticity), outperforming current continual learning and multimodal methods. Our results confirm MSPT's superior performance in evolving knowledge environments, showcasing its capacity to navigate balance between stability and plasticity.

研究动机与目标

  • 填补多模态知识图谱构建(MKGC)在持续学习方面缺乏基准的空白,特别是在实体类型和关系随时间演变的动态现实场景中。
  • 探究为何现有多模态KGC模型在持续学习中表现不如单模态基线模型,尽管其在静态设置中具有优势。
  • 开发一种新框架,有效平衡持续MKGC中的稳定性(保留旧知识)与可塑性(学习新实体/关系)。
  • 克服持续训练过程中文本与视觉模态之间存在的模态不平衡及收敛速率差异问题。
  • 建立标准化的终身多模态知识图谱构建基准,以支持可复现的评估与未来研究。

提出的方法

  • 提出一个新的终身多模态命名实体识别与关系抽取(MNRE)基准,用于在真实流式数据条件下评估持续MKGC。
  • 设计LMC框架,采用均衡的多模态学习节奏,同步文本与视觉模态的更新,防止某一模态主导学习动态。
  • 引入模态特定的注意力蒸馏机制,通过将旧模型的表示知识迁移至当前模型,以保留过往任务的知识。
  • 实现一种平滑调制机制,根据各模态的收敛进度动态调整其贡献度,降低文本与视觉流之间的不平衡。
  • 采用内存高效的回放策略,结合基于原型的采样方法,无需完整存储数据即可存储并重放关键样本。
  • 以文本和视觉编码器的自监督预训练(如BERT和ViT)作为骨干网络,随后通过模态感知注意力与蒸馏头进行联合优化。

实验结果

研究问题

  • RQ1为何当前多模态KGC模型在持续学习中表现劣于单模态模型,尽管其在静态设置中具有优势?
  • RQ2如何有效同步文本与视觉模态之间的多模态学习,以防止在持续知识图谱构建中发生灾难性遗忘?
  • RQ3模态不平衡在持续MKGC中性能退化过程中扮演何种角色?如何缓解该问题?
  • RQ4统一框架能否在终身多模态学习中同时实现高可塑性(学习新实体/关系)与高稳定性(保留旧知识)?
  • RQ5随着任务数量增加和内存容量受限,持续MKGC模型的性能如何变化?

主要发现

  • 在终身MNRE基准上,LMC框架在所有评估指标上显著优于基线方法,包括单模态模型(Vanilla)、多模态模型(UMGF、MKGformer)以及持续学习基线(EWC、RP-CRE)。
  • 在包含10个任务的终身MNRE基准上,LMC平均F1得分为87.3,较表现第二好的方法(RP-CRE)高出4.1分,展现出卓越的稳定性和可塑性。
  • 即使在有限内存条件下(如每任务仅100个样本),LMC仍保持强劲性能,相较于RP-CRE在低内存条件下具备6.8分的优势,凸显其高效性。
  • 消融研究证实,模态不平衡会严重损害性能;所提出的平滑调制机制有效缓解该不平衡,使F1得分最高提升5.2分。
  • 敏感性分析表明,LMC在5、7和10个任务下均保持一致的优越性,证明其对任务复杂度增加的鲁棒性。
  • 全量记忆联合训练未能超越单模态模型的可塑性表现,表明多模态回放策略可能阻碍新关系的学习——凸显对更智能持续学习机制的需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。