[论文解读] Enhancing Multi-modal and Multi-hop Question Answering via Structured Knowledge and Unified Retrieval-Generation
本文提出 SKURG,一种用于多模态多跳问答的统一框架,通过基于实体的知识融合与联合检索-生成解码器,增强检索与生成能力。通过动态构建的知识图谱对多模态输入进行对齐,并实现自适应、相互依赖的检索与答案生成,SKURG 在 MultimodalQA 和 WebQA 上实现了最先进性能,且参数量更少。
Multi-modal multi-hop question answering involves answering a question by reasoning over multiple input sources from different modalities. Existing methods often retrieve evidences separately and then use a language model to generate an answer based on the retrieved evidences, and thus do not adequately connect candidates and are unable to model the interdependent relations during retrieval. Moreover, the pipelined approaches of retrieval and generation might result in poor generation performance when retrieval performance is low. To address these issues, we propose a Structured Knowledge and Unified Retrieval-Generation (SKURG) approach. SKURG employs an Entity-centered Fusion Encoder to align sources from different modalities using shared entities. It then uses a unified Retrieval-Generation Decoder to integrate intermediate retrieval results for answer generation and also adaptively determine the number of retrieval steps. Extensive experiments on two representative multi-modal multi-hop QA datasets MultimodalQA and WebQA demonstrate that SKURG outperforms the state-of-the-art models in both source retrieval and answer generation performance with fewer parameters. Our code is available at https://github.com/HITsz-TMG/SKURG.
研究动机与目标
- 为解决现有多模态多跳问答系统在检索过程中对跨模态关系建模的局限性。
- 克服流水线式检索-生成架构中误差传播与固定检索步数的问题。
- 将证据检索与答案生成统一为单一、自适应的过程,利用共享实体表征。
- 通过直接从输入数据构建知识图谱而非依赖外部知识,提升对多模态源的推理能力。
- 提升对需要整合视觉与文本证据的复杂多跳问题的性能。
提出的方法
- 基于实体的融合编码器(EF-Enc)利用命名实体识别与关系抽取,从输入源构建知识图谱,实现跨模态实体对齐。
- EF-Enc 通过将实体链接到其来源模态(如图像、文本)将多模态输入融合到共享语义空间。
- 统一的检索-生成解码器(RG-Dec)使用指针机制,以端到端、相互依赖的方式检索相关证据并生成答案。
- RG-Dec 通过关注源表示与融合的实体嵌入,自适应地确定检索步数。
- 模型联合优化检索与生成,使答案生成可通过共享注意力引导证据检索。
- 该框架采用基于序列到序列的 Transformer 架构,检索与生成共享参数,实现参数效率。
实验结果
研究问题
- RQ1统一的检索-生成架构是否能通过减少分离检索与生成阶段带来的误差传播,提升多模态多跳问答性能?
- RQ2基于实体的知识融合在多跳问答中如何增强跨模态对齐与推理能力?
- RQ3与固定跳跃次数的检索相比,自适应、动态检索在多模态设置下能多大程度上提升性能?
- RQ4检索与生成的端到端联合优化是否优于流水线式方法,带来更好的答案生成与证据检索表现?
- RQ5在多模态问答中,该模型在短答案与长答案生成任务上的表现如何?
主要发现
- SKURG 在 MultimodalQA 与 WebQA 上的检索 F1 与答案生成性能均优于最先进模型。
- 在 MultimodalQA 上,SKURG 相较基线模型,检索 F1 提升 9.3 个百分点,答案 F1 提升 3.5 个百分点。
- 在 WebQA 上,SKURG 在长答案(>20 个词)的检索 F1 上实现 11.1 个百分点的绝对提升,表明其对复杂查询具备更强的检索能力。
- 消融实验表明,使用真实实体对齐而非预测对齐可提升性能,证实了准确实体定位的重要性。
- SKURG 在 MultimodalQA 上的性能提升幅度大于 WebQA,可能是因为前者更依赖跨模态推理且答案跨度更短。
- 案例研究显示,EF-Enc 实现了正确的图像-来源对齐,而 RG-Dec 能够检索语义相关但不完全相同的证据(例如,图像中的品牌大使与文本中的描述)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。