[论文解读] Multimodal Explainable Artificial Intelligence: A Comprehensive Review of Methodological Advances and Future Research Directions
本文对多模态可解释人工智能(MXAI)进行了全面综述,系统分析了多模态预测任务中的方法、数据集、评估指标与挑战。基于模态数量、解释生成时机和数学形式化方法,提出了一套结构化的MXAI方法分类体系,指出了评估中的关键缺口、标注中的偏见问题,以及对用户定制化解释的迫切需求。
Despite the fact that Artificial Intelligence (AI) has boosted the achievement of remarkable results across numerous data analysis tasks, however, this is typically accompanied by a significant shortcoming in the exhibited transparency and trustworthiness of the developed systems. In order to address the latter challenge, the so-called eXplainable AI (XAI) research field has emerged, which aims, among others, at estimating meaningful explanations regarding the employed model reasoning process. The current study focuses on systematically analyzing the recent advances in the area of Multimodal XAI (MXAI), which comprises methods that involve multiple modalities in the primary prediction and explanation tasks. In particular, the relevant AI-boosted prediction tasks and publicly available datasets used for learning/evaluating explanations in multimodal scenarios are initially described. Subsequently, a systematic and comprehensive analysis of the MXAI methods of the literature is provided, taking into account the following key criteria: a) The number of the involved modalities (in the employed AI module), b) The processing stage at which explanations are generated, and c) The type of the adopted methodology (i.e. the actual mechanism and mathematical formalization) for producing explanations. Then, a thorough analysis of the metrics used for MXAI methods evaluation is performed. Finally, an extensive discussion regarding the current challenges and future research directions is provided.
研究动机与目标
- 系统分析多模态可解释人工智能(MXAI)在预测任务、数据集和方法论框架方面的最新进展。
- 根据模态数量、解释生成阶段和底层数学形式化方法,识别并分类MXAI方法。
- 评估现有的MXAI评估指标与协议,强调缺乏标准化基准和客观评估标准的问题。
- 解决关键挑战,如文本标注中的偏见、真实视觉解释的缺失以及多模态评估协议的不足。
- 倡导以用户为中心的解释设计,充分考虑终端用户在专业知识水平和认知能力上的多样性。
提出的方法
- 本文采用系统文献综述方法,基于三个标准对MXAI方法进行分类:输入与解释中涉及的模态数量、解释生成阶段(训练阶段与推理阶段)以及所采用的数学形式化方法。
- 将MXAI技术划分为单模态与多模态解释生成,区分使用与输入相同模态的解释与生成跨模态输出的解释(例如,视觉输入配以文本解释)。
- 评估现有解释质量指标,强调缺乏能考虑模态间相关性与人类主观性的标准化、多模态评估协议。
- 提出一种评估MXAI系统的框架,通过分析模态特定显著性、融合机制可解释性以及跨模态的因果特征识别来实现。
- 该方法包括对MXAI研究中公开可用数据集的批判性审查,识别出数据可及性与标注质量方面的缺口。
- 引入对挑战的结构化分析,如人工标注文本解释中的偏见以及缺乏用于监督训练的真实视觉解释数据。

实验结果
研究问题
- RQ1MXAI方法如何根据输入与解释中使用的模态数量进行分类,这对可解释性有何影响?
- RQ2解释通常在主预测模型生命周期的哪个阶段生成,这如何影响其可靠性和实用性?
- RQ3MXAI中最常使用的数学形式化方法是什么,它们如何影响解释的质量与可理解性?
- RQ4当前MXAI评估实践的主要局限性是什么,这些局限性如何阻碍不同方法间的客观比较?
- RQ5如何根据用户画像(包括非专家与领域专家)定制解释,以提升信任度与可用性?
主要发现
- 缺乏真实视觉解释数据是一个显著缺口,严重阻碍了基于监督学习的视觉解释MXAI模型的发展。
- 人工标注的文本解释常因个体背景与性格差异而包含偏见与矛盾,降低了用于解释模块训练数据的可靠性。
- 当前MXAI评估实践主要孤立地评估各模态,忽视了模态间的相关性,可能导致对解释质量的误导性结论。
- 迄今为止,仅提出了有限数量的任务与模型特定的评估指标,尚无标准化的多模态可解释性评估基准。
- 迫切需要能够同时考虑模态特定贡献及其对模型决策联合影响的多模态可解释性度量方法。
- 针对特定用户专业知识水平(尤其是非专家)定制的解释,可显著提升理解力、信任度以及人与AI系统之间的协作效率。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。