[论文解读] Mutual Information Divergence: A Unified Metric for Multimodal Generative Models
本文提出互信息散度(MID),一种统一的多模态生成模型度量指标,基于高斯假设下的负交叉互信息,利用CLIP特征进行计算。MID在与人类判断的相关性以及在文本到图像生成和图像字幕生成基准测试中的鲁棒性方面,显著优于现有指标,在包括FOIL幻觉检测和Flickr8K-Expert在内的多个标准评估集上达到最先进性能。
Text-to-image generation and image captioning are recently emerged as a new experimental paradigm to assess machine intelligence. They predict continuous quantity accompanied by their sampling techniques in the generation, making evaluation complicated and intractable to get marginal distributions. Based on a recent trend that multimodal generative evaluations exploit a vison-and-language pre-trained model, we propose the negative Gaussian cross-mutual information using the CLIP features as a unified metric, coined by Mutual Information Divergence (MID). To validate, we extensively compare it with competing metrics using carefully-generated or human-annotated judgments in text-to-image generation and image captioning tasks. The proposed MID significantly outperforms the competitive methods by having consistency across benchmarks, sample parsimony, and robustness toward the exploited CLIP model. We look forward to seeing the underrepresented implications of the Gaussian cross-mutual information in multimodal representation learning and the future works based on this novel proposition.
研究动机与目标
- 为解决由于分布散度难以计算和采样复杂性带来的多模态生成模型评估挑战。
- 通过单一、合理的度量指标,统一文本到图像生成与图像字幕生成的评估。
- 提高与人类判断的相关性,并增强对CLIP模型变化的鲁棒性。
- 为多模态表示学习中基于互信息的评估提供理论基础。
- 实现在多样化基准测试中样本高效且一致的评估。
提出的方法
- 提出一种基于多变量高斯假设下负交叉互信息的统一度量指标——互信息散度(MID),用于视觉和文本CLIP特征。
- 将图像与文本特征的联合分布建模为多变量高斯分布,通过估计均值与协方差来计算互信息。
- 采用负交叉互信息作为散度度量,衡量生成数据分布与真实数据分布之间的对齐程度。
- 以CLIP嵌入作为特征表示基础,实现零样本迁移和跨领域的稳定性。
- 应用平方马氏距离进行分布外检测,并提供偏差-方差分解以支持理论分析。
- 将MID与Kullback-Leibler散度建立理论联系,确立其与信息论原理的关联。
实验结果
研究问题
- RQ1基于互信息的统一度量是否能有效评估文本到图像生成与图像字幕生成?
- RQ2MID在多样化基准测试中与人类判断的相关性方面,相较于现有度量指标表现如何?
- RQ3MID在底层CLIP模型变化和数据领域变化下,其鲁棒性达到何种程度?
- RQ4MID是否能比基于参考或n-gram的度量更可靠地检测幻觉和分布偏移?
- RQ5MID与KL散度等既定散度度量之间存在何种理论关系?
主要发现
- 在FOIL幻觉检测基准上,MID取得90.5%的准确率(使用一个参考样本时)和90.5%的准确率(使用四个参考样本时),达到最先进性能。
- 在Flickr8K-Expert和Flickr8K-CF基准上,MID平均准确率达85.2%,优于RefCLIP-S(83.1%)和CLIP-S(80.7%)。
- 在人类判断相关性方面,MID在CUB和MM-CelebA-HQ等数据集上表现出更优的一致性,shuffle实验中斜率稳定。
- MID对CLIP模型变化表现出鲁棒性,在COCO、LN-COCO、CUB和MM-CelebA-HQ等不同领域中保持一致性能。
- 理论分析证实MID与KL散度存在理论关联,支持偏差-方差分解,并可通过马氏距离实现分布外检测。
- 在FOIL数据集的HI子集上,MID准确率达99.7%,接近完美性能,优于BERT-S++(98.1%)和TIGEr(99.8%)在该特定划分上的表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。