[论文解读] Wasserstein Barycenter Model Ensembling
本文提出基于Wasserstein中位数的模型集成方法,通过引入词嵌入或代价矩阵中的语义辅助信息,提升多类与多标签学习中的模型平均性能。借助最优传输理论,该方法在平衡模型置信度与语义相似性方面表现优异,在基于属性的分类、多标签学习和图像字幕生成任务中,优于算术平均与几何平均集成方法,尤其在提升语义多样性及对标签扰动的鲁棒性方面表现突出。
In this paper we propose to perform model ensembling in a multiclass or a multilabel learning setting using Wasserstein (W.) barycenters. Optimal transport metrics, such as the Wasserstein distance, allow incorporating semantic side information such as word embeddings. Using W. barycenters to find the consensus between models allows us to balance confidence and semantics in finding the agreement between the models. We show applications of Wasserstein ensembling in attribute-based classification, multilabel learning and image captioning generation. These results show that the W. ensembling is a viable alternative to the basic geometric or arithmetic mean ensembling.
研究动机与目标
- 解决标准模型集成方法(算术平均与几何平均)忽略类别间语义关系的局限性。
- 提出一种将语义辅助信息(如词嵌入或类别相似性矩阵)整合到模型集成中的方法,以改进共识发现。
- 通过Wasserstein距离在度量空间中比较分布的能力,实现在不同标签集模型间的有效集成。
- 通过促进语义一致的输出(如改写、多样化且语义准确的输出),提升图像字幕与多标签分类等任务的性能。
提出的方法
- 将模型预测表示为标签空间上的离散概率测度,其中每个类别与预训练嵌入空间中的向量相关联(例如,GloVe)。
- 利用语义相似性(例如,词嵌入之间的余弦距离)在标签空间上定义基础度量 $ C $,以编码类别间的关系。
- 通过熵正则化与Sinkhorn算法,高效优化计算多个模型预测的Wasserstein中位数。
- 将中位数作为最终的集成预测结果,其在模型间平衡置信度,并在标签空间中保持语义接近性。
- 通过将中位数计算适配到输出结构(例如,字幕生成中的top-k束搜索),将该方法应用于多类、多标签及序列生成任务。
- 引入基于同义词的相似性矩阵 $ K $,以限制邻域大小,防止中位数过度扩散至均匀分布。
实验结果
研究问题
- RQ1Wasserstein中位数能否通过整合词嵌入等语义辅助信息,改善模型集成性能?
- RQ2在多标签与多类任务中,Wasserstein集成相较于算术平均与几何平均,在准确率与鲁棒性方面表现如何?
- RQ3该中位数方法在生成输出(如图像字幕)中,能在多大程度上保持语义相似性?
- RQ4当标签被扰动或预测顺序被打乱时(尤其在保留语义结构的前提下),该方法表现如何?
- RQ5该中位数方法能否在不牺牲语义质量的前提下,促进生成序列(如改写后的字幕)的多样性?
主要发现
- 在COCO图像字幕基准测试中,Wasserstein中位数在top-k束搜索下取得了1.091的CIDEr分数与0.209的SPICE分数,熵值达6.94,WMD稳定在0.198,表明生成结果语义相近但具有多样性。
- 随着熵值增加,Wasserstein中位数的WMD分数保持稳定,显示出对改写与语义漂移的鲁棒性;而算术平均与几何平均的CIDEr与SPICE分数则显著下降。
- 在MS-COCO的人工评估中,Wasserstein中位数优于算术与几何平均,34%的MTurkers选择其为最准确的字幕,32%选择其为最详细的字幕。
- Wasserstein中位数在语义扰动下表现出更优的鲁棒性:当模型预测在语义簇内被打乱时,其性能恢复能力优于算术与几何平均,后者出现显著性能下降。
- 使用基于同义词的相似性矩阵 $ K $ 有效限制了扩散效应,保留了有意义的结构,防止中位数坍缩为均匀分布。
- 在多标签分类任务中,Wasserstein中位数通过有效平衡置信度与语义一致性,显著提升了准确率,尤其在类别不平衡设置下表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。