[论文解读] Hierarchical Optimal Transport for Robust Multi-View Learning
本文提出分层最优传输(HOT),一种鲁棒的多视图学习方法,消除了对样本对应关系以及各视图间相同潜在分布的依赖。通过使用切片Wasserstein距离作为基底距离并学习最优传输矩阵,HOT显式建模了各视图中的聚类结构,在合成数据集和真实世界数据集的半监督与无监督设置下均提升了性能。
Traditional multi-view learning methods often rely on two assumptions: ($i$) the samples in different views are well-aligned, and ($ii$) their representations in latent space obey the same distribution. Unfortunately, these two assumptions may be questionable in practice, which limits the application of multi-view learning. In this work, we propose a hierarchical optimal transport (HOT) method to mitigate the dependency on these two assumptions. Given unaligned multi-view data, the HOT method penalizes the sliced Wasserstein distance between the distributions of different views. These sliced Wasserstein distances are used as the ground distance to calculate the entropic optimal transport across different views, which explicitly indicates the clustering structure of the views. The HOT method is applicable to both unsupervised and semi-supervised learning, and experimental results show that it performs robustly on both synthetic and real-world tasks.
研究动机与目标
- 解决传统多视图学习方法所依赖的假设,即样本良好对齐且各视图间具有相同的潜在分布。
- 开发一种方法,能够从未对齐、分布异构的多视图数据中学习有意义的表示,尤其适用于医疗和金融等隐私敏感场景。
- 通过最优传输显式建模视图的聚类结构,提升表示学习与泛化能力。
- 在无需所有视图均提供标签数据的前提下,实现有效的半监督与无监督多视图学习。
- 通过学习视图级别的聚类结构,为协同正则化方法提供更具可解释性与鲁棒性的替代方案。
提出的方法
- 该方法使用切片Wasserstein距离(SWD)衡量不同视图潜在表示之间的分布差异,避免了对样本对应关系的依赖。
- 将SWD用作基底距离,计算视图之间的熵正则化最优传输,构建分层最优传输(HOT)模型,以捕捉视图间的成对相似性。
- 在每对视图之间引入可学习权重,该权重被解释为视图间的最优传输计划,从而实现聚类结构的发现。
- 通过引入全局参考表示,显式学习视图聚类,使最优传输矩阵能够反映具有相似或冗余信息的视图分组。
- 结合小批量随机梯度下降与Sinkhorn算法,实现HOT模型的高效优化。
- 该框架支持半监督与无监督学习,可选的自编码器解码器通过重建损失进一步正则化表示。
实验结果
研究问题
- RQ1基于切片Wasserstein距离的最优传输是否能有效正则化多视图学习,而无需依赖样本对应?
- RQ2通过最优传输建模视图级别的聚类结构,是否能在弱假设条件下提升多视图学习的性能?
- RQ3HOT模型在真实世界与合成数据集的半监督与无监督设置下,相较于基线方法表现如何?
- RQ4所学习的最优传输矩阵是否能揭示有意义的视图分组?这些分组在信息冗余性方面是否具有可解释性?
- RQ5HOT模型在多大程度上减少了强制各视图具有相同潜在分布所导致的过度正则化问题?
主要发现
- 所提出的HOT模型在多个数据集上持续优于强基线方法,在半监督与无监督设置下均实现了更高的分类准确率。
- 在无监督特征提取中,依赖显式视图聚类(通过HOT实现)的方法保持高准确率,而依赖成对比较的方法性能显著下降。
- HOT学习到的最优传输矩阵揭示了可解释的聚类结构:例如在Caltech7数据集中,Gabor与CENTIST构成一个聚类,WM与GIST构成另一个聚类,而HOG与LBP则为多个聚类的混合体。
- 移除同一聚类中的视图(如Gabor或CENTRIST)仅导致性能轻微下降,证实这些视图携带冗余信息。
- 相反,移除一个具有独特结构的视图(如MOR)则导致性能严重下降,验证了模型识别结构上不同的视图的能力。
- 引入自编码器重建损失可进一步提升分类准确率,表明HOT框架中多目标正则化的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。