[论文解读] Sparse Mixture-of-Experts are Domain Generalizable Learners
本文提出通用性专家混合模型(GMoE),一种基于视觉变换器的架构,通过稀疏专家专业化对齐不变视觉相关性,从而提升领域泛化能力。GMoE 在使用 ERM 训练时优于当前最先进(SOTA)的领域泛化方法,并在 DomainBed 基准上实现最先进性能,表明主干网络架构设计是提升对分布偏移鲁棒性的关键且尚未充分探索的方向。
Human visual perception can easily generalize to out-of-distributed visual data, which is far beyond the capability of modern machine learning models. Domain generalization (DG) aims to close this gap, with existing DG methods mainly focusing on the loss function design. In this paper, we propose to explore an orthogonal direction, i.e., the design of the backbone architecture. It is motivated by an empirical finding that transformer-based models trained with empirical risk minimization (ERM) outperform CNN-based models employing state-of-the-art (SOTA) DG algorithms on multiple DG datasets. We develop a formal framework to characterize a network's robustness to distribution shifts by studying its architecture's alignment with the correlations in the dataset. This analysis guides us to propose a novel DG model built upon vision transformers, namely Generalizable Mixture-of-Experts (GMoE). Extensive experiments on DomainBed demonstrate that GMoE trained with ERM outperforms SOTA DG baselines by a large margin. Moreover, GMoE is complementary to existing DG methods and its performance is substantially improved when trained with DG algorithms.
研究动机与目标
- 探究主干网络架构在领域泛化中的作用,挑战当前对损失函数设计的主导关注。
- 利用算法对齐理论,形式化网络架构对齐与对分布偏移鲁棒性之间的关系。
- 提出一种新型架构——通用性专家混合模型(GMoE),通过专家对视觉属性的专门化,增强对虚假相关性的不变性。
- 通过展示在不同数据分布下对共享视觉属性的专家选择保持一致,验证 GMoE 在跨领域上的泛化能力。
- 证明 GMoE 与现有 DG 方法具有互补性,并在与之结合时进一步提升性能。
提出的方法
- 作者利用算法对齐理论形式化了对分布偏移的鲁棒性,证明与不变相关性对齐的架构更具鲁棒性。
- 他们分析了卷积模块与基于注意力的模块在真实世界数据集中对不变相关性与虚假相关性的对齐程度,揭示了为何在 ERM 设置下视觉变换器优于卷积神经网络(CNNs)。
- 他们设计了 GMoE,作为插入视觉变换器中的稀疏专家混合层,其中每个专家专门处理特定的视觉属性(例如:鸟喙、腿部、背景)。
- 路由机制根据输入内容动态将 token 分配给专家,实现稀疏、自适应的计算,并提升视觉因子的解耦能力。
- 他们可视化了不同领域中的专家选择,表明相同的专家在不同风格化和领域中持续处理相同的属性(例如:喙、尾羽)。
- 他们对比了 ViT 与 GMoE 的多头注意力模式,证明 MoE 层减少了注意力冗余,并提升了特征解耦能力。
实验结果
研究问题
- RQ1仅通过主干网络架构设计是否能独立提升领域泛化能力,而不依赖损失函数工程?
- RQ2架构对不变相关性与虚假相关性的对齐程度如何影响模型对分布偏移的鲁棒性?
- RQ3能否设计一种专家混合模型,使其专门处理视觉属性并在领域偏移下保持泛化能力?
- RQ4当使用标准 ERM 训练时,GMoE 是否优于当前最先进(SOTA)的领域泛化方法,且无需额外的 DG 损失组件?
- RQ5GMoE 是否与现有 DG 算法互补?与之结合时是否能进一步提升性能?
主要发现
- 在 OfficeHome、DomainNet 和 VLCS 数据集上,使用 ERM 训练的原始视觉变换器(ViT-S/16)在参数量相近的情况下,优于使用 SOTA DG 算法的 ResNet-50。
- 理论分析证实,与不变相关性对齐的模型对分布偏移更具鲁棒性,而与虚假相关性对齐的模型则更不鲁棒。
- GMoE 在 ERM 训练下于 DomainBed 基准上实现了最先进性能,显著超越当前 SOTA DG 基线。
- GMoE 中的专家选择在不同领域间保持一致:无论领域特定的风格化如何,相同的视觉属性(如喙、尾羽)均由相同的专家处理。
- 可视化结果表明,与标准多头注意力相比,GMoE 减少了注意力冗余,且专家专注于不同的视觉特征。
- 当与现有 DG 算法结合时,GMoE 进一步提升了性能,证明其与当前方法具有良好的互补性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。