[论文解读] HMOE: Hypernetwork-based Mixture of Experts for Domain Generalization
HMOE 提出了一种基于超网络的专家混合(MoE)新型域泛化方法,无需依赖域标签即可发现潜在域,实现可解释且鲁棒的泛化。通过学习稀疏门控的专家路由并结合域内混合(mixup),该方法在多个基准测试中达到最先进性能,平均准确率显著优于现有方法。
Due to domain shifts, machine learning systems typically struggle to generalize well to new domains that differ from those of training data, which is what domain generalization (DG) aims to address. Although a variety of DG methods have been proposed, most of them fall short in interpretability and require domain labels, which are not available in many real-world scenarios. This paper presents a novel DG method, called HMOE: Hypernetwork-based Mixture of Experts (MoE), which does not rely on domain labels and is more interpretable. MoE proves effective in identifying heterogeneous patterns in data. For the DG problem, heterogeneity arises exactly from domain shifts. HMOE employs hypernetworks taking vectors as input to generate the weights of experts, which promotes knowledge sharing among experts and enables the exploration of their similarities in a low-dimensional vector space. We benchmark HMOE against other DG methods under a fair evaluation framework -- DomainBed. Our extensive experiments show that HMOE can effectively separate mixed-domain data into distinct clusters that are surprisingly more consistent with human intuition than original domain labels. Using self-learned domain information, HMOE achieves state-of-the-art results on most datasets and significantly surpasses other DG methods in average accuracy across all datasets.
研究动机与目标
- 为解决现实场景中缺乏域标签的域泛化问题,克服现有方法依赖显式域标注的局限性。
- 通过在专家混合框架中引入无监督路由机制,实现潜在域发现,提升模型可解释性。
- 开发一种端到端联合学习并利用潜在域的方法,增强专家之间的泛化能力与知识共享。
- 在保持跨多样化数据集鲁棒性的前提下,超越现有域泛化方法的平均准确率。
- 引入可微的密集到稀疏路由机制,稳定专家划分并提升潜在域分离质量。
提出的方法
- HMOE 使用一个超网络,以可学习的嵌入向量作为输入,生成 MoE 专家的权重,从而在低维空间中实现知识共享与相似性探索。
- 路由机制利用这些嵌入向量计算门控值,使模型能够将输入空间软性划分为与潜在域相关的子空间。
- 提出一种新型可微的密集到稀疏 Top-1 路由算法,强制门控值变为 one-hot 状态,实现硬性划分并稳定潜在域发现过程。
- 该方法引入一种域内混合策略,即在每个推断出的潜在域内部应用 mixup,以提升泛化性能。
- 模型通过自学习的域表示进行端到端训练,无需真实域标签。
- 框架在 DomainBed 基准上进行评估,确保与最先进域泛化方法的公平比较。
实验结果
研究问题
- RQ1在不依赖域标签的前提下,专家混合框架能否在混合域数据中发现有意义的潜在域?
- RQ2基于超网络的专家权重生成方式如何提升域泛化中的知识共享与模型可解释性?
- RQ3与软性路由相比,稀疏门控路由在多大程度上提升了潜在域发现的稳定性和质量?
- RQ4在无域标签条件下,域内混合是否能提升泛化性能?
- RQ5HMOE 是否能在多样化数据集上实现最先进性能,同时保持可解释性与鲁棒性?
主要发现
- 在 PACS 数据集的 'w/o Domain Labels' 设置下,HMOE 达到 88.0 的最先进平均准确率,显著优于先前方法如 RSC(87.0)和 SelfReg(86.1)。
- 在 Office-Home 数据集上,HMOE-MU 实现 72.5 的平均准确率,所有评估方法中排名第一,甚至超越了使用域标签的模型。
- 在 TerraInc 数据集上,HMOE-MU 达到 52.8 的平均准确率,排名第一,领先第二名方法 SagNet(50.7)2.1 个百分点。
- HMOE-DL(使用域标签)仍表现出强劲性能,表明该方法在标签可用时也具备高度鲁棒性。
- 模型成功将混合域数据聚类为清晰、符合人类直觉的簇,证明了有效的潜在域发现能力。
- 消融实验确认,超网络、稀疏路由与域内混合的组合对实现最优性能至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。