[论文解读] Learning Cross-domain Generalizable Features by Representation Disentanglement
本文提出 MIDNet,一种半监督学习方法,通过互信息最小化,将领域不变的类别特征与领域特定特征解耦,以提升在目标领域未见类别上的泛化能力。该方法在 MNIST 和胎儿超声数据集上均达到最先进性能,尤其在仅使用 30% 标注数据时,对未见类别的表现尤为出色。
Deep learning models exhibit limited generalizability across different domains. Specifically, transferring knowledge from available entangled domain features(source/target domain) and categorical features to new unseen categorical features in a target domain is an interesting and difficult problem that is rarely discussed in the current literature. This problem is essential for many real-world applications such as improving diagnostic classification or prediction in medical imaging. To address this problem, we propose Mutual-Information-based Disentangled Neural Networks (MIDNet) to extract generalizable features that enable transferring knowledge to unseen categorical features in target domains. The proposed MIDNet is developed as a semi-supervised learning paradigm to alleviate the dependency on labeled data. This is important for practical applications where data annotation requires rare expertise as well as intense time and labor. We demonstrate our method on handwritten digits datasets and a fetal ultrasound dataset for image classification tasks. Experiments show that our method outperforms the state-of-the-art and achieve expected performance with sparsely labeled data.
研究动机与目标
- 解决将已知的纠缠图像特征(类别特征与领域特征)迁移到目标领域未见类别所面临的挑战。
- 减少在医学影像等实际应用中对大规模标注数据的依赖,因为此类标注成本高且耗时。
- 开发一种半监督学习框架,有效利用标注数据与未标注数据,以提升泛化能力。
- 显式地将领域不变特征与领域特定特征及类别特征解耦,从而实现对未见类别组合的迁移。
提出的方法
- MIDNet 采用互信息最小化方法,将类别特征(C)与领域特征(D)解耦,促使模型学习领域不变的表示。
- 模型为类别特征与领域特征分别使用独立的编码器与解码器,并基于跨领域特征相似性的对比损失,增强解耦效果。
- 采用受 MixMatch 启发的半监督训练策略,通过一致性正则化整合未标注数据,提升在有限标注数据下的泛化能力。
- 通过联合优化包含交叉熵损失、互信息最小化损失和对比损失的多组件损失函数,平衡解耦效果与分类性能。
- 超参数根据具体应用进行调优,实验中使用了特定数值(例如,λ₁=1,λ₂=10,λ₃=10⁻⁴,λ₄=50,λ₅=50)。
- 该架构可通过为新领域添加额外的编码器-解码器对,轻松扩展至多个目标领域。
实验结果
研究问题
- RQ1通过互信息最小化实现表征解耦,是否能提升在目标领域未见类别特征上的泛化能力?
- RQ2在标注数据有限的情况下,半监督学习方法在实现对未见类别-领域组合迁移方面的有效性如何?
- RQ3解耦领域不变特征是否能带来相较于标准领域自适应方法在未见类别上的更好性能?
- RQ4该模型能否在医学影像(如胎儿超声)中实现跨不同成像设备的泛化,其中领域偏移源于设备特异性伪影?
主要发现
- 在胎儿超声跨设备实验中,MIDNet-VIII 在 $T_{Target}^{New}$ 上取得 0.8383 的 F1 分数,显著优于 DANN(0.3470)和 MME(0.4293)。
- 在 $T_{Target}^{New}$ 上,MIDNet-VIII 达到 86.00% 的召回率和 84.97% 的精确率,展现出对未见类别的强大泛化能力。
- 在仅使用 30% 标注数据的跨设备胎儿超声任务中,MIDNet-VIII 在 $T_{Target}$ 上取得 0.7434 的 F1 分数,优于 DANN(0.3568)和 MME(0.5400)。
- 在源域($T_{Source}$)上,MIDNet-VIII 取得 0.9281 的 F1 分数,表明其在已知类别上也具备强大性能。
- 该方法对类别不平衡和标注数据稀缺具有鲁棒性,性能在中等标注率下达到峰值,并在过度标注时下降。
- 定性分析表明,解耦使模型能够识别显著特征(如超声中的声影伪影),这些特征可能对某些类别比解剖学特征更具预测性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。