[论文解读] Deeper, Broader and Artier Domain Generalization
本文提出一种低秩参数化的卷积神经网络(CNN),用于端到端的域泛化,在一个新且更具挑战性的基准数据集 PACS 上表现优于先前方法。该数据集涵盖照片、艺术绘画、卡通和素描四种域。该方法使用 2-hot 编码的域描述符与低秩分解,实现在不同域之间共享知识的同时减少过拟合,最终在 PACS 基准上实现 69.21% 的平均准确率,达到当前最优性能。
The problem of domain generalization is to learn from multiple training domains, and extract a domain-agnostic model that can then be applied to an unseen domain. Domain generalization (DG) has a clear motivation in contexts where there are target domains with distinct characteristics, yet sparse data for training. For example recognition in sketch images, which are distinctly more abstract and rarer than photos. Nevertheless, DG methods have primarily been evaluated on photo-only benchmarks focusing on alleviating the dataset bias where both problems of domain distinctiveness and data sparsity can be minimal. We argue that these benchmarks are overly straightforward, and show that simple deep learning baselines perform surprisingly well on them. In this paper, we make two main contributions: Firstly, we build upon the favorable domain shift-robust properties of deep learning methods, and develop a low-rank parameterized CNN model for end-to-end DG learning. Secondly, we develop a DG benchmark dataset covering photo, sketch, cartoon and painting domains. This is both more practically relevant, and harder (bigger domain shift) than existing benchmarks. The results show that our method outperforms existing DG alternatives, and our dataset provides a more significant DG challenge to drive future research.
研究动机与目标
- 为解决现有域泛化(DG)基准的局限性,即过于简单,且基于仅含照片的域,域间差异较小。
- 开发一个更具实际意义且更具挑战性的 DG 基准,以反映现实世界场景中目标域(如素描、绘画)数据稀缺且与照片在视觉上显著不同的情况。
- 提出一种新颖的深度学习方法,通过低秩参数化权重生成,实现端到端学习域无关特征与分类器。
- 证明当在更真实、高域偏移的基准上评估时,简单的深度学习基线可超越专门设计的 DG 方法。
提出的方法
- 提出一种低秩参数化的卷积神经网络(CNN),减少模型参数量,并实现在各层之间灵活可学习的域间知识共享。
- 使用域描述符的 2-hot 编码,通过基于张量的权重生成网络生成共享的、与域无关的分类器权重。
- 对权重生成网络的参数应用低秩分解,实现对不同域之间知识共享程度的动态、逐层控制。
- 对微调后的模型执行 Tucker 分解,以分析各层学习到的知识共享强度,结果表明早期卷积层的知识共享程度高于后期全连接层。
- 在多个源域(照片、绘画、卡通、素描)上进行端到端训练,联合优化特征提取与域无关分类。
- 引入一种新颖的消融实验框架,用于评估各组件的贡献:域描述符编码、低秩分解以及多层应用。
实验结果
研究问题
- RQ1当在更真实、更具挑战性的基准上评估时,简单的端到端深度学习基线是否能超越专门设计的域泛化方法?
- RQ2新基准(PACS)中的域偏移程度与现有仅含照片的基准相比,在难度和实际相关性方面有何差异?
- RQ3低秩参数化与 2-hot 编码的域描述符在多样化视觉域上的泛化性能提升方面,其贡献程度如何?
- RQ4在域泛化设置下,CNN 不同层的模型学习到的共享强度如何变化?
- RQ5多层低秩权重生成相较于单层微调,在域泛化中的贡献如何?
主要发现
- 所提方法 Ours-Full 在 PACS 基准上实现 69.21% 的平均准确率,优于所有先前的 DG 方法,包括 uDICA 和 D-MTAE-1HNN。
- 消融研究显示,每个组件——2-hot 编码、低秩分解与多层应用——均对性能有逐步贡献,Ours-Full 平均比 2HE+Decomp-Last 高出 5.11%。
- 模型学习到灵活的、逐层的共享强度:早期卷积层(Conv1–Conv3)表现出高共享,而后期层(FC6–FC8)共享程度较低,中间层则根据未见域而变化。
- 当素描为未见域时,模型在照片、绘画与卡通之间学习到更高的共享程度,反映出这些域与素描在视觉上的相对相似性。
- Tucker 分解结果表明,模型自动学习到素描是差异最大的域,因此当其被排除在训练域之外时,共享强度较低。
- 该方法优于强基线(如 Deep-ALL 和 SVM),表明引入显式 DG 归纳偏置的端到端深度学习比浅层或手工设计方法更有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。