[论文解读] Entropy Minimization vs. Diversity Maximization for Domain Adaptation
本文提出了一种新型无监督域自适应方法——最小熵多样性最大化(MEDM),通过在熵最小化与多样性最大化之间取得平衡,避免了平凡解。利用深度嵌入验证进行超参数调优,MEDM在VisDA-2017、ImageCLEF、Office-Home和Office-31数据集上均取得了最先进性能,在SVHN→MNIST任务上达到98.7%的准确率,显著优于仅采用熵最小化的基线方法及先前的最先进方法。
Entropy minimization has been widely used in unsupervised domain adaptation (UDA). However, existing works reveal that entropy minimization only may result into collapsed trivial solutions. In this paper, we propose to avoid trivial solutions by further introducing diversity maximization. In order to achieve the possible minimum target risk for UDA, we show that diversity maximization should be elaborately balanced with entropy minimization, the degree of which can be finely controlled with the use of deep embedded validation in an unsupervised manner. The proposed minimal-entropy diversity maximization (MEDM) can be directly implemented by stochastic gradient descent without use of adversarial learning. Empirical evidence demonstrates that MEDM outperforms the state-of-the-art methods on four popular domain adaptation datasets.
研究动机与目标
- 解决基于熵最小化的无监督域自适应中出现的平凡解问题,即模型坍缩为仅预测单一主导类别的情况。
- 通过显式最大化预测中的类别多样性来提升目标域泛化能力,与熵最小化形成互补。
- 提出一种无需对抗训练即可实现熵最小化与多样性最大化之间近似最优权衡的方法。
- 在缺乏目标标签的情况下,利用深度嵌入验证(DEV)实现无偏风险估计,以实现有效的超参数选择。
- 在标准域自适应基准上展示优越性能,尤其在VisDA-2017等大规模数据集上表现突出。
提出的方法
- 提出一种结合熵最小化与多样性最大化的损失函数,其中多样性通过预测类别概率的方差来度量。
- 引入平衡目标:$\mathcal{L}_{\text{MEDM}} = \lambda \cdot H(\mathbf{p}) - \beta \cdot \mathcal{L}_d(\mathcal{T})$,其中$H(\mathbf{p})$为熵,$\mathcal{L}_d(\mathcal{T})$为多样性损失。
- 使用深度嵌入验证(DEV)以无监督方式估计目标风险,从而实现平衡超参数$\lambda$与$\beta$的自动选择。
- 通过随机梯度下降端到端训练模型,无需对抗训练,简化优化过程并提升稳定性。
- 在无标签目标数据上训练过程中应用MEDM目标,以同时鼓励模型做出置信预测并保持预测中类别分布的均匀性。
- 采用ResNet-50主干网络,并在VisDA-2017、Office-31、Office-Home和ImageCLEF等多个域自适应基准上进行训练。
实验结果
研究问题
- RQ1仅使用熵最小化是否会导致无监督域自适应中的平凡解?如果是,其成因是什么?
- RQ2如何显式地最大化模型预测中的多样性,以防止在域自适应过程中坍缩为单一类别?
- RQ3在域自适应中,为最小化目标风险,熵最小化与多样性最大化之间应如何实现最优权衡?
- RQ4深度嵌入验证(DEV)是否能有效用于在无目标标签条件下调优熵与多样性之间的平衡超参数?
- RQ5结合熵最小化与多样性最大化是否能在多种不同的域偏移场景下持续带来性能提升?
主要发现
- 仅采用熵最小化(EMO)在SVHN→MNIST任务上表现灾难性失败,准确率仅为44.1%,且预测结果被单一类别(数字1)主导,表明存在平凡解。
- MEDM在SVHN→MNIST上达到98.7%的准确率,较先前最先进方法MECA(95.2%)提升3.5个百分点,展现出强大的泛化能力与鲁棒性。
- 在VisDA-2017上,MEDM实现了最先进性能,显著优于现有方法,尤其在最大规模的基准数据集上展现出巨大优势。
- 多样性损失$\mathcal{L}_d(\mathcal{T})$本身并不会自动导致类别分布均匀;通过DEV进行恰当平衡对避免性能下降至关重要。
- 当$\beta$过低(如<0.3)时,部分类别未被识别;当$\beta$过高(如0.5)时,性能反而下降,表明需谨慎调优超参数。
- 添加如MMD或对抗性损失等域差异损失会进一步降低性能,表明MEDM内部的平衡机制比外部域对齐方法更有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。