[论文解读] Domain Adaptation with Randomized Expectation Maximization
本文提出了一种简单且可扩展的领域自适应方法——Ad-REM(随机化期望最大化),通过使用逻辑回归或支持向量机(SVM)迭代优化未标注目标数据的预测,实现了最先进(SOTA)的性能。该方法在36个多样化的文本和图像任务中优于复杂的深度迁移学习方法,尤其在结合预训练网络提取的深度特征时表现更优。
Domain adaptation (DA) is the task of classifying an unlabeled dataset (target) using a labeled dataset (source) from a related domain. The majority of successful DA methods try to directly match the distributions of the source and target data by transforming the feature space. Despite their success, state of the art methods based on this approach are either involved or unable to directly scale to data with many features. This article shows that domain adaptation can be successfully performed by using a very simple randomized expectation maximization (EM) method. We consider two instances of the method, which involve logistic regression and support vector machine, respectively. The underlying assumption of the proposed method is the existence of a good single linear classifier for both source and target domain. The potential limitations of this assumption are alleviated by the flexibility of the method, which can directly incorporate deep features extracted from a pre-trained deep neural network. The resulting algorithm is strikingly easy to implement and apply. We test its performance on 36 real-life adaptation tasks over text and image data with diverse characteristics. The method achieves state-of-the-art results, competitive with those of involved end-to-end deep transfer-learning methods.
研究动机与目标
- 开发一种简单、可扩展至高维数据、且与复杂端到端深度迁移学习方法具有竞争力的领域自适应方法。
- 解决现有基于领域差异最小化的方法的局限性,这些方法计算成本高,且在高维或存在领域偏移的数据上表现不佳。
- 探究结合预训练网络提取的深度特征时,简单的基于EM的方法是否能有效利用未标注的目标数据。
- 在涉及文本和图像数据、且领域偏移程度各异的真实世界适应任务中,评估该方法的性能表现。
提出的方法
- 该方法采用随机化期望最大化(EM)框架,通过在源数据上训练的模型,迭代地为未标注的目标数据重新分配标签,并利用标签置信度在后续轮次中更新模型。
- 提出两种变体:Ad-REM LR(逻辑回归)和Ad-REM SVM(支持向量机),两者均在源数据上训练,并通过伪标签化的目标样本进行优化。
- 该算法在“期望”(对目标数据预测类别概率)和“最大化”(使用源数据和伪标签化的目标数据重新训练分类器)步骤之间交替进行。
- 在EM过程中引入随机化,以避免收敛到次优局部最优解,从而提升鲁棒性和泛化能力。
- 该方法直接整合从预训练深度神经网络(如ResNet、VGG)提取的深度特征,无需微调网络,即可实现有效自适应。
- 该方法假设单一线性分类器可在源域和目标域之间泛化,通过迭代优化实现对领域偏移的灵活处理。
实验结果
研究问题
- RQ1一种简单的基于随机化EM的方法是否能在无需端到端训练深度神经网络的情况下,实现领域自适应的最先进性能?
- RQ2当应用于高维深度特征时,所提出的Ad-REM方法与复杂深度迁移学习方法相比表现如何?
- RQ3当源域和目标域之间存在显著词汇或特征分布偏移(如跨产品类型的情感分析)时,该方法是否仍具有效性?
- RQ4该方法在高维数据集(尤其是与现有领域差异最小化技术相比)中的可扩展性如何?
- RQ5该方法在多大程度上能从预训练深度特征中获益?其在这些特征上的表现是否优于浅层领域自适应基线方法?
主要发现
- 在Office-31数据集上,Ad-REM LR使用ResNet-50特征实现了96.6%的平均准确率,优于所有基线方法,包括最先进的深度方法JAN-A(84.6%)。
- 在Cross Dataset Testbed上,Ad-REM LR使用校正后的DECAF-fc7特征实现了51.1%的准确率,显著优于第二名方法(CORAL为43.9%)。
- 在Office-Caltech 10数据集上,Ad-REM LR使用ResNet-50特征实现了96.7%的平均准确率,超过次优方法(使用SURF特征的CORAL为48.8%)。
- 该方法在36项真实世界文本和图像领域的适应任务中均取得了最先进结果,展现出强大的泛化能力和鲁棒性。
- 与仅使用源数据的基线方法(在Office-31上为91.4%)相比,Ad-REM LR平均高出超过5个百分点,充分证明了未标注目标数据的显著增益。
- 该方法具有高度可扩展性和高效性,避免了领域差异最小化方法的超二次方复杂度,适用于高维数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。