[论文解读] Collaborative Training of Balanced Random Forests for Open Set Domain Adaptation
本文提出 CoBRF,一种用于平衡随机森林的协作训练算法,在存在噪声、数据量小或数据错位的情况下,显著提升了开放集域自适应任务的鲁棒性。通过基于 SVM 的超平面强制决策树实现均等分割,并利用对抗学习最小化领域信息增益,CoBRF 有效缓解了过拟合问题,提升了泛化能力,在 Office-31、Office-Home 和 ImageCLEF-DA 数据集上,于极端设定(高达 80% 标注噪声和 10% 训练数据)下实现了最先进性能。
In this paper, we introduce a collaborative training algorithm of balanced random forests with convolutional neural networks for domain adaptation tasks. In real scenarios, most domain adaptation algorithms face the challenges from noisy, insufficient training data and open set categorization. In such cases, conventional methods suffer from overfitting and fail to successfully transfer the knowledge of the source to the target domain. To address these issues, the following two techniques are proposed. First, we introduce the optimized decision tree construction method with convolutional neural networks, in which the data at each node are split into equal sizes while maximizing the information gain. It generates balanced decision trees on deep features because of the even-split constraint, which contributes to enhanced discrimination power and reduced overfitting problem. Second, to tackle the domain misalignment problem, we propose the domain alignment loss which penalizes uneven splits of the source and target domain data. By collaboratively optimizing the information gain of the labeled source data as well as the entropy of unlabeled target data distributions, the proposed CoBRF algorithm achieves significantly better performance than the state-of-the-art methods.
研究动机与目标
- 解决在训练数据存在噪声或规模有限时,领域自适应任务中的过拟合问题。
- 在源域与目标域之间存在未知或错位类别时,提升开放集领域自适应中的泛化能力。
- 通过施加均等分割约束,构建更平衡的决策树,从而增强随机森林的判别能力。
- 在不依赖目标域标签的前提下,通过最小化对抗领域信息增益来对齐源域与目标域分布。
提出的方法
- 提出一种平衡决策树构建方法,在每个节点强制实现大小相等的分割,同时最大化信息增益,从而提升树的表达能力并减少过拟合。
- 使用线性 SVM 配合二值伪标签生成方法,以寻找判别性超平面,再将其转换以实现均等分割,确保树结构的平衡性。
- 引入一种领域对齐损失,最小化源域与目标域数据之间的信息增益,从而在目标域中促进更均匀的分割。
- 在协同优化框架中,同时最大化类别信息增益(针对有标签的源域数据)与最小化领域信息增益(针对无标签的目标域数据)。
- 将领域对齐视为对抗学习过程,通过最小化源域与目标域标签之间的互信息,促进共享特征分布。
- 采用两阶段训练流程:第一阶段使用有标签的源域数据构建平衡树;第二阶段通过联合优化,利用无标签的目标域数据实施领域对齐。
实验结果
研究问题
- RQ1在小样本或噪声数据设置下,强制决策树实现均等分割是否能提升泛化能力并减少过拟合?
- RQ2当目标域标签不可用时,所提出的领域对齐损失在缓解领域偏移方面的有效性如何?
- RQ3在开放集场景下,平衡随机森林的协同训练是否优于标准随机森林及当前最先进领域自适应方法?
- RQ4在极端数据稀缺(如仅 10% 训练数据)和高标签噪声(如 80%)条件下,该方法表现如何?
主要发现
- 在 Office-31 数据集上,当标注噪声达 40% 且使用 ResNet-50 时,CoBRF 在所有对比方法中取得了最高的平均准确率,包括 DAN、JAN 和 CDAN+E。
- 在 80% 标注噪声条件下,CoBRF 相较基线方法展现出最大的性能提升,证实了其对严重数据损坏的鲁棒性。
- 仅使用 10% 的训练数据时,CoBRF 在 Office-31、Office-Home 和 ImageCLEF-DA 上均保持强劲性能,在易过拟合的设置中优于其他方法。
- 在 OpenSet1 协议下使用 AlexNet 时,CoBRF 达到 83.0% 的平均准确率,较先前最先进方法 ([21]) 提升 1.9 个百分点。
- 在更具挑战性的 OpenSet2 协议下使用 ResNet-50 时,CoBRF 达到 86.1% 的平均准确率,超过次优方法(CDA)6.0 个百分点。
- 在更极端的设置下(仅 54 个总训练样本,较标准 OpenSet2 少 54.5%),CoBRF* 仍达到 84.3% 的平均准确率,展现出对低数据场景的强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。