QUICK REVIEW
[论文解读] Learning Sampling Policies for Domain Adaptation
Yash Patel, Kashyap Chitta|arXiv (Cornell University)|May 19, 2018
Domain Adaptation and Few-Shot Learning参考文献 16被引用 6
一句话总结
本文提出一种基于深度Q-learning的方法,用于学习半监督域适应中的采样策略,利用源分类器在目标数据上生成噪声标签,并训练智能体选择能最大化小规模标注奖励集准确率的有信息量样本。该方法在Office-31数据集上实现了半监督方法中的最先进性能,优于基线方法并缩小了与无监督SOTA的差距,但受限于固定且未优化的表示。
ABSTRACT
We address the problem of semi-supervised domain adaptation of classification algorithms through deep Q-learning. The core idea is to consider the predictions of a source domain network on target domain data as noisy labels, and learn a policy to sample from this data so as to maximize classification accuracy on a small annotated reward partition of the target domain. Our experiments show that learned sampling policies construct labeled sets that improve accuracies of visual classifiers over baselines.
研究动机与目标
- 通过在目标域中利用小规模标注奖励集,解决域适应中高标注成本的挑战。
- 通过学习目标数据的最优采样策略,提升半监督域适应中的分类准确率。
- 将预训练源分类器的知识与强化学习智能体相结合,指导有信息量的目标样本的主动选择。
- 探究基于策略的采样是否能在低资源域适应设置下优于随机或启发式采样。
- 在Office-31基准上评估该方法,与无监督及半监督基线进行性能比较。
提出的方法
- 在源域上微调一个ResNet-50主干网络,以生成用于目标域图像伪标签的源分类器 $C_{src}$。
- 训练一个二分类SVM域判别器 $C_{dom}$,以区分源域与目标域特征,并基于其决策边界距离采样一个奖励集 $S_{rew}$。
- 一个深度Q网络(DDQN)充当采样策略,选择将目标图像添加到多分类SVM目标分类器 $C_{tar}$ 的训练集 $S_{pos}$ 中。
- Q智能体基于 $C_{tar}$ 在保留奖励集 $S_{rew}$ 上的准确率,使用稀疏奖励进行训练,且在每次动作后重新训练 $S_{pos}$。
- 状态表示包括预测置信度直方图和候选特征,动作空间为每轮迭代中21张采样的图像。
- Q网络使用Adam优化器、$\u0000$-greedy探索策略训练,并在20,000轮迭代中每10步更新一次目标网络。
实验结果
研究问题
- RQ1强化学习智能体能否学习到选择能提升分类器准确率的有信息量目标域图像,且仅需极少人工标注数据?
- RQ2在半监督域适应中,基于策略的采样与随机或启发式采样相比表现如何?
- RQ3当结合主动采样时,使用源分类器生成的伪标签在下游性能上能提升多少?
- RQ4将基于奖励的强化学习智能体与固定源分类器结合,是否能获得优于无监督域适应方法的结果?
- RQ5表示质量对所学采样策略性能的影响如何?
主要发现
- 所提方法在A→D上达到86.1%准确率,A→W上为83.5%,D→A上为64.6%,D→W上为93.1%,W→A上为60.8%,W→D上为98.2%,在所有迁移任务中均优于基线。
- 在Office-31的六个迁移任务中,该方法将准确率从基线的76.9%提升至96.8%,表明主动采样带来了持续的性能增益。
- 尽管使用了预训练源分类器的固定表示,该方法仍显著缩小了与Kang等人(2019)等先进无监督域适应方法的差距。
- 基于域分类器置信度采样的奖励集 $S_{rew}$,有效评估了策略性能,并引导Q智能体选择高质量样本。
- 基于DDQN的采样策略具有良好的跨域泛化能力,尤其在仅每类3个标注样本的低资源设置下表现一致提升。
- 结果表明,通过强化学习将主动学习与源域知识相结合,可获得优于单独使用任一方法的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。