[论文解读] VisDA-2021 Competition Universal Domain Adaptation to Improve Performance on Out-of-Distribution Data
本论文介绍了VisDA-2021通用域适应(UniDA)竞赛,挑战模型在源域与目标域之间类别重叠未知的情况下,对分布外数据实现泛化。该竞赛提出一个统一基准,采用多样化数据集(ImageNet、ObjectNet、ImageNet-R、ImageNet-C、ImageNet-O),并使用AUC评估新类别检测能力,以及实例级准确率,强调在无目标数据标签的情况下对分布偏移的鲁棒性。
Progress in machine learning is typically measured by training and testing a model on the same distribution of data, i.e., the same domain. This over-estimates future accuracy on out-of-distribution data. The Visual Domain Adaptation (VisDA) 2021 competition tests models' ability to adapt to novel test distributions and handle distributional shift. We set up unsupervised domain adaptation challenges for image classifiers and will evaluate adaptation to novel viewpoints, backgrounds, modalities and degradation in quality. Our challenge draws on large-scale publicly available datasets but constructs the evaluation across domains, rather that the traditional in-domain bench-marking. Furthermore, we focus on the difficult "universal" setting where, in addition to input distribution drift, methods may encounter missing and/or novel classes in the target dataset. Performance will be measured using a rigorous protocol, comparing to state-of-the-art domain adaptation methods with the help of established metrics. We believe that the competition will encourage further improvement in machine learning methods' ability to handle realistic data in many deployment scenarios.
研究动机与目标
- 评估机器学习模型在源域与目标域之间类别重叠未知的情况下,对分布外数据的泛化能力。
- 通过在真实世界分布偏移(如新视角、新背景、图像退化)上测试模型,解决传统分布内评估的局限性。
- 通过要求模型在无目标数据标签的情况下检测并分类已知与新类别,推动域适应的鲁棒性。
- 利用大规模、公开可用的数据集并控制域偏移,建立严格的通用域适应基准。
- 鼓励开发能够跨多种分布偏移类型(包括开集与部分集适应)泛化的无监督域适应方法。
提出的方法
- 竞赛使用ImageNet作为源域,ObjectNet、ImageNet-R、ImageNet-C和ImageNet-O的混合作为目标域,以模拟多样化的分布偏移。
- 参赛者可获得带标签的源数据和无标签的目标数据,训练或调参期间无法访问目标标签。
- 采用双阶段评估协议:第一阶段允许在混合目标域的验证集上进行调参,第二阶段释放独立的测试集用于最终提交,且不提供标签。
- 该方法要求模型对每个输入输出一个预测类别标签和一个标量新颖度分数,以支持对未知类别的AUC计算。
- 评估使用两种指标:已知类别的实例级准确率,以及检测分布外(新)类别的AUC。
- 提供开发工具包,包含数据链接、基线代码、提交说明和指标实现,以实现评估的标准化。
实验结果
研究问题
- RQ1无监督域适应模型在类别重叠未知(包括缺失与新类别)的目标域上,泛化能力如何?
- RQ2模型在未接触过的新类别上,仅依赖置信度或新颖度分数,检测分布外样本的能力有多强?
- RQ3在通用域适应设置下,模型能否在保持已知类别高准确率的同时,同时识别并拒绝新类别?
- RQ4当测试环境涉及多种类型的数据退化与域偏移时,现有域适应技术的有效性如何?
- RQ5在无法访问目标域标签的情况下,当前方法在超参数调优方面存在哪些局限性?
主要发现
- VisDA-2021竞赛建立了新的通用域适应基准,整合了包括新类别、图像退化和域偏移在内的多种分布偏移类型。
- 通过实例级准确率和新类别检测的AUC双重评估,全面衡量了模型的泛化能力与鲁棒性。
- 竞赛协议通过禁止在目标标签上进行调参,防止对测试集的过拟合,确保了泛化能力的公平评估。
- 开发集与测试集均来自公开可用的数据集,采用不同混合比例,防止通过数据记忆实现过拟合。
- 竞赛强调真实世界部署场景,即模型必须在无人工标注目标数据的情况下适应未见的数据分布。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。