Skip to main content
QUICK REVIEW

[论文解读] Aggregating From Multiple Target-Shifted Sources

Changjian Shui, Zijian Li|arXiv (Cornell University)|May 9, 2021
Domain Adaptation and Few-Shot Learning参考文献 84被引用 7
一句话总结

本文提出了一种新颖的多源域自适应方法,通过建模语义条件分布相似性 P(x|y) 而非边缘分布 P(x),聚合来自多个源域的知识,从而在标签分布偏移下实现有效的源选择。该方法通过统一框架将三种关键场景——有限标签、无监督和部分标签域自适应——统一起来,联合学习任务关系与标签分布比率,相较于现有基线方法取得显著性能提升。

ABSTRACT

Multi-source domain adaptation aims at leveraging the knowledge from multiple tasks for predicting a related target domain. Hence, a crucial aspect is to properly combine different sources based on their relations. In this paper, we analyzed the problem for aggregating source domains with different label distributions, where most recent source selection approaches fail. Our proposed algorithm differs from previous approaches in two key ways: the model aggregates multiple sources mainly through the similarity of semantic conditional distribution rather than marginal distribution; the model proposes a \emph{unified} framework to select relevant sources for three popular scenarios, i.e., domain adaptation with limited label on target domain, unsupervised domain adaptation and label partial unsupervised domain adaption. We evaluate the proposed method through extensive experiments. The empirical results significantly outperform the baselines.

研究动机与目标

  • 解决现有多源域自适应方法依赖边缘分布相似性 P(x) 所带来的局限性,当源域与目标域标签分布不同时该方法会失效。
  • 为三种关键域自适应场景——有限标签、无监督和部分标签域自适应——设计统一的源选择框架。
  • 通过建模语义条件分布 P(x|y) 并在广义标签偏移(GLS)条件下估计标签分布比率,克服域自适应中的负迁移问题。
  • 即使目标标签稀缺或部分缺失,也能实现可靠的源聚合,提升实际应用中的鲁棒性与泛化能力。

提出的方法

  • 提出一种基于语义条件分布 P(x|y) 相似性的源选择策略,其对任务相关性的捕捉优于边缘分布 P(x)。
  • 引入统一框架,通过预测的标签分布比率与条件分布相似性联合实现源加权与模型聚合。
  • 利用广义标签偏移(GLS)条件建模标签分布偏移,并估计源域与目标域标签分布之间的比率。
  • 通过源预测的加权组合与域差异的联合优化来调整模型参数,其中权重根据估计的标签比率自适应调整。
  • 通过引入无需完整目标监督的标签分布比率估计器,将方法扩展至无监督与部分标签设置。
  • 基于定理1与定理2的理论洞见,推导出一种在分布偏移下最小化风险的合理源聚合机制。

实验结果

研究问题

  • RQ1在标签分布偏移下,基于 P(x|y) 相似性的源选择是否能优于传统的基于 P(x) 相似性的方法?
  • RQ2如何设计一个统一框架,以同时处理有限标签、无监督和部分标签域自适应场景?
  • RQ3当源域与目标域标签分布不同时,建模语义条件分布 P(x|y) 在多大程度上可减少负迁移?
  • RQ4标签分布比率估计器是否能提升无监督与部分标签域自适应设置下的性能?
  • RQ5在不同源域偏移的数据分布下,估计的标签比率是否具有稳定性和一致性?

主要发现

  • 所提方法在所有三种场景——有限标签、无监督和部分标签设置——下的多源域自适应中,显著优于现有基线方法。
  • 在 Amazon 评论数据集上的实证结果表明,WADN 的准确率更高且收敛更稳定,优于 DANN、PADA 和 DARN。
  • 方法正确估计了标签分布比率,可视化结果表明对被丢弃类(如 Amazon 中的 y=0,数字数据集中的 5–9 位数字)的估计权重 α̂t 更高。
  • 在无监督与部分标签设置下,WADN 即使仅提供部分类别,也能保持稳定性能,优于 DANN 和 PADA 等方法所表现出的高方差。
  • 所提框架展示了对标签分布比率的一致且可靠的估计,而 DARN 在源域偏移下表现出不稳定的估计。
  • α̂t 演变过程的可视化结果证实,模型会为源域中低频或被丢弃的类别分配更高权重,与理论预期一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。