Skip to main content
QUICK REVIEW

[论文解读] Bias Reduction via End-to-End Shift Learning: Application to Citizen Science

Di Chen, Carla P. Gomes|arXiv (Cornell University)|Nov 1, 2018
Species Distribution and Climate Change参考文献 23被引用 3
一句话总结

本文提出了一种端到端深度学习框架——位移补偿网络(SCN),通过联合学习判别器估计的位移因子与通过重加权实现的特征空间均值对齐,校正公民科学数据中的协变量偏移问题。在eBird鸟类观测数据上的实验表明,SCN显著提升了多物种分布建模性能,在具有偏差采样模式的测试集上,AUC最高提升3.46%,F1-score最高提升5.36%。

ABSTRACT

Citizen science projects are successful at gathering rich datasets for various applications. However, the data collected by citizen scientists are often biased --- in particular, aligned more with the citizens' preferences than with scientific objectives. We propose the Shift Compensation Network (SCN), an end-to-end learning scheme which learns the shift from the scientific objectives to the biased data while compensating for the shift by re-weighting the training data. Applied to bird observational data from the citizen science project eBird, we demonstrate how SCN quantifies the data distribution shift and outperforms supervised learning models that do not address the data bias. Compared with competing models in the context of covariate shift, we further demonstrate the advantage of SCN in both its effectiveness and its capability of handling massive high-dimensional data.

研究动机与目标

  • 为解决公民科学项目中普遍存在的数据偏差问题,即志愿者贡献集中于城市和易达区域而非具有科学代表性的地点。
  • 开发一种可扩展的端到端深度学习方法,量化并校正偏差训练数据与无偏科学测试数据之间的分布偏移。
  • 通过补偿采样偏差,在不重新收集数据的前提下提升机器学习模型在真实世界科学评估任务中的性能。
  • 展示将判别式位移估计与特征空间均值匹配相结合,在高维大规模数据集中的有效性。

提出的方法

  • SCN使用判别器网络区分训练分布(P)和测试分布(Q)的样本,将位移因子 q(x)/p(x) 学习为密度比。
  • 引入特征空间均值匹配损失,将加权训练特征的均值与测试特征的均值对齐,提升位移估计的准确性。
  • 模型联合优化分类损失与两个辅助损失:用于位移估计的判别损失,以及用于分布对齐的特征空间均值匹配损失。
  • 采用移动平均估计方法实现特征空间均值匹配损失,以稳定训练并提升泛化能力。
  • 最终模型利用估计的位移因子对训练样本进行重加权,以最小化在测试分布下的分类误差。
  • 该框架采用端到端训练,实现位移估计与模型预测的联合优化。

实验结果

研究问题

  • RQ1端到端深度学习模型能否在具有高维特征的真实公民科学数据中有效估计并校正协变量偏移?
  • RQ2将判别式位移估计与特征空间均值匹配相结合,如何提升模型在无偏测试数据上的泛化能力?
  • RQ3与基于小批量的估计相比,采用移动平均估计方法进行特征空间均值匹配有何影响?
  • RQ4SCN在大规模生物多样性数据上的预测性能是否优于现有的领域自适应与协变量偏移校正方法?
  • RQ5所学习的位移因子如何重新分配采样权重,以缓解观测数据中的空间偏差?

主要发现

  • 在使用Google Earth图像的测试数据上,SCN实现了83.80%的AUC和62.37%的F1-score,优于所有基线方法(包括DFW、KLIEP和KDE)。
  • 同时采用判别损失与均值匹配损失的SCN变体(SCN)在Google Earth图像基准测试中取得了最高的AUC(83.80%)与F1-score(62.37%)。
  • SCN将加权训练数据与测试数据之间的特征空间差异降低至0.0182,显著低于基线模型(0.8006),表明其具有优异的分布对齐能力。
  • 即使仅使用特征空间均值匹配损失(SCN_FSMM),SCN的性能仍优于所有基线方法,表明其对病态权重估计具有鲁棒性。
  • 采用移动平均估计的均值匹配损失(SCN)优于基于小批量估计的版本(SCN-),证明其在稳定训练中的关键作用。
  • 可视化分析显示,位移因子使纽约州的观测密度分布更加均匀,显著降低了城市区域的过度集中现象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。