Skip to main content
QUICK REVIEW

[论文解读] Derivative Manipulation for General Example Weighting

Xinshao Wang, Elyor Kodirov|arXiv (Cornell University)|May 27, 2019
Industrial Vision Systems and Defect Detection参考文献 66被引用 8
一句话总结

本文提出了一种名为梯度导数操控(Derivative Manipulation, DM)的新框架,通过直接修改梯度导数来实现灵活且鲁棒的示例加权,适用于标签噪声和数据不平衡场景下的深度学习。通过从归一化的导数幅值中定义强调密度函数(Emphasis Density Function),DM 统一并替代了传统的损失函数与加权函数,在视觉与自然语言处理任务中均实现了最先进性能,且复杂度极低。

ABSTRACT

Real-world large-scale datasets usually contain noisy labels and are imbalanced. Therefore, we propose derivative manipulation (DM), a novel and general example weighting approach for training robust deep models under these adverse conditions. DM has two main merits. First, loss function and example weighting are common techniques in the literature. DM reveals their connection (a loss function does example weighting) and is a replacement of both. Second, despite that a loss defines an example weighting scheme by its derivative, in the loss design, we need to consider whether it is differentiable. Instead, DM is more flexible by directly modifying the derivative so that a loss can be a non-elementary format too. Technically, DM defines an emphasis density function by a derivative magnitude function. DM is generic in that diverse weighting schemes can be derived. Extensive experiments on both vision and language tasks prove DM's effectiveness.

研究动机与目标

  • 解决现有损失函数与示例加权方法在大规模深度学习中处理标签噪声与数据不平衡时的局限性。
  • 通过揭示损失函数的导数隐含执行示例加权的机制,重新定义损失函数的角色。
  • 开发一种统一且灵活的框架,通过直接操控梯度导数来绕过损失函数的设计过程。
  • 通过归一化的导数幅值函数,实现对示例加权中强调模式与方差的直接控制。
  • 在无需复杂噪声估计的前提下,证明 DM 在多样化任务、模型架构与优化器上的有效性。

提出的方法

  • 通过归一化梯度(相对于logits的导数)的幅值,定义强调密度函数(EDF),直接编码示例级别的加权信息。
  • 对导数幅值进行非线性变换,以控制强调的方差,从而实现对简单、困难或半困难样本的关注。
  • 通过直接设计导数,替代传统的损失函数与独立的加权方案,避免了对可微性推导的依赖。
  • 应用梯度归一化(DN),确保所有示例的总强调量之和为1,维持训练稳定性。
  • 利用现有的概率密度函数(PDF)作为模板,设计具备期望强调特性的EDF。
  • 通过将损失梯度替换为经操控的导数,将DM无缝集成至标准训练流程中,实现即插即用。

实验结果

研究问题

  • RQ1梯度导数能否作为统一机制,同时替代深度学习中的损失函数与示例加权方案?
  • RQ2与传统损失函数设计相比,直接操控导数幅值在提升对标签噪声与类别不平衡的鲁棒性方面有何优势?
  • RQ3DM在无需任务特定超参数调优的情况下,能否在不同任务、架构与优化器上实现良好泛化?
  • RQ4在真实世界标签噪声场景下,DM能否超越依赖复杂噪声估计或多目标优化的最先进方法?
  • RQ5EDF中的强调模式与方差在不同学习场景下如何影响模型性能?

主要发现

  • 在包含真实世界无偏标签噪声的Clothing1M数据集上,DM取得73.3%的准确率,优于最先进方法,包括联合优化(72.2%)与S-adaptation(70.3%)。
  • 在MARS数据集的视频检索任务中,DM取得84.3%的CMC-1与72.8%的mAP,尽管未使用时间建模,仍优于OSM+CAA(84.7% CMC-1,72.4% mAP)。
  • 在IMDB情感分类任务中,DM结合PV-DBOW与单个8神经元隐藏层,性能优于标准损失函数如CCE与MAE。
  • DM在不同优化器(SGD与Adam)与不同架构(ResNet-56、GoogLeNet V2)中均保持一致的优越性,展现出广泛的兼容性。
  • DM无需像Forward、Masking与联合优化等方法那样进行复杂的噪声转移矩阵估计,提供了一种更简洁但更有效的替代方案。
  • 消融实验表明,DM在不同强调模式与方差下性能稳定,即使在未使用归一化(DN)的情况下,准确率也无显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。