Skip to main content
QUICK REVIEW

[论文解读] TAPAS: Two-pass Approximate Adaptive Sampling for Softmax

Yu Bai, Sally A. Goldman|arXiv (Cornell University)|Jul 10, 2017
Machine Learning and Algorithms参考文献 15被引用 5
一句话总结

TAPAS 提出了一种用于高效训练大规模词表 Softmax 模型的两阶段近似自适应采样方法。它首先从预设分布中采样,然后基于上下文和模型参数自适应地重新采样难负样本,显著降低了排名损失,同时计算开销极低。该方法在合成数据集和真实世界数据集上的实验表明,MAP 最高提升了 30%。

ABSTRACT

TAPAS is a novel adaptive sampling method for the softmax model. It uses a two pass sampling strategy where the examples used to approximate the gradient of the partition function are first sampled according to a squashed population distribution and then resampled adaptively using the context and current model. We describe an efficient distributed implementation of TAPAS. We show, on both synthetic data and a large real dataset, that TAPAS has low computational overhead and works well for minimizing the rank loss for multi-class classification problems with a very large label space.

研究动机与目标

  • 为解决大规模词表 Softmax 模型中计算归一化常数项(partition function)的高计算成本问题。
  • 在标签空间极大的多分类任务中,提升训练效率和排序性能。
  • 开发一种基于上下文和模型状态自适应选择难负样本的采样策略。
  • 在保持或提升模型准确率的同时,最小化计算开销,尤其针对 MAP 等基于排序的指标。

提出的方法

  • TAPAS 采用两阶段采样策略:第一阶段从预定义分布(如齐次分布或幂律分布)中采样,第二阶段基于预测的 logits 自适应地重新采样一个更小的子集。
  • 自适应重采样聚焦于在给定上下文中预测概率较高的标签,突出难负样本。
  • 该方法利用 GPU 加速和分布式训练平台,最大限度降低计算开销。
  • 它与现有的采样 Softmax 和重要性采样框架兼容,并通过引入自适应采样加以增强。
  • 该算法在 TensorFlow 中实现,专为集成到大规模深度学习流水线而设计。
  • 采样过程仅使用自适应子集来近似归一化常数项的梯度,从而减少计算量。

实验结果

研究问题

  • RQ1两阶段采样策略是否能在计算开销极低的前提下,提升大规模词表 Softmax 模型的排序性能?
  • RQ2基于上下文和模型参数的自适应重采样,相较于固定或均匀采样,对排名损失的影响如何?
  • RQ3TAPAS 在保持或提升模型准确率的同时,能在多大程度上减少训练开销?
  • RQ4与完整 Softmax 损失相比,TAPAS 是否能更好地优化基于排序的指标(如 MAP)?

主要发现

  • 在具有重叠聚类的合成数据集上,TAPAS 随着重采样大小 r 的增加,准确率提升;当 n=128, r=4 时,其准确率与 n=512, r=1 相当,但速度提升 4 倍。
  • 在包含 50 万个项目的实际视频推荐数据集上,TAPAS 在 n=1000, r=8 时达到 MAP@20 为 0.068,相比 n=1000, r=1 的 0.050 提升了 30%。
  • 即使预采样大小更小,TAPAS(n=1000, r=8)也优于更大的基线模型(n=8000, r=1),实现了更高的 MAP(0.068 vs. 0.067)和更快的速度。
  • 尽管采用自适应采样,当 r 从 1 增加到 8 时,计算开销仅增加 10%,表明其计算成本极低。
  • 尽管 MAP 显著提升,全 Softmax 损失略有上升(从 9.10 上升到 9.34),表明 TAPAS 优化的是排名损失,而非交叉熵损失。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。