Skip to main content
QUICK REVIEW

[论文解读] Fast Amortized Inference and Learning in Log-linear Models with Randomly Perturbed Nearest Neighbor Search

Stephen Mussmann, Daniel Lévy|arXiv (Cornell University)|Jul 11, 2017
Topic Modeling参考文献 22被引用 6
一句话总结

本文提出了一种基于Gumbel扰动和最大内积搜索(MIPS)的大规模离散对数线性模型的亚线性摊销推理与学习方法。通过仅使用MIPS从$O(\sqrt{n})$个候选中懒加载采样,并从尾部进行均匀采样,该方法在ImageNet和词嵌入任务上实现了与精确推理相比5–10倍的速度提升,且具有可证明的精度保证。

ABSTRACT

Inference in log-linear models scales linearly in the size of output space in the worst-case. This is often a bottleneck in natural language processing and computer vision tasks when the output space is feasibly enumerable but very large. We propose a method to perform inference in log-linear models with sublinear amortized cost. Our idea hinges on using Gumbel random variable perturbations and a pre-computed Maximum Inner Product Search data structure to access the most-likely elements in sublinear amortized time. Our method yields provable runtime and accuracy guarantees. Further, we present empirical experiments on ImageNet and Word Embeddings showing significant speedups for sampling, inference, and learning in log-linear models.

研究动机与目标

  • 解决在输出空间较大但可枚举的对数线性模型中推理与学习的高计算成本问题。
  • 将采样与梯度计算的摊销运行时间从线性降低到输出空间大小的亚线性级别。
  • 在显著加速自然语言处理与计算机视觉应用中的推理与学习的同时保持高精度。
  • 为大规模对数线性模型中的近似推理与学习提供可证明的运行时间与精度保证。

提出的方法

  • 利用Gumbel最大变换技巧,将从对数线性模型中采样转化为最大化扰动后的未归一化对数概率。
  • 引入Gumbel变量的懒惰实例化机制,仅对最可能的$O(\sqrt{n})$个状态计算其值,以减少计算量。
  • 使用最大内积搜索(MIPS)数据结构,基于参数与特征之间的点积高效检索$O(\sqrt{n})$个最优候选。
  • 通过结合top-$k$ MIPS结果与对尾部的均匀采样,估计归一化常数和期望 sufficient 统计量。
  • 将MIPS数据结构视为黑箱,支持与任何高效的MIPS实现兼容。
  • 为每个查询使用全新且独立的Gumbel样本,以避免先前固定噪声方法中存在的偏差与相关性问题。

实验结果

研究问题

  • RQ1是否可以将大规模离散对数线性模型中的推理与学习加速至超越线性时间复杂度?
  • RQ2是否可以在保持精度的同时实现亚线性摊销推理,并提供理论保证?
  • RQ3如何在不产生线性代价的前提下有效整合分布尾部信息于近似推理中?
  • RQ4能否结合Gumbel扰动与MIPS技术,实现可证明准确且高效的推理?

主要发现

  • 与精确推理相比,该方法在ImageNet上的梯度计算实现了9.6倍的速度提升,且对数似然值几乎完全一致。
  • 在ImageNet上,该方法实现了-3.175的对数似然值,接近精确方法的-3.170,同时优于top-$k$方法的-4.062。
  • 在ImageNet和词嵌入任务中,该方法在采样、推理和学习方面实现了5–10倍的每查询速度提升。
  • 使用$O(\sqrt{n})$个最优候选加上对尾部的均匀采样,可对归一化常数和期望值提供可证明准确的估计。
  • 通过为每个查询使用全新Gumbel样本,该方法避免了先前固定Gumbel方法中存在的偏差与相关性问题。
  • 该方法具有高度灵活性,可兼容任何高效的MIPS实现,且其性能提升可继承MIPS技术的最新进展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。