Skip to main content
QUICK REVIEW

[论文解读] Sparse Stochastic Zeroth-Order Optimization with an Application to Bandit Structured Prediction

Artem Sokolov, Julian Hitschler|arXiv (Cornell University)|Jun 12, 2018
Advanced Bandit Algorithms Research参考文献 38被引用 4
一句话总结

本文提出稀疏随机零阶(SZO)优化以缓解梯度自由学习中的维度瓶颈问题,利用结构化预测特征中的稀疏性。通过仅扰动活跃特征,该方法实现了接近随机一阶方法的收敛速率,实证结果表明在名词短语切分任务中表现接近SFO,在使用不可微MAP准则的机器翻译任务中表现更优。

ABSTRACT

Stochastic zeroth-order (SZO), or gradient-free, optimization allows to optimize arbitrary functions by relying only on function evaluations under parameter perturbations, however, the iteration complexity of SZO methods suffers a factor proportional to the dimensionality of the perturbed function. We show that in scenarios with natural sparsity patterns as in structured prediction applications, this factor can be reduced to the expected number of active features over input-output pairs. We give a general proof that applies sparse SZO optimization to Lipschitz-continuous, nonconvex, stochastic objectives, and present an experimental evaluation on linear bandit structured prediction tasks with sparse word-based feature representations that confirm our theoretical results.

研究动机与目标

  • 为解决随机零阶(SZO)优化的高迭代复杂度问题,其复杂度与完整参数维度成比例。
  • 表明在稀疏结构化预测设置中,迭代复杂度可降低至活跃特征的期望数量,而非完整维度。
  • 提出并评估使用稀疏扰动的SZO算法,以提升老虎机结构化预测中的效率。
  • 探究在训练和测试阶段均使用不可微损失准则(如MAP)的可行性,这在标准SFO方法中不可行。

提出的方法

  • 理论分析将先前的SZO工作扩展至非凸、Lipschitz连续、随机目标函数,采用稀疏参数扰动。
  • 提出三种SZO算法:两点函数评估、基线比较和函数比较,每种均旨在降低反馈复杂度。
  • 稀疏扰动仅应用于输入-输出对中的活跃特征,例如序列标注任务中的n-gram。
  • 该方法依赖高斯平滑以确保平滑目标函数的Lipschitz连续性,从而通过函数值比较实现梯度近似。
  • 超参数(学习率h和探索参数μ)在开发集上进行调优,结果对三个随机种子的平均值进行报告。
  • 在名词短语切分(F1分数)和统计机器翻译(BLEU分数)任务上评估该方法,分别采用密集和稀疏扰动。

实验结果

研究问题

  • RQ1能否通过利用结构化预测特征空间中的稀疏性,缓解SZO优化中的维度瓶颈?
  • RQ2在实践中,稀疏参数扰动是否能实现与随机一阶方法相当的收敛速率?
  • RQ3在SZO中能否在训练和测试阶段一致使用不可微损失函数(如MAP),从而实现对SFO方法的性能提升?
  • RQ4反馈复杂度(如单点与两点函数评估)如何影响SZO在结构化预测中的收敛速度和最终性能?

主要发现

  • SPARSE两点更新规则在名词短语切分任务上达到0.888的测试F1分数,接近SFO基线的0.908。
  • SPARSE基线比较更新规则在切分任务中取得最高的测试F1分数0.869,优于ALL-扰动基线比较的0.819。
  • 在机器翻译任务中,最佳SZO结果(使用稀疏扰动的两点更新)达到0.273的BLEU分数,优于SFO的0.263,提升0.01 BLEU点。
  • 采用稀疏扰动和两点反馈的SZO方法在10万次迭代时达到最优性能,显著快于SFO方法。
  • 在训练和测试阶段均使用不可微MAP准则的SZO方法,相比域外基线提升了1.6 BLEU点,展现出对SFO方法的独特优势。
  • 所有采用稀疏扰动的SZO方法均表现出比密集扰动更快的收敛速度,证实了有效维度的理论降低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。