Skip to main content
QUICK REVIEW

[论文解读] Stochastic Structured Prediction under Bandit Feedback

Artem Sokolov, Julia Kreutzer|arXiv (Cornell University)|Jun 2, 2016
Advanced Bandit Algorithms Research参考文献 27被引用 12
一句话总结

该论文提出了一种在Bandit反馈设置下的随机结构化预测算法,其中仅能获得预测输出的部分损失反馈。论文引入并分析了三种目标函数:期望损失、交叉熵和成对偏好学习,结果表明由于梯度方差和Lipschitz常数更低,成对偏好学习在经验(开发集性能最优)和理论(最小化平方梯度范数)标准下均实现了最快的收敛速度。

ABSTRACT

Stochastic structured prediction under bandit feedback follows a learning protocol where on each of a sequence of iterations, the learner receives an input, predicts an output structure, and receives partial feedback in form of a task loss evaluation of the predicted structure. We present applications of this learning scenario to convex and non-convex objectives for structured prediction and analyze them as stochastic first-order methods. We present an experimental evaluation on problems of natural language processing over exponential output spaces, and compare convergence speed across different objectives under the practical criterion of optimal task performance on development data and the optimization-theoretic criterion of minimal squared gradient norm. Best results under both criteria are obtained for a non-convex objective for pairwise preference learning under bandit feedback.

研究动机与目标

  • 解决在仅能获得部分反馈(例如,单个预测输出的损失)而无法获得完整标准标签的交互式学习场景中的结构化预测问题。
  • 分析在结构化预测中,针对凸与非凸目标函数,基于Bandit反馈的随机一阶优化方法的收敛行为。
  • 在真实NLP应用中,比较基于开发数据早停的实践收敛性与基于平方梯度范数的理论收敛标准。
  • 在机器翻译和名词短语切分任务上,评估三种学习目标函数——期望损失、交叉熵和成对偏好学习的性能。
  • 探究为何尽管渐近复杂度界更差,非凸目标函数(如成对偏好学习)在实践中仍能优于强凸目标函数。

提出的方法

  • 该方法使用对数线性概率模型在探索阶段采样输出结构,随后基于采样结构的损失反馈,利用无偏梯度估计更新模型权重。
  • 采用随机一阶优化(SFO)方法最小化三种目标函数:期望损失(非凸)、交叉熵(强凸)和成对偏好学习(非凸)。
  • 梯度估计器采用类似策略梯度的更新方式,从相对反馈(例如,“A 比 B 好”)中估计梯度,而非完整标签。
  • 通过在线到批量转换进行评估,即从开发数据中选择性能最佳的模型用于最终测试评估。
  • 收敛性通过平方梯度范数 $\mathbb{E}[\|\nabla J(w_t)\|^2]$ 分析,并估计Lipschitz常数 $L$ 和梯度方差 $\sigma^2$ 以评估收敛速度。
  • 该算法在两个NLP任务上进行了应用:使用指数输出空间的神经机器翻译(SMT)和名词短语切分任务,采用恒定学习率和早停策略。

实验结果

研究问题

  • RQ1在实际NLP应用中,成对偏好学习在Bandit反馈下是否比期望损失和交叉熵最小化具有更快的收敛速度?
  • RQ2在随机结构化预测中,理论收敛标准(平方梯度范数)与实践收敛性(基于开发数据的早停)之间是否存在相关性?
  • RQ3为何尽管渐近复杂度界更差,非凸目标函数(成对偏好学习)在实践中仍能优于强凸目标函数(交叉熵)?
  • RQ4在Bandit反馈下,梯度方差和Lipschitz常数在不同目标函数的收敛速度中起什么作用?
  • RQ5仅需相对反馈的成对偏好学习在真实交互式学习场景中是否能与全信息方法具有相当的性能?

主要发现

  • 在机器翻译任务中,成对偏好学习(PR)在 $T = 767,000$ 次迭代时达到最小的平方梯度范数($1.03 \times 10^{-8}$),表明其理论收敛最快。
  • 在实践中,PR(bin)达到开发数据上最优BLEU分数所需的迭代次数仅为EL和CE的2至4倍,证实了其更快的实证收敛性。
  • PR的梯度方差 $\sigma^2$ 为 $1.78 \times 10^{-7}$,显著低于CE($35$)和EL($3.13 \times 10^{-4}$)几个数量级,解释了其优越的收敛性能。
  • PR的Lipschitz常数为 $0.10 \pm 5.7 \times 10^{-3}$,远小于CE($1.60 \pm 0.11$)和EL($1.63 \pm 0.67$),进一步支持其更快的收敛速度。
  • 在切分任务中,PR(cont)达到最小的平方梯度范数($5.99 \times 10^{-3}$),且在达到开发数据上最优F1分数前所需迭代次数少于CE和EL。
  • 尽管目标函数为非凸,PR在理论和实证收敛性上均优于强凸和非凸基线方法,归因于其较低的梯度方差和Lipschitz常数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。