Skip to main content
QUICK REVIEW

[论文解读] Learning to Search Better Than Your Teacher

Kai-Wei Chang, Akshay Krishnamurthy|arXiv (Cornell University)|Feb 8, 2015
Advanced Bandit Algorithms Research参考文献 19被引用 91
一句话总结

本文提出 LOLS(局部最优学习搜索),一种新型的端到端学习搜索算法,不仅保证相对于潜在次优参考策略的低遗憾,还保证相对于所学策略的一步偏离的低遗憾。与以往仅匹配参考策略性能的方法不同,LOLS 确保局部最优性,从而在结构化预测和结构化上下文Bandit设置中显著优于次优基线。

ABSTRACT

Methods for learning to search for structured prediction typically imitate a reference policy, with existing theoretical guarantees demonstrating low regret compared to that reference. This is unsatisfactory in many applications where the reference policy is suboptimal and the goal of learning is to improve upon it. Can learning to search work even when the reference is poor? We provide a new learning to search algorithm, LOLS, which does well relative to the reference policy, but additionally guarantees low regret compared to deviations from the learned policy: a local-optimality guarantee. Consequently, LOLS can improve upon the reference policy, unlike previous algorithms. This enables us to develop structured contextual bandits, a partial information structured prediction setting with many potential applications.

研究动机与目标

  • 解决现有学习搜索方法仅保证相对于参考策略性能的局限性,而该参考策略可能次优。
  • 开发一种学习搜索算法,即使参考策略较差,也能确保局部最优性。
  • 在全监督不可用、目标是改进现有(可能次优)规则系统的情况下,实现有效学习,适用于结构化上下文Bandit设置。
  • 提供理论保证,平衡相对于参考策略的遗憾与相对于一步策略偏离的遗憾。
  • 在局部策略空间爬升有效但参考策略远非最优的设置中,展示LOLS相对于先前算法的优越性。

提出的方法

  • 提出LOLS,一种在线学习搜索算法,通过保持相对于参考策略的遗憾与相对于自身一步偏离的遗憾的凸组合来实现。
  • 采用通用算法框架,泛化了Searn、DAgger和AggreVaTe等先前方法,支持与现有基于搜索的结构化预测框架兼容。
  • 在小批量中引入代价敏感分类以更新策略,确保收敛到局部最优策略。
  • 提出一种遗憾分解方法,将相对于参考策略的性能与相对于局部策略改进的性能分离。
  • 通过超立方体图的组合分析,界定达到局部最优所需策略更新次数的上界,利用“蛇形盒问题”(snake-in-the-box problem)的理论结果。
  • 通过修改学习规则以处理部分反馈,将LOLS扩展至结构化上下文Bandit设置,同时保持相同的遗憾保证。

实验结果

研究问题

  • RQ1学习搜索方法能否超越次优参考策略,而不仅仅是匹配其性能?
  • RQ2当参考策略非最优时,可提供何种理论保证,特别是关于局部最优性的保证?
  • RQ3当参考策略较差但局部改进可行时,LOLS 相较于先前学习搜索算法的性能如何?
  • RQ4LOLS 能否有效适应结构化上下文Bandit设置,其中反馈是部分的,目标是改进现有系统?
  • RQ5LOLS 达到局部最优策略所需的最坏情况策略更新次数是多少?其在搜索空间规模增大时的扩展性如何?

主要发现

  • LOLS 实现了结合相对于参考策略的遗憾与相对于一步策略偏离的遗憾的遗憾上界,即使参考策略较差,也能确保局部最优性。
  • 理论分析表明,当参考策略次优但局部爬升有效时,LOLS 优于先前算法。
  • 在结构化上下文Bandit设置中,LOLS 提供自然扩展并具备相应的遗憾保证,支持从部分反馈中学习。
  • 实验结果证实,LOLS 在真实世界数据集上显著优于参考策略,展现出实际优越性。
  • LOLS 达到局部最优所需最坏情况下的策略更新次数由超立方体中最长路径(即“蛇形盒”)的长度界定,其规模为 Θ(2^T),表明在高维策略空间中存在可扩展性限制。
  • 由于代价函数结构,即使在处理小批量时,算法仍被迫遵循一步偏离,确保收敛至局部最优,而不会偏离该路径。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。