Skip to main content
QUICK REVIEW

[论文解读] Exploration vs. Exploitation in the Information Filtering Problem

Xiaoting Zhao, Peter I. Frazier|arXiv (Cornell University)|Jul 30, 2014
Advanced Bandit Algorithms Research参考文献 42被引用 3
一句话总结

该论文提出了一种贝叶斯顺序决策模型用于信息过滤,能够最优地平衡探索与利用,尤其在用户反馈有限的冷启动场景下。通过将问题分解为可处理的两臂赌博机子问题,该方法在不确定性较高时会转发更多相关项目以实现探索,且随着反馈积累,探索行为逐渐减少。

ABSTRACT

We consider information filtering, in which we face a stream of items too voluminous to process by hand (e.g., scientific articles, blog posts, emails), and must rely on a computer system to automatically filter out irrelevant items. Such systems face the exploration vs. exploitation tradeoff, in which it may be beneficial to present an item despite a low probability of relevance, just to learn about future items with similar content. We present a Bayesian sequential decision-making model of this problem, show how it may be solved to optimality using a decomposition to a collection of two-armed bandit problems, and show structural results for the optimal policy. We show that the resulting method is especially useful when facing the cold start problem, i.e., when filtering items for new users without a long history of past interactions. We then present an application of this information filtering method to a historical dataset from the arXiv.org repository of scientific articles.

研究动机与目标

  • 解决信息过滤中的冷启动问题,即新用户缺乏足够的历史交互数据以实现有效的相关性预测。
  • 将信息过滤中的探索与利用权衡建模为一个使用贝叶斯统计和动态规划的随机控制问题。
  • 开发一种高效且最优的策略,以平衡从不确定项目中学习(探索)与转发高置信度相关项目(利用)之间的关系。
  • 为信息过滤背后的部分可观察马尔可夫决策过程(POMDP)提供可扩展的解决方案,克服维度灾难问题。
  • 在来自 arXiv.org 的真实世界数据上展示该方法的有效性,证明其显著优于基准策略。

提出的方法

  • 将信息过滤问题建模为一个贝叶斯顺序决策模型,其项目相关性的信念状态由贝塔分布参数化。
  • 将高维 POMDP 分解为一组较小的、相互独立的两臂赌博机问题——一个已知臂(丢弃)和一个未知伯努利臂(转发),其状态转移基于反馈。
  • 使用动态规划最优求解每个两臂赌博机子问题,利用来自 Gittins 指数文献中的已知结果。
  • 推导出价值函数的上下界,随着规划时域增加而收敛,确保收敛至最优策略。
  • 通过依赖后验均值相关性和折扣因子 γx 的递归价值函数更新实现最优策略。
  • 将该方法应用于来自 arXiv.org 的真实世界数据集,其能根据已观测反馈项目的数量动态调整探索程度。

实验结果

研究问题

  • RQ1在缺乏历史数据的情况下,信息过滤系统如何最优地平衡探索(转发不确定项目以学习)与利用(转发高置信度相关项目)?
  • RQ2信息过滤的最优策略具有何种结构性特征,特别是随着反馈积累,探索强度如何变化?
  • RQ3尽管在完整 POMDP 建模中存在维度灾难,该最优策略能否被高效计算?
  • RQ4在冷启动环境下,与贪婪策略和 Thompson 采样相比,该方法在累积奖励(即转发的相关项目数量)方面表现如何?
  • RQ5当用户相关性最初未知时,探索对长期过滤性能有何影响?

主要发现

  • 最优策略转发了所有贪婪策略会转发的项目,且可能额外转发贪婪策略会丢弃的项目,尤其在反馈稀缺时。
  • 探索在已观测项目数量较少时最为激进,随着已观测反馈项目数量的增加而减弱,并在反馈无限增加的极限下完全消失。
  • 随着规划时域 M 趋近于无穷大,价值函数的上下界收敛至真实价值函数,上下界之间的差异以 γx^M / (1 - γx) 的几何速率衰减。
  • 该方法通过将问题分解为两臂赌博机问题实现最优性能,每个子问题均可通过已知的 Gittins 指数方法求解,从而实现高效计算。
  • 在 arXiv.org 上的实证结果表明,最优探索策略在累积相关性检测方面显著优于纯利用策略和 Thompson 采样。
  • 最优策略在冷启动场景下最愿意探索,并随着相关性估计置信度的提高而系统性地减少探索意愿,体现了对不确定性的原则性适应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。