[论文解读] Sample Efficient Feature Selection for Factored MDPs
本文提出 FS-EE,一种用于分解马尔可夫决策过程(Factored MDPs)的在线强化学习算法,可在学习过程中自动选择相关特征。通过根据是否未能到达目标状态,动态调整父特征的入度,该方法实现的样本复杂度仅与必要特征的入度相关——当必要特征的入度较低时,相比使用全部特征的方法,实现了指数级的性能提升。
In reinforcement learning, the state of the real world is often represented by feature vectors. However, not all of the features may be pertinent for solving the current task. We propose Feature Selection Explore and Exploit (FS-EE), an algorithm that automatically selects the necessary features while learning a Factored Markov Decision Process, and prove that under mild assumptions, its sample complexity scales with the in-degree of the dynamics of just the necessary features, rather than the in-degree of all features. This can result in a much better sample complexity when the in-degree of the necessary features is smaller than the in-degree of all features.
研究动机与目标
- 解决在分解马尔可夫决策过程中使用大规模冗余特征集时,强化学习面临高样本复杂度的挑战。
- 开发一种在线强化学习算法,能够自动识别并仅聚焦于最优策略学习所必需的特征。
- 实现样本复杂度仅与最小必要特征集的入度相关,而非整个特征集的入度。
- 在无需事先了解必要特征及其父结构的前提下,提供样本效率的理论保证。
提出的方法
- 使用基于失败的机制,在探索过程中逐步增加每个特征的候选父集入度。
- 利用无法到达目标状态作为信号,表明当前父集大小不足以准确建模动态。
- 维护一个动态扩展每个特征父集大小的动力学模型,依据学习表现进行调整。
- 对转移模型施加一个温和的假设,以检测父集大小是否不足,而无需穷举测试所有特征。
- 将特征选择整合到探索与利用的核心权衡中,避免事后或离策略的特征选择。
- 在先前的分解马尔可夫决策过程强化学习算法(如 LSE-RMax)基础上进行扩展,实现具有理论保证的在线特征选择。
实验结果
研究问题
- RQ1在线强化学习算法是否能够实现仅与必要特征入度相关的样本复杂度?
- RQ2是否可能在不事先了解必要特征及其父结构的前提下,在在线学习过程中完成特征选择?
- RQ3无法到达目标状态能否作为可靠信号,用于指导动力学模型中父集的扩展?
- RQ4当无需特征选择时,所提出方法是否能保持与当前最先进分解马尔可夫决策过程强化学习算法相当的性能?
- RQ5该算法是否能在识别出必要特征的正确入度后,停止父集扩展,从而避免不必要的探索?
主要发现
- FS-EE 实现的样本复杂度仅与必要特征的入度相关,而非整个特征集,实现了相对于先前分解马尔可夫决策过程强化学习算法的潜在指数级性能提升。
- 在一个包含冗余特征的模拟环境中,FS-EE 在前 2000 步内优于标准分解马尔可夫决策过程算法,归因于对无关特征的快速剔除和更快的收敛速度。
- 当在第 2000 步增加入度时,FS-EE 经历了短暂的性能下降,这与预期一致,因为此前被剔除的特征再次变得相关。
- 当入度达到 3 后,FS-EE 维持了与 LSE-RMax 和 MET-RMax 等基线算法相当的性能,证实了其鲁棒性与可扩展性。
- 在股票交易环境中——其中所有特征均为必要特征——FS-EE 实现了约 5500 的累积奖励,优于 MET-RMax,并接近 LSE-RMax 的性能表现。
- 该算法表明,即使在缺乏最优特征集或父结构先验知识的情况下,也能将特征选择集成到在线强化学习中,并提供理论保证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。