[论文解读] Sparse Feature Selection Makes Batch Reinforcement Learning More Sample Efficient
本文在批量强化学习中通过Lasso和组Lasso提出稀疏特征选择,以提升样本效率。通过聚焦于相关特征,其有限样本误差界与相关特征数量呈线性关系,而非完整环境维度,显著降低了高维设置下的样本复杂度。
This paper provides a statistical analysis of high-dimensional batch Reinforcement Learning (RL) using sparse linear function approximation. When there is a large number of candidate features, our result sheds light on the fact that sparsity-aware methods can make batch RL more sample efficient. We first consider the off-policy policy evaluation problem. To evaluate a new target policy, we analyze a Lasso fitted Q-evaluation method and establish a finite-sample error bound that has no polynomial dependence on the ambient dimension. To reduce the Lasso bias, we further propose a post model-selection estimator that applies fitted Q-evaluation to the features selected via group Lasso. Under an additional signal strength assumption, we derive a sharper instance-dependent error bound that depends on a divergence function measuring the distribution mismatch between the data distribution and occupancy measure of the target policy. Further, we study the Lasso fitted Q-iteration for batch policy optimization and establish a finite-sample error bound depending on the ratio between the number of relevant features and restricted minimal eigenvalue of the data's covariance. In the end, we complement the results with minimax lower bounds for batch-data policy evaluation/optimization that nearly match our upper bounds. The results suggest that having well-conditioned data is crucial for sparse batch policy learning.
研究动机与目标
- 解决批量强化学习中高维状态空间带来的挑战,标准方法在该场景下样本效率低下。
- 通过利用特征表示中的稀疏性,克服离策略策略评估(OPE)和批量策略优化中的维度灾难。
- 开发理论基础坚实的算法,通过从大量候选特征中仅选择相关特征,实现样本高效的强化学习。
- 建立依赖于分布失配和特征稀疏性的实例相关误差界,而非依赖于全维复杂度。
- 提供极小化最大下界,以验证在稀疏性假设下所提方法的统计最优性。
提出的方法
- 提出Lasso拟合Q-评估(Lasso-FQE),该方法对离策略评估中的值函数估计应用L1正则化线性回归,以促进特征选择的稀疏性。
- 引入一种后模型选择估计器,使用组Lasso在应用拟合Q-评估前选择特征,以减少Lasso偏差并提高估计精度。
- 定义一个散度函数,用于度量行为数据与目标策略的占据测度之间的分布失配,且该度量限制在所选特征子空间内。
- 分析用于批量策略优化的Lasso拟合Q-迭代,推导出依赖于相关特征数量与数据协方差矩阵受限最小特征值之比的误差界。
- 利用新颖的浓度不等式和鞅论证,推导出自适应特征选择下的估计误差的高概率界。
- 为稀疏批量RL建立极小化最大下界,其与上界几乎匹配,证实了所提方法在稀疏性和良好条件数据假设下的统计最优性。
实验结果
研究问题
- RQ1稀疏特征选择能否在高维批量强化学习中提升样本效率?
- RQ2正则化选择(Lasso与组Lasso)如何影响离策略策略评估中的估计偏差与误差?
- RQ3行为策略与目标策略之间的分布失配在多大程度上影响OPE误差?是否可通过特征选择缓解该影响?
- RQ4数据协方差矩阵的受限最小特征值在决定稀疏策略学习样本复杂度方面起什么作用?
- RQ5所提稀疏批量RL的上界是否统计上紧致?与基本的下界相比如何?
主要发现
- Lasso拟合Q-评估方法实现了有限样本误差界,其依赖于相关特征数量与受限最小特征值,且对环境维度d无多项式依赖。
- 使用组Lasso的后模型选择估计器可获得更紧致的、实例相关的误差界,该界依赖于一个度量所选特征空间内分布失配的散度函数。
- 在所选特征空间上的散度项显著小于在全空间上的值,表明稀疏特征选择可有效降低分布失配。
- 对于批量策略优化,策略误差的ℓ∞-范数与相关特征数量和数据协方差矩阵受限最小特征值之比呈线性关系。
- 极小化最大下界与上界几乎匹配,证实所提方法在稀疏性与良好条件数据假设下具有统计最优性。
- 结果表明,具有良好条件的数据——由有利的受限最小特征值表征——对于实现样本高效的稀疏批量策略学习至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。