Skip to main content
QUICK REVIEW

[论文解读] Feature Selection Using Reinforcement Learning

Rasoul Sali, Sodiq Adewole|arXiv (Cornell University)|Jan 23, 2021
Evolutionary Algorithms and Applications参考文献 12被引用 9
一句话总结

本文提出一种基于强化学习(RL)的特征选择方法,将问题建模为马尔可夫决策过程(MDP),其中智能体按顺序选择特征以最大化预测准确率。采用具有ε-greedy策略的时序差分学习算法,并使用鲁棒分类器进行奖励评估,该方法在澳大利亚数据集上实现了85.55%的高准确率,同时高效探索特征空间,优于传统的过滤法和包装法。

ABSTRACT

With the decreasing cost of data collection, the space of variables or features that can be used to characterize a particular predictor of interest continues to grow exponentially. Therefore, identifying the most characterizing features that minimizes the variance without jeopardizing the bias of our models is critical to successfully training a machine learning model. In addition, identifying such features is critical for interpretability, prediction accuracy and optimal computation cost. While statistical methods such as subset selection, shrinkage, dimensionality reduction have been applied in selecting the best set of features, some other approaches in literature have approached feature selection task as a search problem where each state in the search space is a possible feature subset. In this paper, we solved the feature selection problem using Reinforcement Learning. Formulating the state space as a Markov Decision Process (MDP), we used Temporal Difference (TD) algorithm to select the best subset of features. Each state was evaluated using a robust and low cost classifier algorithm which could handle any non-linearities in the dataset.

研究动机与目标

  • 为应对高维数据带来的日益严峻挑战,通过选择最优特征子集以最小化偏差和方差。
  • 克服传统特征选择方法的局限性,如基于过滤的评分方法(忽略特征依赖性)和包装方法(计算成本高)。
  • 将特征选择建模为使用RL的序列决策问题,实现对特征子集的高效探索与利用。
  • 通过基于强化学习的特征选择策略,提升模型可解释性、预测准确率和计算效率。
  • 在具有不同特征空间大小的数据集上,评估该方法相对于标准过滤法和包装法的性能。

提出的方法

  • 将特征选择问题建模为马尔可夫决策过程(MDP),其中每个状态代表一个已选特征子集。
  • 动作对应于将一个未选中的特征添加到当前子集,动作空间随着特征的添加而动态缩小。
  • 使用时序差分(TD)学习算法,基于相邻状态间分类准确率的差异来更新状态值,并采用鲁棒、低成本的分类器进行奖励估计。
  • 采用ε-greedy策略平衡探索与利用:在首次访问某一状态时执行随机动作,而在后续访问时根据累积结果奖励(AOR表)选择贪婪动作。
  • 智能体通过多个回合推进,按顺序添加特征,并在每一步更新AOR表,直到所有特征被包含或满足停止条件。
  • 该方法引入混合探索阶段,当到达新节点时切换为随机选择,以保持特征选择的多样性。

实验结果

研究问题

  • RQ1强化学习能否有效将特征选择建模为具有有意义状态空间和动作空间的序列决策过程?
  • RQ2所提出的基于RL的特征选择方法在准确率和效率方面与传统过滤法和包装法相比如何?
  • RQ3基于AOR的值更新与ε-greedy策略在多大程度上提升了特征子集选择中的探索效率与收敛性?
  • RQ4该基于RL的方法在具有不同特征数和样本数的数据集上具有多大可扩展性?
  • RQ5RL智能体能否在不进行穷举搜索的情况下,持续学习到能选择高性能特征子集的策略?

主要发现

  • 在澳大利亚数据集上,基于RL的方法实现了85.55% ± 0.039的分类准确率,优于标准的过滤法和包装法基线。
  • 在乳腺癌威斯康星(预后)数据集上,该方法达到了76.29% ± 0.007的准确率,表明其在中等规模特征空间中的优异性能。
  • 在包含60个特征的连接主义基准数据集上,该方法实现了73.69% ± 0.108的准确率,表明其可扩展至更大的特征集合。
  • 提高ε值导致状态访问频率上升,证实了通过ε-greedy策略实现了有效的探索控制。
  • 在澳大利亚数据集上,第50轮回合时状态值函数增至约3.5的峰值,表明随时间推移学习过程持续进展。
  • 与基于过滤的方法相比,RL智能体在特征排序准确性方面表现更优,如各数据集上的对比性能图所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。