[论文解读] Costly Features Classification using Monte Carlo Tree Search
本文提出一种两阶段强化学习方法,结合优势演员-评论家(A2C)与蒙特卡洛树搜索(MCTS),用于昂贵特征分类,其中特征获取会带来显著成本。该方法通过学习自适应特征选择策略,在分类准确率与成本之间实现平衡,在平衡与非平衡数据集上均达到最先进性能,MCTS显著改进了A2C的次优策略,同时保持高效性。
We consider the problem of costly feature classification, where we sequentially select the subset of features to make a balance between the classification error and the feature cost. In this paper, we first cast the task into a MDP problem and use Advantage Actor Critic algorithm to solve it. In order to further improve the agent's performance and make the policy explainable, we employ the Monte Carlo Tree Search to update the policy iteratively. During the procedure, we also consider its performance on the unbalanced dataset and its sensitivity to the missing value. We evaluate our model on multiple datasets and find it outperforms other methods.
研究动机与目标
- 解决特征获取成本显著(如时间、能量或人力)的昂贵特征分类问题。
- 开发一种序列特征选择策略,以最优方式权衡分类误差与特征获取成本。
- 通过将A2C与MCTS结合以实现策略优化,提升模型稳定性和可解释性。
- 通过设计考虑少数类影响的奖励函数,处理数据集中的类别不平衡问题。
- 在真实世界分类任务中,优于现有方法(如DQN、Adapt-Gbrt和BudgetPrune)在准确率-成本权衡上的表现。
提出的方法
- 将昂贵特征分类问题建模为马尔可夫决策过程(MDP),以支持在特征获取过程中的序列决策。
- 使用优势演员-评论家(A2C)算法预训练策略网络,以在特征选择中平衡探索与利用。
- 引入自定义奖励函数,通过将多数类样本的奖励乘以因子δ来体现类别不平衡,δ值根据不平衡比ρ进行调优。
- 应用蒙特卡洛树搜索(MCTS)迭代优化A2C策略,利用神经网络的价值估计作为树扩展与选择的指导。
- 使用A2C的价值网络作为树节点选择的启发式方法,实现高效剪枝并加快MCTS搜索的收敛速度。
- 结合A2C预训练与MCTS,实现稳定、高性能且可解释的特征选择策略。

实验结果
研究问题
- RQ1深度强化学习方法是否能在真实场景中有效平衡分类准确率与特征获取成本?
- RQ2将MCTS与A2C结合后,相较于仅使用A2C学习的策略,能否显著提升昂贵特征选择中的策略性能?
- RQ3何种奖励函数设计可确保在昂贵特征获取背景下,对不平衡数据集具有鲁棒性能?
- RQ4所提方法在准确率与成本效率方面,相较于DQN、Adapt-Gbrt和BudgetPrune等现有方法表现如何?
- RQ5与基于Q-learning的基线方法相比,A2C+MCTS框架在不完整或不平衡数据上的性能保持程度如何?
主要发现
- 在平衡数据集上,A2C+MCTS在保持相近成本预算的同时,准确率高于DQN和Adapt-Gbrt,20%成本下Cir数据集的G-mean为0.85 (9.3),Rng数据集为0.88 (9.3)。
- 在非平衡数据集上,A2C+MCTS优于DQN和Adapt-Gbrt,在5%成本下Cir数据集的G-mean达到0.65 (6.1),而DQN和Adapt-Gbrt无法收敛或性能显著下降。
- 消融实验表明,MCTS显著提升了A2C策略性能,Cir数据集上G-mean从0.57 (8.5)提升至0.65 (6.1),Pid数据集上从0.63 (4.2)提升至0.79 (3.4)。
- 当MCTS搜索由A2C价值网络引导时,搜索时间快几个数量级,证明神经网络作为剪枝启发式方法的有效性。
- 当奖励缩放因子δ略小于不平衡比ρ时性能最优,表明适度增强少数类影响可提升G-mean。
- 该方法仅使用少量特征即可实现高准确率——与DNN和RF相当,但所用特征显著更少,展现出优异的成本效率。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。