Skip to main content
QUICK REVIEW

[论文解读] Learning to Maximize Mutual Information for Dynamic Feature Selection

Ian Covert, Wei Qiu|arXiv (Cornell University)|Jan 2, 2023
Machine Learning and Data Classification被引用 6
一句话总结

本文提出了一种可微分的、缓解放的动态特征选择(DFS)方法,通过基于目标变量的条件互信息(CMI)来学习贪婪地选择特征。通过将贪婪CMI策略建模为变分优化问题,并利用Concrete分布实现连续松弛,该方法能够在标准标注数据集上实现端到端训练,在多个基准测试中优于以往的静态与动态特征选择方法。

ABSTRACT

Feature selection helps reduce data acquisition costs in ML, but the standard approach is to train models with static feature subsets. Here, we consider the dynamic feature selection (DFS) problem where a model sequentially queries features based on the presently available information. DFS is often addressed with reinforcement learning, but we explore a simpler approach of greedily selecting features based on their conditional mutual information. This method is theoretically appealing but requires oracle access to the data distribution, so we develop a learning approach based on amortized optimization. The proposed method is shown to recover the greedy policy when trained to optimality, and it outperforms numerous existing feature selection methods in our experiments, thus validating it as a simple but powerful approach for this problem.

研究动机与目标

  • 解决动态特征选择(DFS)中的挑战,即基于已有信息按顺序获取特征,而非使用固定集合。
  • 克服在基于贪婪CMI的特征选择中,精确计算条件互信息(CMI)所需的对数据分布的“理想访问”不切实际的问题。
  • 开发一种实用且可学习的替代方案,以替代训练困难且性能通常不佳的强化学习基DFS方法。
  • 仅使用标准标注数据,实现特征选择策略的端到端训练,无需专家演示或复杂的生成建模。
  • 验证当模型训练收敛时,所学习的策略能够恢复理论上的最优贪婪CMI策略,确保理论上的合理性。

提出的方法

  • 该方法将贪婪CMI策略建模为变分优化问题,表明其等价于使用最优分类器最小化一步 ahead 预测损失。
  • 提出一种缓解放的优化框架,其中策略网络被训练以直接预测下一个要选择的特征,仅使用标准标注数据集。
  • 通过Concrete分布实现连续松弛,使对离散特征选择决策的可微分、基于梯度的优化成为可能。
  • 策略网络与预测器网络通过损失函数联合训练,其全局最小值恰好对应于贪婪CMI策略。
  • 通过修改掩码投影的组矩阵,该方法支持特征分组,适用于独热编码的分类特征。
  • 该方法与架构无关,可使用标准深度学习组件应用于表格数据、图像及其他数据模态。

实验结果

研究问题

  • RQ1可学习的策略在实践中能否恢复理论上最优的贪婪条件互信息(CMI)特征选择策略?
  • RQ2所提出的缓解放、可微分特征选择方法相较于现有静态与动态基线方法的性能如何?
  • RQ3在不同特征预算约束下,该方法在多种数据类型(包括表格数据和图像块)上是否具备泛化能力?
  • RQ4所学习的策略在动态设置中,对每个样本能否自适应地选择不同的特征?
  • RQ5该方法对特征分组和使用独热编码的分类特征是否具备鲁棒性?

主要发现

  • 在六个表格数据集和两个视觉数据集(MNIST、CIFAR-10)上,该方法优于大量近期的静态与动态特征选择方法,实现了最先进性能。
  • 在三个急诊医学诊断任务中,该方法在8个特征的预算下达到AUROC 0.975,显著优于SAGE(0.883)和DeepLift(0.869)等基线方法。
  • 该方法展现出强大的泛化能力,在8个特征预算下,糖尿病数据集的AUROC达到0.973,流体数据集达到0.975。
  • 特征选择频率热图显示,模型在不同样本中选择不同的特征,证实了其动态、上下文相关的特性。
  • 消融研究显示,若移除关键组件(如Concrete松弛或缓解放策略),性能显著下降,验证了设计选择的有效性。
  • 在CIFAR-10上的定性结果表明,该策略以结构化、自适应的方式学习选择信息量高的图像块,通常聚焦于基于预测信息含量的垂直条纹。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。