Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning for Multi-class Imbalanced Training

Jenny Yang, Rasheed El-Bouri|arXiv (Cornell University)|May 24, 2022
Imbalanced Data Classification Techniques被引用 6
一句话总结

本文提出了一种基于双值网络(dueling)与双深度Q网络(double DQN)架构的深度强化学习框架,并设计了自定义奖励函数,以解决临床数据集中多类别数据不平衡的问题。该方法在显著提升少数类检测性能的同时,保持了所有类别间性能的平衡,优于当前最先进(SOTA)的方法。

ABSTRACT

With the rapid growth of memory and computing power, datasets are becoming increasingly complex and imbalanced. This is especially severe in the context of clinical data, where there may be one rare event for many cases in the majority class. We introduce an imbalanced classification framework, based on reinforcement learning, for training extremely imbalanced data sets, and extend it for use in multi-class settings. We combine dueling and double deep Q-learning architectures, and formulate a custom reward function and episode-training procedure, specifically with the added capability of handling multi-class imbalanced training. Using real-world clinical case studies, we demonstrate that our proposed framework outperforms current state-of-the-art imbalanced learning methods, achieving more fair and balanced classification, while also significantly improving the prediction of minority classes.

研究动机与目标

  • 解决临床机器学习中多类别数据不平衡的挑战,其中少数疾病类别代表性不足。
  • 开发一种基于强化学习的训练框架,根据类别不平衡动态调整学习过程,以改善少数类预测性能。
  • 将先前针对单类别设计的强化学习方法扩展至多类别设置,并应用于真实临床数据。
  • 与当前最先进技术(包括SMOTE、代价敏感学习和集成模型)进行对比评估。
  • 展示在所有类别中,尤其是罕见临床诊断中,性能的公平性与平衡性得到提升。

提出的方法

  • 该框架采用双值网络与双深度Q网络(DQN)架构,以稳定学习过程并提升价值函数估计性能。
  • 设计了一种自定义密集奖励函数,以激励正确分类少数类别,奖励值与类别频率的倒数成正比。
  • 实施基于回合的训练流程,每个回合对应一个训练周期,智能体(模型)通过选择动作(学习更新)来最大化累积奖励。
  • 该方法集成了类别感知的探索机制与优先经验回放,以提升样本效率,并在不平衡数据上实现更快收敛。
  • 通过将每个类别视为智能体动作空间内的独立决策目标,该框架支持多类别分类。
  • 智能体能够基于类别分布的变化调整其策略,实现在不进行数据重采样或类别加权的情况下自适应学习。

实验结果

研究问题

  • RQ1与传统数据级或算法级方法相比,强化学习框架是否能有效提升多类别不平衡临床数据集上的分类性能?
  • RQ2当标准模型失效时,所提出的强化学习方法在检测罕见临床状况方面表现如何?
  • RQ3自定义奖励函数在不降低多数类性能的前提下,对少数类学习的增强程度如何?
  • RQ4该框架在包含数十个诊断代码的多类别问题中表现如何?类别异质性对性能有何影响?
  • RQ5与代价敏感学习或数据增强技术(如SMOTE)相比,基于强化学习的方法是否能在平衡性能指标(如G-mean、F-score)上表现更优?

主要发现

  • 所提出的强化学习框架在所有测试集上均取得了最高或第二高的G-mean分数,表明其在所有类别中均具备卓越的平衡性能。
  • 在二分类新冠(COVID-19)预测任务中,强化学习模型的平均敏感度达到0.703(95%置信区间:0.539–0.785),显著优于基线神经网络(0.236)与XGBoost(0.288)。
  • 在多类别诊断任务中,强化学习在个体及平均少数类F-score上均表现最强,展现出对多样化临床状况的鲁棒性。
  • 引入代价敏感权重虽提升了基线模型的敏感度,但以多数类准确率下降为代价;而强化学习方法在所有指标上均保持了高性能。
  • SMOTE增强在多数情况下仅带来微小改进,甚至在某些情况下(尤其是神经网络)导致性能下降,原因在于合成样本存在噪声或重叠。
  • 该模型在预测急性肾损伤事件方面表现最弱,可能是因为输入特征中缺乏关键诊断指标(如血液检测与尿液分析)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。