[论文解读] Student-Teacher Curriculum Learning via Reinforcement Learning: Predicting Hospital Inpatient Admission Location
本文提出了一种学生-教师强化学习框架,通过利用学生网络内部的权重表示作为状态信号,动态生成医院住院患者入院预测的数据课程。教师网络根据熵排序选择数据批次以优化学生表现,在表格型医疗数据上取得了最先进结果,展示了有效且自适应的课程,显著优于标准方法。
Accurate and reliable prediction of hospital admission location is important due to resource-constraints and space availability in a clinical setting, particularly when dealing with patients who come from the emergency department. In this work we propose a student-teacher network via reinforcement learning to deal with this specific problem. A representation of the weights of the student network is treated as the state and is fed as an input to the teacher network. The teacher network's action is to select the most appropriate batch of data to train the student network on from a training set sorted according to entropy. By validating on three datasets, not only do we show that our approach outperforms state-of-the-art methods on tabular data and performs competitively on image recognition, but also that novel curricula are learned by the teacher network. We demonstrate experimentally that the teacher network can actively learn about the student network and guide it to achieve better performance than if trained alone.
研究动机与目标
- 通过数据驱动的自适应课程方法,提升医院住院患者入院位置预测的准确性。
- 通过早期患者分诊预测实现主动床位分配,缓解资源限制和急诊科拥挤问题。
- 开发一个教师网络,利用对学生内部状态的实时反馈来指导学生网络。
- 探究强化学习是否能够生成超越固定或启发式调度策略的有效、任务特定课程。
- 探索所学教学策略在不同医疗预测任务间的可迁移性与稳定性。
提出的方法
- 学生网络使用按熵排序的数据批次进行训练,优先呈现‘更简单’的批次(熵较低),以改善优化景观。
- 教师网络将学生当前的权重表示作为状态输入,使其能够观察并适应学生的学习进度。
- 通过强化学习训练一个深度Q网络(DQN)策略,以选择能最大化未来学生表现的数据批次。
- 教师的动作空间由预排序的数据批次列表构成,奖励由学生验证准确率的提升来设计。
- 该方法使用学生权重的表示(而非仅梯度或损失)作为状态信号,使教师能够学习学生内部状态中的复杂非线性关系。
- 通过将一个在某一数据集(如Ward Admission)上训练的教师应用于另一数据集(如MIMIC-III)而不进行微调,评估策略迁移性。
实验结果
研究问题
- RQ1通过强化学习训练的教师网络是否能生成比固定或启发式调度更有效的数据课程用于住院患者入院预测?
- RQ2使用学生权重表示作为状态输入是否能使教师学习到稳定且可迁移的教学策略?
- RQ3学生-教师系统在表格型医疗数据和图像识别任务上的表现与最先进方法相比如何?
- RQ4教师网络是否能通过动态调整课程设计,避免陷入局部极小值,表现为训练过程中的性能‘跃升’?
- RQ5在未进行微调的情况下,一个在某一医疗预测任务上训练的教师网络在另一任务上可成功迁移的程度如何?
主要发现
- 所提出的师生强化学习框架在Ward Admission表格数据集上达到了最先进性能,超越所有基线和SOTA方法。
- 在MIMIC-III数据集上,迁移后的教师策略达到了67% ± 1%的准确率,与SOTA方法具有竞争力,并优于标准基线。
- 教师网络学会了采用‘熵波动’策略,即临时选择高熵批次以逃离局部极小值,导致性能出现特征性的波浪式提升。
- 通过向学生权重表示中注入高斯噪声验证了策略稳定性;教师行为保持一致,表明其具有鲁棒的、依赖状态的行为特征。
- 该方法在不同医疗预测任务间展示了教学策略的可迁移性,表明可泛化的教学策略是可学习的。
- 使用权重表示作为状态输入使教师能够学习到复杂且自适应的课程,这是静态或基于性能的启发式方法无法实现的。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。