[论文解读] HAMLET: Interpretable Human And Machine co-LEarning Technique
HAMLET 是一种人机协同学习框架,通过迭代式地利用专家反馈和可解释的参考嵌入来优化标签,从而在噪声大、难以标注的医学数据上提升深度学习性能。该框架结合神经嵌入、参考模式的记忆模块以及可解释的反馈机制,在连续脑电图(EEG)数据上将分类准确率从 7.03% 提升至 68.75%,显著提升了模型性能与临床可解释性。
Efficient label acquisition processes are key to obtaining robust classifiers. However, data labeling is often challenging and subject to high levels of label noise. This can arise even when classification targets are well defined, if instances to be labeled are more difficult than the prototypes used to define the class, leading to disagreements among the expert community. Here, we enable efficient training of deep neural networks. From low-confidence labels, we iteratively improve their quality by simultaneous learning of machines and experts. We call it Human And Machine co-LEarning Technique (HAMLET). Throughout the process, experts become more consistent, while the algorithm provides them with explainable feedback for confirmation. HAMLET uses a neural embedding function and a memory module filled with diverse reference embeddings from different classes. Its output includes classification labels and highly relevant reference embeddings as explanation. We took the study of brain monitoring at intensive care unit (ICU) as an application of HAMLET on continuous electroencephalography (cEEG) data. Although cEEG monitoring yields large volumes of data, labeling costs and difficulty make it hard to build a classifier. Additionally, while experts agree on the labels of clear-cut examples of cEEG patterns, labeling many real-world cEEG data can be extremely challenging. Thus, a large minority of sequences might be mislabeled. HAMLET has shown significant performance gain against deep learning and other baselines, increasing accuracy from 7.03% to 68.75% on challenging inputs. Besides improved performance, clinical experts confirmed the interpretability of those reference embeddings in helping explaining the classification results by HAMLET.
研究动机与目标
- 解决医学人工智能中高质量标签获取的挑战,尤其是在连续脑电图等复杂、模糊数据上,专家标注成本高且不一致。
- 通过人类专家与机器模型的协作,实现标签的迭代优化,克服标准深度学习在低数据、高噪声场景下的局限性。
- 通过提供参考嵌入以解释分类决策,增强模型的可解释性,支持专家重新评估并提升标签一致性。
- 开发一种可扩展、高效的标注框架,在显著提升真实临床数据上模型性能的同时,减少需要专家审阅的样本数量。
提出的方法
- 使用带有记忆模块的深度神经网络,存储来自不同类别的多样化参考嵌入,以支持基于相似度的分类。
- 应用神经嵌入函数,将输入序列映射到共享嵌入空间,使语义相似性反映类别相似性。
- 实施协同学习循环:模型识别低置信度预测,并建议交由专家重新评估,采用熵、边缘采样或置信度阈值作为反馈策略。
- 通过检索并展示与当前样本相似度最高的参考嵌入(即相似度得分最高的嵌入),为专家提供可解释的说明,用于重新评估。
- 使用改进后的标签对模型进行微调,迭代提升模型准确率与专家标注的一致性。
- 在全连接层中使用类似注意力的权重,衡量每个参考嵌入对最终预测的贡献程度,从而实现每类的可解释性评分。
实验结果
研究问题
- RQ1人机协同学习框架能否在降低标注成本的同时,提升难以标注的医学数据上的模型准确率?
- RQ2通过参考嵌入生成的模型解释能否提升专家的一致性并提高重新评估效率?
- RQ3对低置信度预测进行迭代优化在真实世界脑电图数据上的分类性能提升程度如何?
- RQ4哪种机器反馈策略——高置信度、边缘采样或熵——最有效地识别出需要专家重新评估的样本?
- RQ5模型的可解释性能否被量化,并与分类性能建立关联,特别是在模糊或多样化的类别上?
主要发现
- HAMLET-CNN 在仅经过 837 个专家修订序列后,将未见的连续脑电图数据上的分类准确率从 7.03% 提升至 68.75%,展现出显著的性能提升。
- 通过注意力权重对模型可解释性进行了量化:LRDA 的前 16 个参考嵌入中 75% 属于同一类别,GRDA 中为 68.75%,表明学习到的注意力机制与正确分类高度一致。
- 基于熵的反馈策略在建议重新评估时获得了最高的专家一致性(93.75%),优于高置信度和边缘采样方法。
- 混淆矩阵显示,经过协同学习后,模型减少了将 LRDA 和 LPD 误判为癫痫发作的情况,尽管癫痫发作的识别率略有下降,但整体准确率得到提升。
- 可解释性评分与性能呈正相关:可解释性较低的类别(如癫痫发作,为 37.50%)也表现出最差的分类准确率,表明模型对相似度得分的依赖对可靠预测至关重要。
- HAMLET-CNN 模型在性能上优于无监督的 CAE 基线模型和标准的 MLP 模型,证实了该框架中联合学习与可解释性组件的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。