[论文解读] Exemplar Auditing for Multi-Label Biomedical Text Classification
本文提出了一种名为原型审核(Exemplar Auditing)的方法,用于可解释的多标签生物医学文本分类,该方法将二值标记的卷积分解(BLADE)方法扩展至多标签场景。通过将推理时的预测结果与真实阳性、假阴性、假阳性及真阴性代表样本之间的归一化距离关联,实现对模型预测的可解释性分析,从而在保持MIMIC-III电子病历数据集上具有竞争力的分类性能的同时,提升临床可解释性。
Many practical applications of AI in medicine consist of semi-supervised discovery: The investigator aims to identify features of interest at a resolution more fine-grained than that of the available human labels. This is often the scenario faced in healthcare applications as coarse, high-level labels (e.g., billing codes) are often the only sources that are readily available. These challenges are compounded for modalities such as text, where the feature space is very high-dimensional, and often contains considerable amounts of noise. In this work, we generalize a recently proposed zero-shot sequence labeling method, "binary labeling via a convolutional decomposition", to the case where the available document-level human labels are themselves relatively high-dimensional. The approach yields classification with "introspection", relating the fine-grained features of an inference-time prediction to their nearest neighbors from the training set, under the model. The approach is effective, yet parsimonious, as demonstrated on a well-studied MIMIC-III multi-label classification task of electronic health record data, and is useful as a tool for organizing the analysis of neural model predictions and high-dimensional datasets. Our proposed approach yields both a competitively effective classification model and an interrogation mechanism to aid healthcare workers in understanding the salient features that drive the model's predictions.
研究动机与目标
- 为解决在缺乏细粒度标签的高维、噪声较大的生物医学文本数据中,对黑箱神经网络模型进行解释的挑战。
- 将二值零样本序列标注方法BLADE扩展至电子病历的多标签分类任务。
- 开发一种人类可理解的机制,通过与代表性训练原型之间的相对距离来审核模型预测。
- 为临床医生和研究人员提供直观的、基于特征层面的模型决策洞察,利用局部特征与基于距离的归一化方法。
- 实现对发现模式的验证以及在高风险医疗数据集中对标签不一致性的检测。
提出的方法
- 通过将卷积分解应用于文档级预测,将其映射为标记级特征得分,将BLADE框架扩展至多标签分类。
- 使用鼓励稀疏性的损失函数,以促进对显著标记的局部化注意力,实现细粒度特征检测。
- 对训练好的卷积神经网络进行反向展开,提取每个标签类别的代表性向量,从最近的训练实例中形成原型。
- 计算测试样本特征到各类原型(真阳性、假阴性、假阳性、真阴性)最近原型的归一化距离。
- 将这些归一化距离的softmax分布用作每个标签预测的可靠性信号。
- 在统一的训练目标中结合局部(标记级)与全局(文档级)损失信号,以提升精确率与可解释性。
实验结果
研究问题
- RQ1卷积分解能否在保持可解释性的前提下,有效从二值分类扩展至多标签生物医学文本分类?
- RQ2与代表性训练原型(TP、FN、FP、TN)之间的相对距离,如何在标签与实例层面提供对模型预测可靠性的信息?
- RQ3原型审核是否能提供比注意力机制或基于系数的方法更直观、更具临床可操作性的神经网络模型预测解释?
- RQ4所提出的方法是否在保持竞争性分类性能的同时,实现在高维、噪声较大的电子病历数据中的模型自省能力?
- RQ5该方法是否能通过预测的距离分析,检测出训练数据中的标签不一致或异常?
主要发现
- 所提出的原型审核方法在MIMIC-III多标签电子病历分类基准上实现了具有竞争力的分类性能。
- 与最近原型(TP、FN、FP、TN)之间的归一化距离,为在实例与标签层面评估预测可靠性提供了有用且直观的信号。
- 该方法通过将推理时的预测与特定的代表性训练样本关联,实现了模型自省,显著增强了临床医生对模型可解释性的理解。
- 原型审核在提供局部化、特征特定的解释方面优于基于注意力的方法,其解释更符合临床决策中的人类推理逻辑。
- 该方法能有效识别驱动预测的关键特征,并允许将模型行为与已知训练数据进行比对验证。
- 即使在缺乏显式细粒度标签的情况下,该方法依然有效,因此适用于细粒度标签稀缺的真实世界医疗NLP场景。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。