[论文解读] Grounded Recurrent Neural Networks
本文提出了基于注意力机制的循环神经网络(GRNN),这是一种新颖的RNN架构,通过将每个标签显式地与隐藏状态中的专用维度关联,提升了多标签文本分类任务中的数据效率与可解释性。通过将标签锚定在特定的隐藏单元中,并对循环矩阵施加半对角约束,GRNN在数据量有限的医疗文本分类任务中实现了最先进性能,在MIMIC和StackOverflow数据集上均优于GRU和BiGRU等强基线模型。
In this work, we present the Grounded Recurrent Neural Network (GRNN), a recurrent neural network architecture for multi-label prediction which explicitly ties labels to specific dimensions of the recurrent hidden state (we call this process "grounding"). The approach is particularly well-suited for extracting large numbers of concepts from text. We apply the new model to address an important problem in healthcare of understanding what medical concepts are discussed in clinical text. Using a publicly available dataset derived from Intensive Care Units, we learn to label a patient's diagnoses and procedures from their discharge summary. Our evaluation shows a clear advantage to using our proposed architecture over a variety of strong baselines.
研究动机与目标
- 为解决医疗领域中标签数据有限的多标签文本分类挑战,特别是从临床记录中预测大规模ICD9编码的问题。
- 通过在序列处理过程中追踪单个概念信念演化的过程,提升医疗NLP模型的可解释性。
- 开发一种可扩展的RNN架构,在保持计算可行性的同时,通过在循环矩阵上施加结构约束,支持数千个标签的处理。
- 证明将标签锚定在隐藏状态中可带来比标准RNN更优的优化效果与性能表现,尤其在低资源场景下。
提出的方法
- GRNN架构为每个标签引入专用的隐藏状态维度,用于在序列处理过程中追踪模型对相应标签存在性的信念。
- 对循环转移矩阵施加半对角约束,其中左上角块为对角矩阵,确保模型规模随标签数量线性增长。
- 通过可微分门控机制更新每个标签的信念,整合来自输入词元的证据,使模型能够学习概念在何时何地被提及。
- 模型使用标准RNN单元(如GRU或LSTM)进行上下文表征,而标签特异性维度则基于注意力或门控机制独立更新。
- 通过可视化各时间步上标签特异性隐藏单元的演化过程,增强可解释性,揭示文本中具有临床意义的证据。
- 采用端到端训练方式,使用交叉熵损失进行多标签分类,并应用L2正则化防止过拟合。
实验结果
研究问题
- RQ1将标签锚定在专用隐藏状态维度中,是否能提升医疗文本多标签分类任务中的数据效率?
- RQ2对循环矩阵施加半对角约束,是否能在支持数千个标签的同时保持模型性能?
- RQ3GRNN是否能通过追踪每个标签的信念演化过程,实现比标准RNN更优的可解释性预测?
- RQ4在低资源设置下,GRNN相较于GRU、BiGRU及注意力机制模型的性能表现如何?
- RQ5该模型是否能有效学习概念之间的关联性,并在出院小结中检测到细微的临床线索?
主要发现
- 在MIMIC-II数据集上,GRNN的微F1为0.560,宏F1为0.179,优于BiGRU基线(0.554/0.189)和GRU(0.554/0.189)在两项指标上的表现。
- GRNN的微AUC(ROC)为0.989,宏AUC(ROC)为0.973,宏AUC优于BiGRU基线(0.991/0.976),微AUC与之持平。
- 在包含4000个标签的StackOverflow数据集上,GRNN的微F1为0.560,宏F1为0.179,微F1优于BiGRU基线(0.554/0.189),宏F1与之持平。
- 模型展现出更优的可解释性:锚定维度中的信念演化过程清晰突出了如“herniated disc”或“transfusions of ffp”等具有临床意义的短语,而注意力机制模型则表现出更分散的信号。
- 在训练数据减少的情况下,GRNN比标准RNN保持了更优的性能,表明其具备更高的数据效率。
- 半对角约束有效减少了过拟合,改善了优化过程,使模型在大规模标签集下仍能实现稳定训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。