[论文解读] Visualization of Diseases at Risk in the COVID-19 Literature
本文介绍了 VIDAR-19,一种自然语言处理系统,通过使用世界卫生组织(WHO)的 ICD-11 分类标准,自动从 CORD-19 语料库中提取疾病和风险因素。该系统采用基于关键词的提取流水线,结合 flashtext 技术,并通过交互式仪表板进行结果可视化,使研究人员能够以高精度探索疾病风险层级关系,并识别与严重 COVID-19 结局相关的共病情况。
This paper presents a project, named VIDAR-19, able to extract automatically diseases from the CORD-19 dataset, and also diseases which might be considered as risk factors. The project relies on the ICD-11 classification of diseases maintained by the WHO. This nomenclature is used as a data source of the extraction mechanism, and also as the repository for the results. Developed for the COVID-19, the project has the ability to extract diseases at risk and to calculate relevant indicators. The outcome of the project is presented in a dashboard which enables the user to explore graphically diseases at risk which are put back in the classification hierarchy. Beyond the COVID-19, VIDAR has much broader applications and might be directly used for any corpus dealing with other pathologies.
研究动机与目标
- 为解决在快速增长的 COVID-19 文献中,共病和风险因素报告零散且非结构化的问题。
- 开发一种自动化系统,利用标准化的医学分类从科学文本中提取疾病和风险因素。
- 创建一个交互式可视化仪表板,使用户能够直观探索 ICD-11 框架下的疾病风险层级关系。
- 提供一种可扩展、可复用的工具,适用于 COVID-19 以外的任何生物医学语料库中疾病风险的分析。
提出的方法
- 该系统以 ICD-11 分类作为参考本体论,将其加载并结构化为具有从根节点到每个疾病的明确路径表示的分层数据框。
- 采用 flashtext 库执行快速、多轮次的关键词匹配,以识别疾病名称,并通过预处理步骤处理复杂或模糊的名称(例如,移除逗号后的附加描述)。
- 提取流水线处理完整的 CORD-19 数据集,识别 ICD-11 编码疾病及潜在风险因素的提及,支持按数据源或额外标准进行过滤。
- 系统计算并聚合每个 ICD-11 层次结构层级上的关键指标,如出现频率和相对风险占比。
- 结果通过基于 Plotly Dash 的仪表板进行可视化,包含树状图、占比图和分层导航功能,所有可视化采用一致的颜色编码。
- 仪表板支持动态过滤、数据源选择,并可下钻至任意识别出的疾病或风险因素的原始文献来源。
实验结果
研究问题
- RQ1在科学文献中,哪些疾病被最频繁地报告为严重 COVID-19 结局的风险因素?
- RQ2从 CORD-19 语料库中自动提取 ICD-11 疾病与已知的高风险共病(如糖尿病、心脏病和肥胖症)的吻合程度如何?
- RQ3像 ICD-11 这样分层且标准化的分类系统,在多大程度上能提升生物医学文献中疾病风险可视化的可解释性和一致性?
- RQ4该系统的输出是否可用于识别尚未在临床指南中广泛认可的新兴或被低估的风险因素?
主要发现
- 系统成功从 CORD-19 语料库中提取出 15,286 个 ICD-11 编码疾病,预处理显著提升了对复杂疾病名称的匹配准确性。
- 排名靠前的高风险疾病(如慢性肺部疾病、糖尿病、心力衰竭和肥胖症)与美国疾病控制与预防中心(CDC)及纽约大学格罗斯曼医学院的临床研究结果高度一致,这些研究指出这些疾病与严重 COVID-19 结局相关。
- 仪表板支持对 ICD-11 全体层级的疾病风险进行交互式探索,具备一致的颜色编码和分层导航,提升可读性。
- 系统的输出可动态更新,并可通过公开的 GitHub 仓库访问,确保可重现性与长期可用性。
- 本项目表明,从大规模生物医学语料库中进行自动化、基于本体论的提取,可生成具有实际应用价值、视觉直观的疾病风险模式洞察。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。