[论文解读] BADREX: In situ expansion and coreference of biomedical abbreviations using dynamic regular expressions
BADREX 提出了一种基于规则的系统,利用动态生成的正则表达式来识别并原位展开生物医学缩写,并解决其与定义之间的指代关系。该系统在 Medstract 语料库上实现了 98% 的精确率和 97% 的召回率,优于先前无需训练数据或模型微调的方法。
BADREX uses dynamically generated regular expressions to annotate term definition-term abbreviation pairs, and corefers unpaired acronyms and abbreviations back to their initial definition in the text. Against the Medstract corpus BADREX achieves precision and recall of 98% and 97%, and against a much larger corpus, 90% and 85%, respectively. BADREX yields improved performance over previous approaches, requires no training data and allows runtime customisation of its input parameters. BADREX is freely available from https://github.com/philgooch/BADREX-Biomedical-Abbreviation-Expander as a plugin for the General Architecture for Text Engineering (GATE) framework and is licensed under the GPLv3.
研究动机与目标
- 解决在科学文本中识别并展开上下文内生物医学缩写的问题。
- 将未配对的缩写或首字母缩略词与它们原始定义之间的指代关系进行消解。
- 开发一种无需标注训练数据且支持运行时参数自定义的系统。
- 在缩写展开与指代消解任务中,超越现有方法的精确率与召回率。
- 提供一个免费可用、可扩展的解决方案,并集成至 GATE NLP 框架中。
提出的方法
- 基于生物医学文本中术语-定义对的上下文特定模式,动态生成正则表达式。
- 将这些正则表达式模式应用于检测并直接在原文上下文中展开缩写(即原位展开)。
- 使用指代消解技术将未配对的缩写与文档中其最可能的定义项关联起来。
- 利用语言学和结构线索(如标点符号、空格和句法接近度)指导模式生成。
- 将系统实现为 GATE 插件,支持集成到现有的 NLP 工作流中。
- 支持运行时配置参数,如术语长度、大小写规则和标点符号规则。
实验结果
研究问题
- RQ1动态正则表达式是否能有效识别并展开生物医学缩写,而无需依赖训练数据?
- RQ2指代消解技术在生物医学文本中将未配对的缩写与原始定义关联的准确度如何?
- RQ3该系统在标准基准语料库上相较于先前方法,在精确率与召回率方面提升程度如何?
- RQ4系统是否支持在运行时针对不同文本类型或特定领域缩写模式进行自定义?
- RQ5该方法在大规模真实世界生物医学语料库上的可扩展性与有效性如何,而不仅限于人工标注的数据集?
主要发现
- BADREX 在 Medstract 语料库上实现了 98% 的精确率和 97% 的召回率,表明其在缩写展开与指代消解方面具有高准确性。
- 在更大、更复杂的语料库上,系统仍保持强劲表现,精确率为 90%,召回率为 85%。
- 该方法在精确率与召回率上均优于先前方法,表明其具备更优的检测与消解能力。
- 系统无需任何训练数据,因此可直接应用于新领域而无需重新训练。
- 运行时可配置性使其能够适应不同文本风格、缩写格式和特定领域模式。
- 该系统作为 GATE 插件免费提供,采用 GPLv3 许可证,支持广泛采用与集成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。