[论文解读] SINA-BERT: A pre-trained Language Model for Analysis of Medical Texts in Persian
Sina-BERT 是一个基于 BERT 的语言模型,在 280 万份正式与非正式波斯语医学文本上进行预训练,以提升波斯语医学 NLP 任务的性能。在医学问题分类、情感分析和问题检索的标注数据集上微调后,其性能优于现有的波斯语模型,尤其在无监督检索任务中表现突出,在改写查询上的 R@1 达到 68.87%。
We have released Sina-BERT, a language model pre-trained on BERT (Devlin et al., 2018) to address the lack of a high-quality Persian language model in the medical domain. SINA-BERT utilizes pre-training on a large-scale corpus of medical contents including formal and informal texts collected from a variety of online resources in order to improve the performance on health-care related tasks. We employ SINA-BERT to complete following representative tasks: categorization of medical questions, medical sentiment analysis, and medical question retrieval. For each task, we have developed Persian annotated data sets for training and evaluation and learnt a representation for the data of each task especially complex and long medical questions. With the same architecture being used across tasks, SINA-BERT outperforms BERT-based models that were previously made available in the Persian language.
研究动机与目标
- 解决波斯语生物医学领域缺乏高质量预训练语言模型的问题。
- 构建大规模且多样化的正式与非正式波斯语医学文本语料库,用于预训练。
- 提升下游医学 NLP 任务(如问题分类、情感分析和问题检索)在波斯语中的性能。
- 提供标注数据集和公开可用的模型,以支持未来波斯语医学文本挖掘研究。
- 证明领域特定的预训练能显著提升对复杂且长篇医学问题的理解能力。
提出的方法
- 使用来自 ParsBERT(一个通用领域的波斯语 BERT 模型)的预训练权重初始化 Sina-BERT。
- 在从网站、期刊、论坛和新闻来源收集的 280 万份波斯语医学文本语料上对 Sina-BERT 进行预训练。
- 在三个下游任务上微调 Sina-BERT:医学问题分类、情感分析和问题检索,使用特定任务的标注数据集。
- 采用对比学习方法,并结合关键词感知重排序(Sina-BERT_kw_rcnt),以提升问题检索性能。
- 基于 BERT 的句子嵌入计算医学问题之间的语义相似度,用于检索任务。
- 将 Sina-BERT 与基线模型(包括 TF-IDF、UKP-DistilBERT 和 UKP-XLMR-paraph)进行比较,使用句子嵌入的余弦相似度作为评估指标。
实验结果
研究问题
- RQ1在大规模波斯语医学语料上预训练的基于 BERT 的语言模型,是否能在下游医学 NLP 任务中优于通用领域模型?
- RQ2在正式与非正式波斯语医学文本上进行领域特定预训练,如何影响对复杂且长篇医学问题的表征能力?
- RQ3Sina-BERT 在医学问题检索任务中,尤其是无监督设置下,相较于现有波斯语语言模型的优越程度如何?
- RQ4医学文本中丰富的关键词特征在多大程度上影响 TF-IDF 与上下文嵌入模型等检索模型的性能?
- RQ5Sina-BERT 是否能在极少任务特定微调的情况下,泛化到多样化医学 NLP 任务(如情感分析和问题分类)?
主要发现
- 在改写问题检索数据集上,Sina-BERT 的 R@1 达到 68.87%,显著优于 TF-IDF(50.00%)和 UKP-DistilBERT(36.36%)。
- 在问题分类任务中,Sina-BERT 的 F1 分数高于以往的波斯语 BERT 模型,表明其在结构化医学文本理解方面性能更优。
- 在医学情感分析任务中,Sina-BERT 在标注的波斯语数据集上表现出更优性能,表明其能更好地捕捉临床文本中的细微情感表达。
- 在问题检索任务中,Sina-BERT_kw_rcnt 表现优于所有基线模型,尤其在高噪声水平下,证明其在真实场景中的鲁棒性。
- 该模型在无监督检索中的性能差距最为显著,凸显了领域特定预训练在语义理解方面的价值。
- 人工评估确认,即使关键词重叠较低,Sina-BERT 仍能检索到语义相似的问题,表明其相比基于关键词的模型具有更优的上下文理解能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。