[论文解读] Context Variance Evaluation of Pretrained Language Models for Prompt-based Biomedical Knowledge Probing
本论文提出上下文方差提示(context variance prompting)与一种基于排名变化的新度量指标——理解-混淆-误解(Understand-Confuse-Misunderstand, UCM),以提升预训练语言模型(PLMs)在生物医学知识探针任务中评估的可靠性与公平性。通过从MIMIC-III、PMC以及一个全新的LMC-EHRs数据集中注入多样化的真实生物医学上下文,该方法减少了基于提示的评估中的偏差,更好地捕捉了模型对罕见关系及大规模N对M关系的理解,12种PLM均展现出更高的稳定性与可检测到的深层理解,而不仅仅是简单的复制行为。
Pretrained language models (PLMs) have motivated research on what kinds of knowledge these models learn. Fill-in-the-blanks problem (e.g., cloze tests) is a natural approach for gauging such knowledge. BioLAMA generates prompts for biomedical factual knowledge triples and uses the Top-k accuracy metric to evaluate different PLMs' knowledge. However, existing research has shown that such prompt-based knowledge probing methods can only probe a lower bound of knowledge. Many factors like prompt-based probing biases make the LAMA benchmark unreliable and unstable. This problem is more prominent in BioLAMA. The severe long-tailed distribution in vocabulary and large-N-M relation make the performance gap between LAMA and BioLAMA remain notable. To address these, we introduced context variance into the prompt generation and proposed a new rank-change-based evaluation metric. Different from the previous known-unknown evaluation criteria, we proposed the concept of "Misunderstand" in LAMA for the first time. Through experiments on 12 PLMs, we showed that our context variance prompts and Understand-Confuse-Misunderstand (UCM) metric make BioLAMA more friendly to large-N-M relations and rare relations. We also conducted a set of control experiments to disentangle "understand" from just "read and copy".
研究动机与目标
- 解决现有基于提示的知识探针方法在生物医学领域中存在的不稳定性与偏差问题,特别是针对生物医学领域。
- 缓解BioLAMA中的三种主要偏差:提示偏好偏差(Prompt Preference Bias, PPB)、实例表述偏差(Instance Verbalization Bias, IVB)与样本差异偏差(Sample Disparity Bias, SDB)。
- 提升对罕见关系与大规模N对M关系评估的公平性,此类关系因长尾词汇分布与PLM预测中的高模糊性而面临挑战。
- 开发一种新评估度量,以区分真正的理解与仅基于上下文的复制行为,超越传统的Top-k准确率。
- 通过实证验证,PLM(尤其是生物医学专用模型)展现出真实的知识理解能力,而非简单的记忆或复制。
提出的方法
- 通过使用来自三个来源的真实生物医学文本生成合成提示,引入上下文方差:MIMIC-III(电子健康记录)、PMC(已发表文献)以及一个全新的未被任何评估PLM接触过的LMC-EHRs数据集。
- 围绕目标实体(S, O_t)、正确替代项(O_cor)与错误实体(O_incor)构建上下文片段,并逐步将它们添加至提示中,以观察在[MASK]标记处的排名变化。
- 基于排名变化定义UCM度量:若O_t在多种不同上下文中均保持高排名,则分类为“理解”;若排名始终较低,则分类为“混淆”;若更倾向于错误或替代实体,则分类为“误解”。
- 使用UMLS概念映射对实体表述进行标准化,以减少实例表述偏差(IVB)。
- 进行控制实验,将O_t替换为负样本目标;观察其排名行为发生相反变化,以区分理解与复制行为。
- 通过对数千个上下文变异提示的排名变化进行统计分析,判断PLM是否真正理解某一事实,而非仅从上下文中复制。
实验结果
研究问题
- RQ1上下文方差提示是否能提升生物医学PLMs知识探针评估的可靠性,特别是在罕见关系与大规模N对M关系场景下?
- RQ2所提出的UCM度量是否比Top-k准确率更有效地区分真实理解与依赖上下文的复制行为?
- RQ3上下文方差提示在多大程度上缓解了提示偏好偏差(PPB)、实例表述偏差(IVB)与样本差异偏差(SDB)?
- RQ4生物医学PLM是否展现出对事实知识的真实理解,还是仅从输入上下文中复制?
- RQ5不同PLM在上下文方差下的行为如何?这种行为是否在不同关系类型与实体频率下系统性地变化?
主要发现
- UCM度量成功识别出‘误解’行为——即模型倾向于选择错误或替代实体,揭示了以往Top-k准确率评估的局限性。
- 上下文方差提示显著提升了评估的稳定性和公平性,尤其在罕见关系与大规模N对M关系上,缩小了LAMA与BioLAMA之间的性能差距。
- 控制实验表明,PLM(特别是生物医学专用模型如BioBERT)在将O_t替换为负样本目标时,表现出一致的排名变化,表明其具备超越复制行为的真正理解能力。
- UCM度量显示,当上下文多样化时,PLM更可能‘理解’事实,尤其在目标实体为罕见实体或属于大规模N对M关系时。
- 通过使用多样化的真实世界上下文与标准化的实体映射,该方法有效缓解了PPB、IVB与SDB,实现了PLMs之间更可靠且可比的评估。
- 在12种PLM上的实证结果表明,上下文方差与UCM共同带来了更稳健、更具可解释性的知识探针结果,尤其在复杂的生物医学场景中表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。