Skip to main content
QUICK REVIEW

[论文解读] Patents Phrase to Phrase Semantic Matching Dataset

Grigor Aslanyan, Ian Wetherbee|arXiv (Cornell University)|Aug 1, 2022
Biomedical Text Mining and Ontologies被引用 4
一句话总结

本文提出了一项新的、由人工标注的、上下文感知的短语对相似度数据集,专注于专利用技术术语,包含48,548个条目,采用细粒度语义类别(例如,同义词、上下位词、反义词)进行标注,并结合上下文CPC编码。该数据集可用于评估模型在复杂案例(如短语消歧和对抗性关键词匹配)上的表现,其中Sentence-BERT表现最佳(Spearman相关系数0.577),甚至优于经过专利数据微调的BERT模型。

ABSTRACT

There are many general purpose benchmark datasets for Semantic Textual Similarity but none of them are focused on technical concepts found in patents and scientific publications. This work aims to fill this gap by presenting a new human rated contextual phrase to phrase matching dataset. The entire dataset contains close to $50,000$ rated phrase pairs, each with a CPC (Cooperative Patent Classification) class as a context. This paper describes the dataset and some baseline models.

研究动机与目标

  • 为解决现有基准数据集在专利用技术概念和科学出版物方面的缺失问题。
  • 创建一个高质量、人工标注的数据集,包含细粒度语义评分(例如,同义词、上下位词、反义词)和上下文CPC分类。
  • 包含具有挑战性的示例,如短语消歧、对抗性关键词匹配以及对BERT模型构成挑战的困难负样本。
  • 为在专利用语言上训练和评估语义匹配模型提供公开基准。

提出的方法

  • 通过从专利用语料库中提取关键名词和功能短语构建数据集,并筛选出在至少100项专利中出现的高频术语。
  • 对于每个锚定短语,从该专利用分类编码中随机抽取最多四个CPC类别作为上下文。
  • 通过两种方法生成目标短语:部分匹配(共享词素但短语不同)和使用BERT进行掩码语言建模以预测被掩码的短语。
  • 所有短语在人工标注前均经过预处理(全部小写,标点符号和停用词被移除)。
  • 两名独立标注员对每对短语的语义相似度进行评估,并分配五个相似度等级,其中包含子类别(例如,下位词、领域相关)。
  • 标注差异通过标注员讨论解决,标注员生成的短语对最终合并入最终数据集。

实验结果

研究问题

  • RQ1现有预训练模型在涉及专利用技术语言并带有上下文线索的语义匹配任务中表现如何?
  • RQ2词袋模型和通用嵌入模型在具有共享关键词但含义不同的专利用短语对上失败的程度如何?
  • RQ3在专利用数据上微调的模型是否能在该语义匹配任务中超越通用模型?
  • RQ4与其它架构相比,双塔结构(如Sentence-BERT)在该专用数据集上的有效性如何?

主要发现

  • 在测试集上表现最佳的模型是Sentence-BERT(all-mpnet-base-v2),其Spearman相关系数为0.577,皮尔逊相关系数为0.598。
  • Patent-BERT(在专利用数据上预训练的BERT模型)优于通用BERT-Large模型,后者Spearman相关系数为0.409,皮尔逊相关系数为0.418。
  • 传统词袋模型(GloVe、FastText、Word2Vec)表现较差,皮尔逊相关系数均低于0.44,表明其在技术文本复杂语义匹配任务中效果有限。
  • 上下文CPC编码的引入显著提升了消歧能力,例如模型能够区分同一上下文中“acid absorption”与“acid reflux”的语义差异。
  • 该数据集共包含48,548个条目,涉及973个唯一锚定短语,涵盖106种不同的CPC类别,且已公开发布于Kaggle供研究使用。
  • 该数据集包含多样化的语义关系,如上下位词关系(例如,“gasoline blend” → “fuel blend”)、下位词关系(“faucet assembly” → “water tap”)以及领域相关匹配,支持细粒度评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。