[论文解读] Relation Classification as Two-way Span-Prediction
该论文提出了一种新颖的双向跨度预测框架用于监督式关系分类,将每种关系视为一个问答对,以增强模型对相关实体的关注。通过使用双向模板将关系分类转化为跨度预测任务,该方法在TACRED和SemEval上分别取得了SOTA结果,F₁分数分别提升2.3和0.9,同时减少了对表面启发式规则的依赖。
The current supervised relation classification (RC) task uses a single embedding to represent the relation between a pair of entities. We argue that a better approach is to treat the RC task as span-prediction (SP) problem, similar to Question answering (QA). We present a span-prediction based system for RC and evaluate its performance compared to the embedding based system. We demonstrate that the supervised SP objective works significantly better then the standard classification based objective. We achieve state-of-the-art results on the TACRED and SemEval task 8 datasets.
研究动机与目标
- 解决标准关系分类模型依赖全局句子嵌入且常忽略特定实体的局限性。
- 通过强制模型关注关系中涉及实体的精确跨度来提升模型性能,减少对表面文本模式的依赖。
- 评估受问答启发的跨度预测方法是否能在监督式关系分类中超越传统的基于嵌入的分类方法。
- 研究双向问题模板和答案组合策略(OR与AND)对模型性能的影响。
- 评估在SQuAD等通用问答数据集上进行预训练是否能提升关系分类任务的性能。
提出的方法
- 将每种关系类型转换为两个问题:一个以头实体作为查询、尾实体作为答案,另一个反之,形成双向跨度预测设置。
- 模型被训练以预测每个问题的答案跨度,使用跨度评分函数使正确跨度的得分最大化。
- 最终的关系预测通过两个问题答案的OR组合实现,以确保高召回率的同时保持高精度。
- 该方法使用BERT和ALBERT等预训练语言模型作为主干网络,用于编码上下文和查询。
- 模板被设计用于编码关系的语义知识,模型在关系分类数据集上进行端到端微调。
- 该方法在TACRED、SemEval-8和新发布的CRE数据集上进行评估,以测试其鲁棒性和泛化能力。
实验结果
研究问题
- RQ1与标准的基于嵌入的分类方法相比,双向跨度预测框架是否能提升监督式关系分类的性能?
- RQ2使用双向问题(将两个实体分别作为查询和答案)是否能提升模型的泛化能力并减少启发式偏差?
- RQ3在跨度预测设置中,不同的答案组合策略(OR与AND)如何影响精确率与召回率?
- RQ4在SQuAD 2.0等通用问答数据集上进行预训练是否能提升关系分类任务的性能?
- RQ5跨度预测目标在多大程度上减少了模型对非语义文本模式的依赖?
主要发现
- 该双向跨度预测方法在TACRED上取得了88.7的新SOTA F₁分数,相比之前方法提升了2.3 F₁分。
- 在SemEval-8上,该方法取得了88.9的F₁分数,相比之前SOTA提升了0.9 F₁分。
- 使用双向问题相比单向设置带来了2.4 F₁分的提升,证明了从两个角度建模关系的重要性。
- 与OR策略相比,AND策略显著降低了F₁分数(约10分),原因是过度约束模型,导致召回率下降。
- 在SQuAD 2.0上进行预训练并未提升性能,甚至在与TACRED数据结合时导致性能下降,表明主要优势来自监督式跨度预测,而非问答预训练。
- 该模型在CRE数据集上表现出强大的泛化能力,该数据集旨在测试对浅层启发式规则的依赖,证实了其对虚假模式的依赖显著降低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。