Skip to main content
QUICK REVIEW

[论文解读] Open-Domain Frame Semantic Parsing Using Transformers

Aditya Kalyanpur, Or Biran|arXiv (Cornell University)|Oct 21, 2020
Natural Language Processing Techniques参考文献 25被引用 5
一句话总结

本文提出一种基于Transformer的生成式编码器-解码器框架,用于开放域框架语义解析,采用T5模型联合建模框架检测、论元跨度选择和角色标注。在FrameNet 1.7和CoNLL 2012 PropBank SRL基准上取得最先进性能,多任务学习设置通过共享子任务表示,显著优于先前方法。

ABSTRACT

Frame semantic parsing is a complex problem which includes multiple underlying subtasks. Recent approaches have employed joint learning of subtasks (such as predicate and argument detection), and multi-task learning of related tasks (such as syntactic and semantic parsing). In this paper, we explore multi-task learning of all subtasks with transformer-based models. We show that a purely generative encoder-decoder architecture handily beats the previous state of the art in FrameNet 1.7 parsing, and that a mixed decoding multi-task approach achieves even better performance. Finally, we show that the multi-task model also outperforms recent state of the art systems for PropBank SRL parsing on the CoNLL 2012 benchmark.

研究动机与目标

  • 通过利用预训练的Transformer模型实现端到端语义解析,提升框架语义解析性能。
  • 探究仅使用T5的生成式序列到序列方法是否在框架语义解析中优于先前最先进系统。
  • 探索使用共享编码器和任务特定解码器的多任务学习方法,以联合优化框架检测、论元跨度选择和角色标注。
  • 在包括FrameNet 1.7和CoNLL 2012 PropBank SRL在内的多样化基准上进行评估,采用真实端到端设置。

提出的方法

  • 该模型采用基于T5的编码器-解码器架构,将框架语义解析视为序列到序列的生成任务,将输入文本映射为结构化的框架表示。
  • 引入多任务学习设置,其中共享编码器处理输入,任务特定解码器分别生成框架标签、论元跨度和角色标签。
  • 在多任务变体中,模型采用基于标记索引的位置编码,以提高跨度检测的准确性。
  • 该框架通过所有子任务的单一损失函数进行端到端训练,实现框架选择、论元检测和标注的联合优化。
  • 使用标准指标(如论元检测的F1和完整框架预测的精确匹配)进行评估。
  • 在FrameNet 1.7和CoNLL 2012 PropBank数据集上进行微调,并使用官方评估脚本与先前最先进系统进行结果对比。

实验结果

研究问题

  • RQ1仅使用T5的生成式序列到序列Transformer模型是否能在框架语义解析中优于先前最先进系统?
  • RQ2使用共享编码器和专用解码器的多任务学习是否能提升框架检测、论元跨度选择和角色标注的性能?
  • RQ3在多任务设置中,编码时引入标记位置索引对论元检测F1有何影响?
  • RQ4该模型在跨多样化框架本体(如Hector和FrameNet)的开放域语义解析中,泛化能力如何?

主要发现

  • 完全生成式的T5-base模型在FrameNet 1.7基准上,论元检测F1相比先前最先进系统Open-Sesame提升了12-17%的绝对值。
  • 采用专用解码器的多任务学习模型在各种开发/测试集和真实/预测谓词设置下,论元检测F1相比仅生成式方法提升了1-5%。
  • 在CoNLL 2012 PropBank SRL基准上,多任务模型在测试集上达到83.7%的F1,优于先前最先进系统报告的83.1%。
  • 错误分析显示,框架检测是主要错误来源,占42.5%的假阳性和假阴性,表明框架分类是主要瓶颈。
  • 约18%的错误源于有争议或模糊的黄金标准标注,表明人工标注的框架和角色边界并非总是明确。
  • 模型在角色生成方面无系统性过生成或欠生成现象,表明尽管框架选择错误率较高,预测行为仍保持平衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。