[论文解读] Probing and Fine-tuning Reading Comprehension Models for Few-shot Event Extraction
该论文提出了一种少样本事件抽取的阅读理解框架,通过将事件检测表述为文本蕴涵任务,将论元检测表述为问答任务,利用预训练的 BERT 模型提炼任务和标签语义。该方法在全监督设置下的 ACE 2005 基准上达到最先进性能,在零样本和少样本设置中也表现出色,证明了有效的知识迁移和标签效率。
We study the problem of event extraction from text data, which requires both detecting target event types and their arguments. Typically, both the event detection and argument detection subtasks are formulated as supervised sequence labeling problems. We argue that the event extraction models so trained are inherently label-hungry, and can generalize poorly across domains and text genres.We propose a reading comprehension framework for event extraction.Specifically, we formulate event detection as a textual entailment prediction problem, and argument detection as a question answer-ing problem. By constructing proper query templates, our approach can effectively distill rich knowledge about tasks and label semantics from pretrained reading comprehension models. Moreover, our model can be fine-tuned with a small amount of data to boost its performance. Our experiment results show that our method performs strongly for zero-shot and few-shot event extraction, and it achieves state-of-the-art performance on the ACE 2005 benchmark when trained with full supervision.
研究动机与目标
- 解决传统监督序列标注模型在事件抽取任务中对标签数据高度依赖的问题。
- 通过减少对大规模标注数据集的依赖,提升在不同领域和文本类型中的泛化能力。
- 通过从预训练语言模型中蒸馏知识,实现在零样本和少样本设置下的有效事件抽取。
- 将事件检测与论元检测从触发词依赖关系中解耦,实现更灵活且鲁棒的抽取机制。
- 通过探测与微调,探究预训练模型在事件抽取任务中的可迁移性。
提出的方法
- 将事件检测表述为文本蕴涵预测任务:给定一个句子和一个声明事件发生的假设,预测该假设是否被句子蕴涵。
- 将论元检测表述为问答任务:针对事件论元生成自然语言问题(例如,“运输发生在何处?”),并从输入句子中抽取答案片段。
- 使用预训练的 BERT 模型作为文本蕴涵头和问答头的骨干网络,以迁移丰富的语义与世界知识。
- 为每种事件类型和论元角色构建查询模板,以引导模型学习任务特定与标签特定的语义。
- 在少量标注数据上微调端到端模型,使其适应特定的事件抽取任务。
- 在微调前,利用探测技术分析并蒸馏 BERT 中关于事件类型和论元角色的知识。
实验结果
研究问题
- RQ1事件抽取能否被有效重构为阅读理解任务,以提升少样本和零样本的泛化能力?
- RQ2文本蕴涵与问答组件在多大程度上能将预训练语言模型的知识迁移至事件抽取任务?
- RQ3将论元检测与触发词识别解耦是否能提升低资源设置下的鲁棒性与性能?
- RQ4基于模板的查询在多大程度上能引导模型学习事件与论元类型的可泛化表征?
- RQ5与序列标注基线模型相比,该框架在零样本、少样本和全监督设置下的性能表现如何?
主要发现
- 所提出的框架在全监督设置下的 ACE 2005 基准上达到最先进性能,优于现有序列标注模型。
- 模型在少样本设置下展现出强大的泛化能力,仅需每类事件的少量标注样本即可取得高性能。
- 该框架在零样本设置下表现具有竞争力,表明从 BERT 中蒸馏的知识可实现无需在目标数据上微调的泛化能力。
- 使用任务特定模板探测 BERT 能有效捕捉事件类型与论元角色的语义与结构知识。
- 在极小数据量下进行微调可显著提升性能,证实了蒸馏知识的有效性。
- 该方法对领域分布变化具有鲁棒性,减少了对噪声触发词标注的依赖,提升了结果的一致性与泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。