[论文解读] Textual Entailment for Event Argument Extraction: Zero- and Few-Shot with Multi-Source Learning
该论文提出了一种基于文本蕴涵的事件论元抽取(EAE)框架,通过在多个自然语言蕴涵(NLI)数据集上进行多源预训练,在零样本和少样本设置下将标注需求减少了90%。通过将EAE重新表述为使用语言化模板的蕴涵任务,该方法在ACE和WikiEvents数据集上实现了最先进性能,同时最小化了对模板的依赖,并实现了仅需极少人工投入的跨领域迁移。
Recent work has shown that NLP tasks such as Relation Extraction (RE) can be recasted as Textual Entailment tasks using verbalizations, with strong performance in zero-shot and few-shot settings thanks to pre-trained entailment models. The fact that relations in current RE datasets are easily verbalized casts doubts on whether entailment would be effective in more complex tasks. In this work we show that entailment is also effective in Event Argument Extraction (EAE), reducing the need of manual annotation to 50% and 20% in ACE and WikiEvents respectively, while achieving the same performance as with full training. More importantly, we show that recasting EAE as entailment alleviates the dependency on schemas, which has been a road-block for transferring annotations between domains. Thanks to the entailment, the multi-source transfer between ACE and WikiEvents further reduces annotation down to 10% and 5% (respectively) of the full training without transfer. Our analysis shows that the key to good results is the use of several entailment datasets to pre-train the entailment model. Similar to previous approaches, our method requires a small amount of effort for manual verbalization: only less than 15 minutes per event argument type is needed, and comparable results can be achieved with users with different level of expertise.
研究动机与目标
- 通过将文本蕴涵作为任务重构手段,降低事件论元抽取(EAE)的高标注成本。
- 通过支持在不同事件模板(如ACE和WikiEvents)之间迁移,最小化对刚性、领域特定模板的依赖。
- 评估多源NLI预训练(超越仅MNLI)在提升基于蕴涵的EAE性能方面的有效性。
- 量化编写语言化模板与人工标注之间的时间与精力权衡,识别最优分配比例。
提出的方法
- 通过为每个事件论元类型创建自然语言假设(语言化表达),将EAE重构为文本蕴涵任务,使用将输入结构化为(事件触发词,候选论元,角色类型)的模板。
- 在多个NLI数据集(如MNLI、SNLI、FEVER和ANLI)上微调预训练的蕴涵模型,以提升在单一数据集预训练之外的泛化能力和鲁棒性。
- 利用蕴涵模型通过计算前提(句子上下文)与假设(包含候选论元的模板)之间的蕴涵概率,预测最可能的论元角色。
- 通过重用模板和预训练模型,在ACE与WikiEvents之间实现零样本和少样本迁移,无需重新标注数据,将标注需求减少至完整训练数据的5%–10%。
- 通过在多样化NLI数据集上联合预训练实现多源学习,以增强零样本和少样本泛化能力,其表现优于仅在MNLI上微调的模型。
- 采用人机协同方式创建模板,对领域专业知识要求极低,并通过专家和新手模板编写者的验证评估性能。
实验结果
研究问题
- RQ1文本蕴涵能否有效应用于事件论元抽取(一种比传统关系抽取更复杂的任务),并在零样本和少样本设置下表现出强劲性能?
- RQ2与仅在单一数据集(如仅MNLI)上微调相比,使用多个NLI数据集进行多源预训练是否能显著提升基于蕴涵的EAE性能?
- RQ3通过将标注方式从人工数据标注转向模板编写,能在多大程度上减少标注工作量?两者之间的时间分配最优比例如何?
- RQ4在不进行人工重新标注的情况下,能否在ACE与WikiEvents之间实现跨模板迁移?整体标注成本降低了多少?
- RQ5模板质量是否依赖于标注者的专业水平?非专业人士能否编写出性能相当的语言化表达?
主要发现
- 基于蕴涵的EAE系统在ACE和WikiEvents上均实现了最先进性能,在少样本设置下仅使用20%的训练数据即可达到全监督结果水平。
- 在多个NLI数据集(如MNLI、SNLI、FEVER、ANLI)上进行预训练,其性能显著优于仅使用MNLI的模型,尤其在零样本和少样本设置下表现更优。
- 每种事件论元类型模板的创建时间少于15分钟,即使由新手用户编写也能获得可比性能,表明专业门槛极低。
- 在从ACE迁移到WikiEvents时,标注需求减少至完整训练数据的10%;从WikiEvents迁移到ACE时,减少至5%,且无需额外人工标注。
- 标注ACE数据的5%约需9小时,F1得分为37.5;而花费5小时编写模板可在零样本设置下获得40.6的F1,表明模板编写比人工标注更高效。
- 性能曲线显示,延长模板编写时间带来的收益递减,表明存在一个最佳平衡点:5小时模板编写与9小时标注结合可实现最优结果(F1 = 57)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。