[论文解读] Rapid Customization for Event Extraction
该论文提出了一种最小化监督的系统,可在每种新事件类型仅需不到10分钟的人工干预下,快速定制事件抽取。该系统利用词嵌入和WordNet扩展初始触发词,应用远程监督进行自动标注,并利用ACE标注的论元训练一个可泛化的论元抽取器,在67种新型事件类型上实现了优异性能,且人工干预极少。
We present a system for rapidly customizing event extraction capability to find new event types and their arguments. The system allows a user to find, expand and filter event triggers for a new event type by exploring an unannotated corpus. The system will then automatically generate mention-level event annotation automatically, and train a Neural Network model for finding the corresponding event. Additionally, the system uses the ACE corpus to train an argument model for extracting Actor, Place, and Time arguments for any event types, including ones not seen in its training data. Experiments show that with less than 10 minutes of human effort per event type, the system achieves good performance for 67 novel event types. The code, documentation, and a demonstration video will be released as open source on github.com.
研究动机与目标
- 减少将事件抽取系统扩展至新事件类型所需的人工劳动量。
- 通过最少的人工输入和触发词的自动扩展,实现在新事件类型上的快速定制。
- 利用现有的ACE标注数据训练一个可泛化的论元抽取模型,使其适用于未见的事件类型。
- 开发一个用户界面,以加速新事件类型触发词的选择与过滤。
- 在67种此前未见过的事件类型上展示该系统的实际应用价值。
提出的方法
- 用户为新事件类型提供少量初始触发词。
- 系统利用词嵌入(高余弦相似度)和WordNet(下位词)扩展这些触发词。
- 用户对扩展后的触发词进行筛选,仅保留相关术语,形成最终的触发词集合。
- 在未标注语料上应用远程监督,自动生成事件触发词的训练样本。
- 使用自动生成的触发词样本训练卷积神经网络(CNN)进行事件检测。
- 在ACE标注数据上训练独立的论元模型,以提取任何事件类型的参与者(Actor)、地点(Place)和时间(Time)论元,包括未见过的类型。
实验结果
研究问题
- RQ1能否在极少人工标注的情况下,快速定制事件抽取以适应新事件类型?
- RQ2通过词嵌入和WordNet进行触发词扩展,在提升覆盖率和准确率方面效果如何?
- RQ3在ACE数据上训练的模型能否泛化到ACE训练数据中未出现的事件类型,以提取论元?
- RQ4远程监督结合人工筛选在多大程度上提升了触发检测性能?
- RQ5用户界面在减少定制流程中的时间和精力方面起到了何种作用?
主要发现
- 每种事件类型仅需不到10分钟的人工干预,系统在67种新型事件类型上即实现了优异性能。
- 在远程监督基础上结合人工筛选训练的触发模型(T_h)优于仅使用远程监督训练的模型(T_d),表明筛选有助于提升泛化能力。
- 论元模型(A_n)的整体F1得分接近使用真实触发词在相同数据上训练的模型,证明其对未见事件类型具有强大的泛化能力。
- 对100个测试论元(62个参与者,7个地点,10个人时间)的人工验证预测,精确率达到0.79,证实论元抽取组件具有高度可靠性。
- 即使在ACE训练数据中未包含的事件类型上,系统性能依然强劲,验证了论元模型的可迁移性。
- 用户界面通过支持触发词在不同事件类型间的交互式筛选与重新分配,显著提升了时间效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。