[论文解读] Active Relation Discovery: Towards General and Label-aware Open Relation Extraction
本文提出了一种名为主动关系发现(Active Relation Discovery, ARD)的新框架,用于开放关系抽取,该框架结合关系异常检测以区分已知关系与新关系,并结合主动学习为发现的关系分配人类可读的标签。ARD在传统设置和新提出的通用开放关系抽取(General OpenRE)设置下,均显著优于先前的最先进方法,展现出在真实场景中的鲁棒性与实用性。
Open Relation Extraction (OpenRE) aims to discover novel relations from open domains. Previous OpenRE methods mainly suffer from two problems: (1) Insufficient capacity to discriminate between known and novel relations. When extending conventional test settings to a more general setting where test data might also come from seen classes, existing approaches have a significant performance decline. (2) Secondary labeling must be performed before practical application. Existing methods cannot label human-readable and meaningful types for novel relations, which is urgently required by the downstream tasks. To address these issues, we propose the Active Relation Discovery (ARD) framework, which utilizes relational outlier detection for discriminating known and novel relations and involves active learning for labeling novel relations. Extensive experiments on three real-world datasets show that ARD significantly outperforms previous state-of-the-art methods on both conventional and our proposed general OpenRE settings. The source code and datasets will be available for reproducibility.
研究动机与目标
- 为解决现有开放关系抽取(OpenRE)方法在真实测试条件下同时存在已知与新关系时,难以区分两者的问题。
- 通过实现新关系的自动分配有意义、人类可读的标签,消除对新关系进行二次人工标注的需求。
- 提出一种实用的通用开放关系抽取(General OpenRE)评估设置,更真实地反映现实世界信息抽取的挑战。
- 开发一种可扩展且高效的框架,将主动学习与关系异常检测相结合,实现端到端的关系发现。
提出的方法
- ARD采用关系异常检测机制,将新关系视为异常,使模型在已知与新关系共存的测试数据中仍能稳健分类关系。
- 该框架在主动学习中引入代表性实例选择策略,仅需人类标注少量高信息量的实例,即可训练监督分类器以识别新关系。
- 训练一个判别器网络以区分已知与未知关系,利用其置信度分数引导主动学习过程。
- ARD使用基于BERT的关系编码器进行关系表征,消融实验表明,即使使用BERT_BASE,其性能也优于先前使用BERT_LARGE的最先进模型。
- 主动学习循环迭代地从未标注数据池中选择最不确定或最具信息量的实例进行人工标注,从而最小化标注成本。
- 该框架在传统设置与通用开放关系抽取(General OpenRE)设置下均进行评估,性能通过标准自然语言处理指标(如F1、V-measure、ARI及精确率/召回率)进行衡量。
实验结果
研究问题
- RQ1当测试数据同时包含已知与新关系时,现有开放关系抽取模型在真实场景下的泛化能力如何?
- RQ2关系抽取模型能否在无需二次人工标注的情况下,自动为新关系分配有意义、人类可读的标签?
- RQ3在混合测试条件下,关系异常检测在区分已知与新关系方面,能在多大程度上提升模型的鲁棒性?
- RQ4结合代表性实例选择的主动学习在多大程度上能有效减少人工标注工作量,同时保持高质量的关系标注?
主要发现
- 在三种真实世界数据集上,ARD在传统设置与通用开放关系抽取(General OpenRE)设置下,均显著优于先前的最先进方法。
- 即使以BERT_BASE作为主干网络,ARD的性能仍优于先前使用BERT_LARGE的最先进模型,表明模型规模并非性能提升的主要驱动因素。
- 判别器对未知关系分类的置信度在训练过程中稳步提升,表明异常检测过程稳定且可靠。
- 在新冠文献的真实应用中,ARD以高置信度自动提取了139,479条关系,覆盖10种实体类型组合,且标注成本极低。
- 消融实验表明,BERT模型规模对性能影响不大,ARD在小型模型上仍能保持优异表现。
- 结合代表性实例选择的主动学习策略显著降低了标注工作量,同时在下游任务中实现了高F1与V-measure分数,证明了其高质量标注能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。