Skip to main content
QUICK REVIEW

[论文解读] ULTRA: Unleash LLMs' Potential for Event Argument Extraction through Hierarchical Modeling and Pair-wise Self-Refinement

Xinliang Frederick Zhang, Carter Blum|arXiv (Cornell University)|Jan 24, 2024
Topic Modeling被引用 4
一句话总结

ULTRA 是一种成本效益高、分层的框架,通过使用开源大语言模型(如 Flan-UL2)来增强文档级事件论元抽取(DocEAE)。它采用顺序分块处理、自修正机制以过滤无关候选论元,并引入 LEAFER 模块以提升论元跨度边界检测性能,在仅使用 50 个标注样本且无需昂贵 API 调用的情况下,相比强基线模型(包括 ChatGPT)实现了 9.8% 的绝对 F1 提升。

ABSTRACT

Structural extraction of events within discourse is critical since it avails a deeper understanding of communication patterns and behavior trends. Event argument extraction (EAE), at the core of event-centric understanding, is the task of identifying role-specific text spans (i.e., arguments) for a given event. Document-level EAE (DocEAE) focuses on arguments that are scattered across an entire document. In this work, we explore open-source Large Language Models (LLMs) for DocEAE, and propose ULTRA, a hierarchical framework that extracts event arguments more cost-effectively. Further, it alleviates the positional bias issue intrinsic to LLMs. ULTRA sequentially reads text chunks of a document to generate a candidate argument set, upon which non-pertinent candidates are dropped through self-refinement. We introduce LEAFER to address the challenge LLMs face in locating the exact boundary of an argument. ULTRA outperforms strong baselines, including strong supervised models and ChatGPT, by 9.8% when evaluated by Exact Match (EM).

研究动机与目标

  • 解决监督式 DocEAE 模型在标注与推理方面成本过高的问题。
  • 缓解如 ChatGPT 等闭源大语言模型在论元抽取中出现的位置偏差与冗长问题。
  • 在极小监督设置下(仅使用 50 个标注样本)实现高效的文档级 EAE。
  • 通过专用的 LEAFER 模块改进论元跨度边界检测。
  • 证明经过适当微调与优化后,开源大语言模型可在 DocEAE 任务中超越闭源模型。

提出的方法

  • ULTRA 将文档按顺序分块处理,通过大语言模型生成候选论元。
  • 采用自修正机制,利用学习到的分类器过滤掉不相关的候选论元。
  • LEAFER 模块通过预测候选论元跨度内的起始与结束位置,用于优化论元跨度边界。
  • 自修正与 LEAFER 模块均采用少样本提示法,最多使用 50 个标注样本进行训练。
  • ULTRA 在零样本推理设置下运行,最大限度减少对昂贵 API 调用的依赖。
  • 分块窗口大小经过调优,以在精确率与召回率之间取得平衡,F1 性能在窗口大小为 15 时趋于稳定。

实验结果

研究问题

  • RQ1在极小监督设置下,开源大语言模型能否在文档级事件论元抽取任务中达到最先进性能?
  • RQ2自修正机制与跨度边界优化如何减少基于大语言模型的 EAE 中的幻觉与冗余?
  • RQ3在分层处理中,调整文本分块窗口大小时,精确率与召回率之间的权衡关系如何?
  • RQ4与原始大语言模型输出相比,轻量级微调后的 LEAFER 模块在论元跨度边界检测上的改进程度如何?
  • RQ5与监督机器学习模型及闭源大语言模型(如 ChatGPT)相比,ULTRA 在成本与性能方面表现如何?

主要发现

  • ULTRA 在 DocEAE 基准测试中,相比最强基线模型(包括 ChatGPT),实现了 9.8% 的绝对 F1 提升,达到精确匹配 F1 的最优表现。
  • 与先前最先进模型相比,ULTRA 将 EM 召回率提升了 56%,后者仅达到 25.2% 的 EM 召回率。
  • 模型仅使用 50 个标注样本即保持高性能,展现出强大的少样本泛化能力。
  • ULTRA 显著降低推理成本——在 2K 测试集上,ChatGPT 的成本估计为 40 至 400 美元,而监督模型需 22K 个标注文章,成本高达 20,000 美元。
  • 仅使用 Layer-1 的变体表明,当窗口大小为 15 时,F1 性能趋于稳定,表明此时精确率与召回率之间达到最优权衡。
  • LEAFER 使 ULTRA 能够修正过宽的论元跨度,例如在正确跨度为“今年 3 月至 5 月之间”时,可将‘7 月’从输出中移除。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。