[论文解读] EventRL: Enhancing Event Extraction with Outcome Supervision for Large Language Models
EventRL 提出了一种强化学习框架,通过使用任务特定的奖励函数进行结果监督,提升大语言模型(LLMs)在事件抽取中的表现,减少幻觉和结构错误。该方法在识别新型事件类型和保持正确事件结构方面优于少样本提示(few-shot prompting)和监督微调(supervised fine-tuning),尤其在 CodeLLaMa 模型(经代码数据预训练)上展现出更强的泛化能力,其在保留数据上的 F1 分数最高达 65.90。
In this study, we present EventRL, a reinforcement learning approach developed to enhance event extraction for large language models (LLMs). EventRL utilizes outcome supervision with specific reward functions to tackle prevalent challenges in LLMs, such as instruction following and hallucination, manifested as the mismatch of event structure and the generation of undefined event types. We evaluate EventRL against existing methods like Few-Shot Prompting (FSP) (based on GPT4) and Supervised Fine-Tuning (SFT) across various LLMs, including GPT-4, LLaMa, and CodeLLaMa models. Our findings show that EventRL significantly outperforms these conventional approaches by improving the performance in identifying and structuring events, particularly in handling novel event types. The study emphasizes the critical role of reward function selection and demonstrates the benefits of incorporating code data for better event extraction. While increasing model size leads to higher accuracy, maintaining the ability to generalize is essential to avoid overfitting.
研究动机与目标
- 为解决基于 LLM 的事件抽取中指令遵循和幻觉问题,特别是结构不匹配和未定义事件类型问题。
- 通过从标准损失函数转向反映实际抽取准确率的结果反馈,提升事件抽取性能。
- 探究通过强化学习实现的结果监督是否能增强模型对未见事件类型的泛化能力,并提升事件结构的保真度。
- 评估代码数据预训练对事件抽取性能及不同模型规模下模型鲁棒性的影响。
提出的方法
- EventRL 采用强化学习框架,其中策略网络通过基于事件抽取性能指标的结果反馈奖励函数进行优化。
- 引入三种奖励函数:Argument-F1、Average-F1 和 Product-F1,每种均旨在更严重地惩罚错误的论元角色或事件类型预测。
- 通过引入 Teacher-Force Threshold 和 Advantage Clipping 稳定训练过程,防止策略退化和灾难性遗忘。
- 基于事件论元和类型是否完全匹配进行奖励塑造,反馈与最终事件结构的正确性直接关联。
- 该方法应用于包括 GPT-4、LLaMA、CodeLLaMa 等在内的 LLM,训练使用 SFT 初始化的模型,并通过类似 PPO 的优化方法进行微调。
- 整合代码数据预训练,以增强模型理解结构化信息的能力,从而提升事件抽取任务的性能。

实验结果
研究问题
- RQ1通过强化学习实现的结果监督是否能显著减少基于 LLM 的事件抽取中的幻觉和结构错误?
- RQ2不同奖励函数(Argument-F1、Average-F1、Product-F1)如何影响模型学习正确事件结构和类型的能力?
- RQ3在代码数据上进行预训练是否能提升 LLM 对未见事件类型的泛化能力?
- RQ4模型规模增大在多大程度上提升事件抽取性能?是否会导致在保留数据上的过拟合?
- RQ5在零样本和少样本事件抽取设置下,基于结果的反馈是否能超越标准监督微调和少样本提示?
主要发现
- EventRL 在多个 LLM 上显著优于少样本提示(GPT-4)和监督微调(SFT),在使用 CodeLLaMa-13B 和 Product-F1 奖励函数的保留测试集上达到 65.90 F1 分数。
- 在 7B 参数规模下,经代码数据预训练的 CodeLLaMa 模型在保留测试集上取得 59.23 AVG F1,在保留测试集上取得 49.74 F1,优于 LLaMa-7B(56.03 和 37.35),表明代码数据有助于结构化推理能力。
- 在 13B 参数规模下,CodeLLaMa 与 LLaMa 的性能差距进一步扩大,CodeLLaMa-13B 在保留测试集上取得 51.69 AVG F1,而 LLaMa 仅为 42.04。
- 当模型扩展至 34B 参数时,CodeLLaMa-34B 在保留测试集上的泛化能力下降至 48.75 F1,表明大模型存在过拟合风险。
- 案例研究显示,EventRL(Prod-F1)能正确识别逮捕事件中的“agent”角色('police')和 'crime' 论元,而 SFT 基线模型则两者均遗漏,凸显其结构准确性提升。
- 研究结果表明奖励函数设计至关重要:Product-F1 表现最佳,表明对精确率和召回率的联合优化最有利于提升事件结构保真度。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。