Skip to main content
QUICK REVIEW

[论文解读] Aligning Instruction Tasks Unlocks Large Language Models as Zero-Shot Relation Extractors

Kai Zhang, Bernal Jiménez Gutiérrez|arXiv (Cornell University)|May 18, 2023
Natural Language Processing Techniques被引用 6
一句话总结

该论文提出 QA4RE 框架,将关系抽取(RE)重构为多项选择题问答任务,以利用指令微调数据集中 QA 任务的高出现频率。通过将 RE 与 QA 对齐,该方法使指令微调的大语言模型(如 text-davinci-003 和 FLAN-T5-XXL)在零样本关系抽取任务上达到最先进性能,F1 值绝对提升最高达 8.6%,优于以往基于小语言模型的最先进方法。

ABSTRACT

Recent work has shown that fine-tuning large language models (LLMs) on large-scale instruction-following datasets substantially improves their performance on a wide range of NLP tasks, especially in the zero-shot setting. However, even advanced instruction-tuned LLMs still fail to outperform small LMs on relation extraction (RE), a fundamental information extraction task. We hypothesize that instruction-tuning has been unable to elicit strong RE capabilities in LLMs due to RE's low incidence in instruction-tuning datasets, making up less than 1% of all tasks (Wang et al., 2022). To address this limitation, we propose QA4RE, a framework that aligns RE with question answering (QA), a predominant task in instruction-tuning datasets. Comprehensive zero-shot RE experiments over four datasets with two series of instruction-tuned LLMs (six LLMs in total) demonstrate that our QA4RE framework consistently improves LLM performance, strongly verifying our hypothesis and enabling LLMs to outperform strong zero-shot baselines by a large margin. Additionally, we provide thorough experiments and discussions to show the robustness, few-shot effectiveness, and strong transferability of our QA4RE framework. This work illustrates a promising way of adapting LLMs to challenging and underrepresented tasks by aligning these tasks with more common instruction-tuning tasks like QA.

研究动机与目标

  • 探究尽管指令微调的大语言模型在其他自然语言处理任务中展现出强大的零样本能力,为何在关系抽取任务上表现不佳。
  • 解决指令微调大语言模型在关系抽取任务上表现不佳的根本原因,假设源于指令微调数据集中关系抽取任务的低频出现(低于 1%)。
  • 开发一种将低频任务(如 RE)与高频指令微调任务(如 QA)对齐的框架,以释放更好的性能。
  • 在不同规模的指令微调大语言模型上,评估所提方法的鲁棒性、少样本有效性及可迁移性。
  • 证明通过采用更常见的指令格式重构任务,大语言模型可以超越以往的最先进零样本关系抽取方法。

提出的方法

  • 将关系抽取重构为多项选择题问答任务,其中每个输入句子被转化为一个问题,候选关系作为选项呈现。
  • 使用现有的指令微调大语言模型,无需微调,仅通过提示工程激发模型在关系抽取任务上的问答行为。
  • 设计提示,将实体对和候选关系映射为结构化的问答格式,使模型通过选择正确选项来识别关系类型。
  • 利用指令微调数据集中 QA 任务的高频率(12–15%)来提升模型在低频任务(如 RE)上的泛化能力和性能。
  • 使用两个系列的六种指令微调大语言模型(GPT-3.5 和 FLAN-T5)在四个真实世界的关系抽取数据集上评估该框架。
  • 开展消融研究和提示变体分析,以评估不同提示设计下的鲁棒性和泛化能力。

实验结果

研究问题

  • RQ1尽管指令微调的大语言模型在其他自然语言处理任务中表现出强大的零样本能力,为何在关系抽取任务上表现不佳?
  • RQ2指令微调数据集中关系抽取任务的低频出现在多大程度上限制了大语言模型在该任务上的性能?
  • RQ3将关系抽取与高频任务(如多项选择题问答)对齐,是否能显著提升大语言模型在零样本关系抽取任务上的性能?
  • RQ4QA4RE 框架对提示设计和模型架构的变化有多强的鲁棒性?
  • RQ5QA4RE 框架是否能在不同规模的大语言模型(包括小型和超大模型)之间实现泛化?

主要发现

  • QA4RE 使 text-davinci-003 在 F1 值上相比原始 RE 提示方法实现了 8.2% 的绝对提升,优于以往最先进零样本关系抽取方法。
  • 对于 FLAN-T5-XXL,QA4RE 实现了 8.6% 的绝对 F1 提升,这是首次有大语言模型在零样本关系抽取任务上超越基于小语言模型的最先进方法。
  • 该框架在所有六种评估的指令微调大语言模型上均显著提升性能,涵盖从 80M 到 175B 参数的模型,展现出强大的可迁移性。
  • 即使是最小的模型 FLAN-T5-Small(80M),也实现了 5.6% 的绝对 F1 提升,证实了其在不同模型规模上的有效性。
  • 该方法对提示变体具有鲁棒性,并展现出较强的少样本有效性,尽管在更大的 GPT-3.5 模型上性能增益略有下降,相较于 FLAN-T5 模型。
  • 结果验证了假设:即在指令微调数据中任务出现频率过低,会限制大语言模型在低频任务(如 RE)上的性能表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。