[论文解读] Exploiting Asymmetry for Synthetic Training Data Generation: SynthIE and the Case of Information Extraction
本文提出 SynthIE,一种利用大语言模型(LLMs)在结构化输出生成与文本生成之间不对称性的方法,通过提示 LLM 从预定义的结构化输出(例如 (主语, 关系, 宾语) 三元组)生成自然语言输入。通过反转任务,作者生成了 180 万条高质量合成数据点,用于封闭式信息抽取,使微调后的小型模型(2.2 亿至 7.7 亿参数)达到最先进性能,分别在 micro-F1 和 macro-F1 上比之前模型高出 57 和 79 个百分点。
Large language models (LLMs) have great potential for synthetic data generation. This work shows that useful data can be synthetically generated even for tasks that cannot be solved directly by LLMs: for problems with structured outputs, it is possible to prompt an LLM to perform the task in the reverse direction, by generating plausible input text for a target output structure. Leveraging this asymmetry in task difficulty makes it possible to produce large-scale, high-quality data for complex tasks. We demonstrate the effectiveness of this approach on closed information extraction, where collecting ground-truth data is challenging, and no satisfactory dataset exists to date. We synthetically generate a dataset of 1.8M data points, establish its superior quality compared to existing datasets in a human evaluation, and use it to finetune small models (220M and 770M parameters), termed SynthIE, that outperform the prior state of the art (with equal model size) by a substantial margin of 57 absolute points in micro-F1 and 79 points in macro-F1. Code, data, and models are available at https://github.com/epfl-dlab/SynthIE.
研究动机与目标
- 为了解决现有封闭式信息抽取(cIE)数据集稀缺且质量差的问题,这些数据集的标注成本高且耗时长。
- 通过利用任务不对称性,克服 LLM 在直接生成结构化输出方面的局限——即使用 LLM 从结构化输出生成自然语言,而非相反。
- 创建一个大规模、高质量且分布均匀的合成数据集,用于 cIE,以训练出泛化能力更强的小型高效模型。
- 证明通过反向提示生成的合成数据可超越真实世界数据集的质量,并在下游任务中实现最先进性能。
提出的方法
- 从 Wikidata 中采样一致的 (主语, 关系, 宾语) 三元组集合,以确保关系覆盖均衡和语义一致性。
- 使用大型语言模型(例如 GPT-3.5)生成准确表达所采样三元组集合的自然语言文本,反转典型的 cIE 方向。
- 设计一个合成数据生成流程,通过验证生成的文本仅包含预期事实且无多余三元组,确保高忠实度。
- 在合成数据集上微调小型 T5 基模型(Flan-T5),构建专为 cIE 优化的 SynthIE 模型。
- 采用多阶段人工评估验证数据质量,测量生成文本中目标事实的精确率、召回率和覆盖度。
- 使用 REBEL Clean 作为基准比较模型性能,通过真实标注和模型预测仔细估算真正例数量。
实验结果
研究问题
- RQ1当直接生成失败时,大语言模型能否有效用于生成结构化预测任务的高质量合成训练数据?
- RQ2反转任务——从结构化输出生成自然语言——是否能产生比直接生成更忠实、更高质量的数据?
- RQ3具有受控分布特性的合成数据(例如关系频率均匀)是否能带来比分布倾斜的真实世界数据更好的模型泛化能力?
- RQ4在封闭式信息抽取中,基于合成数据微调的小型模型在多大程度上能超越在现有真实世界数据集上训练的模型?
主要发现
- SynthIE 生成的合成数据集包含 180 万条高质量数据点,其中仅 15% 的信息在文本中缺失,22% 的三元组未在文本中表达,显著优于 REBEL 的 70% 和 45%。
- 人工评估证实,合成数据的质量明显高于 REBEL 数据集,一致性与事实覆盖度均有提升。
- 在 Wiki-cIE Text 测试集上,微调合成数据的 SynthIE 模型在 micro-F1 上比之前最先进方法高出 57 个百分点,在 macro-F1 上高出 79 个百分点。
- 在 REBEL Clean 上,SynthIE 的 macro-F1 超过了原始 REBEL Gold 标注,表明合成数据可超越人工标注基线的质量。
- 该方法实现了对训练数据中关系分布的完全控制,缓解了现有数据集中存在的长尾问题。
- 该方法可扩展且成本效益高,无需昂贵的人工标注即可实现大规模数据生成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。