[论文解读] MUFFIN: Curating Multi-Faceted Instructions for Improving Instruction-Following
本文提出了 Muffin,一种新颖的指令遵循数据集构建范式,称为按输入扩展任务(Scaling Tasks per Input),通过为每个输入生成多样化、多方面视角的指令,提升大语言模型(LLM)的指令遵循能力。通过结合面向输入方面特征的指令头脑风暴与指令匹配机制,Muffin 提升了模型的鲁棒性与泛化能力,在 3B 和 11B 参数模型上,于四个零样本基准测试中均优于 Scaling-Inputs 和 Scaling Input-Free Tasks 方案。
In the realm of large language models (LLMs), enhancing instruction-following capability often involves curating expansive training data. This is achieved through two primary schemes: i) Scaling-Inputs: Amplifying (input, output) pairs per task instruction, aiming for better instruction adherence. ii) Scaling Input-Free Tasks: Enlarging tasks, each composed of an (instruction, output) pair (without requiring a separate input anymore). However, LLMs under Scaling-Inputs tend to be overly sensitive to inputs, leading to misinterpretation or non-compliance with instructions. Conversely, Scaling Input-Free Tasks demands a substantial number of tasks but is less effective in instruction following when dealing with instances in Scaling-Inputs. This work introduces MUFFIN, a new scheme of instruction-following dataset curation. Specifically, we automatically Scale Tasks per Input by diversifying these tasks with various input facets. Experimental results across four zero-shot benchmarks, spanning both Scaling-Inputs and Scaling Input-Free Tasks schemes, reveal that LLMs, at various scales, trained on MUFFIN generally demonstrate superior instruction-following capabilities compared to those trained on the two aforementioned schemes.
研究动机与目标
- 为解决现有指令遵循数据集构建方案(Scaling-Inputs 与 Scaling Input-Free Tasks)的局限性,提出一种新范式以增强指令遵循能力。
- 通过在每个输入上多样化指令类型,减少模型对输入变化的过度依赖,提升泛化能力并降低敏感性。
- 在指令数据集中平衡分类与生成任务,此类数据集通常偏向于生成任务。
- 开发一种可扩展的自动化框架,基于输入方面特征生成多样化且相关的指令。
- 证明在 Muffin 上进行微调的大语言模型可在多个基准测试中实现更优的指令遵循性能。
提出的方法
- 提出一种新的数据集构建范式:按输入扩展任务(Scaling Tasks per Input),即为每个输入生成多个多样化指令,而非扩展输入-输出对或依赖无输入任务。
- 引入“指令头脑风暴”(Instruction Brainstorm)——一种基于大语言模型的方法,可识别输入的多个文本方面特征,并以每个方面作为提示生成相关指令。
- 实施“指令重匹配”(Instruction Rematching)——一种检索与过滤流水线,重用现有数据集中高质量的指令,并通过大语言模型进行相关性评分与输出生成,将指令匹配至相关输入。
- 应用平衡策略以扩展被低估的分类任务,确保分类与生成任务在数据集中分布更均衡。
- 构建 Muffin 数据集,这是首个符合“按输入扩展任务”范式的数据集,包含多样化、与输入紧密相关的指令-输出对。
- 在 Muffin 上微调 3B 和 11B 参数的大语言模型,并在四个零样本基准测试(SuperNI-Test、MMLU、T0-Eval 和 BBH)上进行评估。
实验结果
研究问题
- RQ1一种通过在每个输入上多样化指令的新数据集构建方案,是否能提升大语言模型的指令遵循能力?
- RQ2与 Scaling-Inputs 和 Scaling Input-Free Tasks 相比,按输入扩展任务范式在零样本泛化能力方面表现如何?
- RQ3面向输入方面的指令生成在多大程度上提升了指令-输入的相关性与任务多样性?
- RQ4在指令数据集中平衡分类与生成任务,是否能提升模型在多样化基准测试中的性能?
- RQ5自动化指令合成与匹配方法能否大规模生成高质量、多样化的指令集合?
主要发现
- 在 Muffin 上微调的大语言模型在四个零样本基准测试中的三个(SuperNI-Test、MMLU 和 BBH)上优于在 Scaling-Inputs 和 Scaling Input-Free Tasks 上微调的模型。
- 在 T0-Eval 基准测试中,Muffin 微调的模型在因果推理与自然语言蕴含任务中表现最佳,相比 Self-Instruct 提升 4.5%,相比 Unnatural Instruct 提升 3.2%。
- 人工评估确认,Muffin 生成的输出与指令更一致,尤其在涉及否定、修改与摘要等复杂指令遵循场景中表现更优。
- Muffin 数据集包含 12,800 个多样化指令-输出对,其中 42% 为分类任务,58% 为生成任务,相比以往偏向生成任务的数据集,实现了更均衡的分布。
- 在错误检测与单词排序任务中,Muffin 微调的模型准确率达到 92%,优于 Self-Instruct(87%)与 Unnatural Instruct(85%)在 BBH 上的表现。
- 基于输入方面的指令头脑风暴方法相比基线指令生成,使指令多样性提升了 58%,且 89% 的生成指令被人工标注者判定为相关。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。