[论文解读] Let Me Speak Freely? A Study on the Impact of Format Restrictions on Performance of Large Language Models
本研究探讨了格式限制(如 JSON、XML 和 YAML)对大型语言模型(LLMs)性能的影响。研究发现,受限生成显著降低了模型的推理能力,且格式越严格,性能下降越明显。为此,研究提出了一种宽松的提示策略,以在保持格式一致性的同时维持高性能。
Structured generation, the process of producing content in standardized formats like JSON and XML, is widely utilized in real-world applications to extract key output information from large language models (LLMs). This study investigates whether such constraints on generation space impact LLMs abilities, including reasoning and domain knowledge comprehension. Specifically, we evaluate LLMs performance when restricted to adhere to structured formats versus generating free-form responses across various common tasks. Surprisingly, we observe a significant decline in LLMs reasoning abilities under format restrictions. Furthermore, we find that stricter format constraints generally lead to greater performance degradation in reasoning tasks.
研究动机与目标
- 探究在结构化生成中施加格式限制是否会导致 LLM 在推理和知识任务中的性能下降。
- 比较不同结构化生成方法的影响:受限解码(JSON 模式)、格式限制指令(FRI)以及自然语言到格式的提示。
- 识别在格式约束下性能下降的根本原因,并提出缓解策略。
- 为格式遵循与模型质量之间的权衡关系提供跨多种任务和 LLM 的实证证据。
提出的方法
- 通过 API 标志应用受限解码(JSON 模式),在生成过程中强制输出有效 JSON。
- 格式限制指令(FRI)通过显式格式约束,指导 LLM 以特定格式(如 JSON、XML、YAML)生成响应。
- 自然语言到格式的提示通过先生成自然语言内容,再将其转换为目标模式,实现内容生成与格式化的解耦。
- 在多个数据集(包括 GSM8K、Last Letter、Shuffled Objects、DDXPlus、Sports、Task280 和 MultiFin)上使用零 shot 提示。
- 使用标准指标(准确率、F1)进行性能评估,并在多次运行中报告统计结果(含标准差)。
- 测试的模型包括 GPT-3.5-turbo、Gemini 1.5 Flash、Claude 3 Haiku、LLaMA 3 8B 和 Gemma2-9B-IT,涵盖推理和分类任务。

实验结果
研究问题
- RQ1将 LLM 限制在 JSON、XML 或 YAML 等结构化格式中是否会降低其推理性能?
- RQ2格式约束的严格程度如何影响不同任务中的模型性能?
- RQ3在格式限制下性能下降的根本原因是什么?
- RQ4宽松提示策略是否能在保持结构化输出的同时维持高性能?
主要发现
- GPT-3.5-turbo 在 GSM8K 任务中的准确率从自然语言生成的 76.60% 下降至 JSON 模式下的 49.25%,表明性能下降了 27.35 个百分点。
- Gemini 1.5 Flash 在 Last Letter 任务中的准确率从自然语言生成的 65.45% 下降至 JSON 模式下的 77.02%,下降了 20.12 个百分点,但此结果在整体趋势中属异常值。
- LLaMA 3 8B 在 GSM8K 任务中的得分从自然语言生成的 74.73% 下降至 JSON 模式下的 48.90%,性能下降了 25.83 个百分点。
- 自然语言到格式的提示在推理任务中始终优于 FRI 和 JSON 模式,所有模型的平均准确率最高。
- 在分类任务中,部分模型(如 Gemini 1.5 Flash 在 DDXPlus 上)的 JSON 模式表现优于自然语言生成,但该现象并非在所有模型和任务中一致。
- YAML 格式在推理任务中表现出最高的方差和最差性能,LLaMA 3 8B 在 Shuffled Objects 任务中仅取得 9.57% 的准确率。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。