[论文解读] BAMBOO: A Comprehensive Benchmark for Evaluating Long Text Modeling Capacities of Large Language Models
BAMBOO 是一个全面的多任务基准,旨在评估大语言模型(LLMs)在五项不同任务——问答、幻觉检测、文本排序、语言建模和代码补全——上的长文本建模能力,涵盖两种长度级别(4k 和 16k token)。该基准解决了数据污染和评估准确性问题,揭示当前 LLM 在长上下文推理、指令遵循和不熟悉任务方面表现不佳,长输入下性能下降,且在微调领域之外泛化能力有限。
Large language models (LLMs) have achieved dramatic proficiency over NLP tasks with normal length. Recently, multiple studies have committed to extending the context length and enhancing the long text modeling capabilities of LLMs. To comprehensively evaluate the long context ability of LLMs, we propose BAMBOO, a multi-task long context benchmark. BAMBOO has been designed with four principles: comprehensive capacity evaluation, avoidance of data contamination, accurate automatic evaluation, and different length levels. It consists of 10 datasets from 5 different long text understanding tasks, i.e. question answering, hallucination detection, text sorting, language modeling, and code completion, to cover core capacities and various domains of LLMs. We conduct experiments with five long context models on BAMBOO and further discuss four key research questions of long text. We also qualitatively analyze current long context models and point out future directions for enhancing long text modeling capacities. We release our data, prompts, and code at https://github.com/RUCAIBox/BAMBOO.
研究动机与目标
- 为评估长上下文 LLM 提供可靠、无污染且可自动评估的基准。
- 全面评估 LLM 在多样化领域中长距离依赖建模、知识利用、推理和工具使用方面的能力。
- 识别长上下文建模中的关键挑战,包括指令遗忘、格式错误和推理能力差,尤其是在不熟悉任务中。
- 提供一个标准化、可复现的评估框架,以支持未来长上下文 LLM 的研究发展。
提出的方法
- BAMBOO 从五个核心任务——问答、幻觉检测、文本排序、语言建模和代码补全——构建了 10 个数据集,每个数据集旨在测试不同的长上下文能力。
- 数据集来源于 2023 年发布的资源,以防止数据污染,确保评估的完整性。
- 该基准包含两个长度级别:BAMBOO-4k(平均 2310 个 token)和 BAMBOO-16k(平均 6586 个 token),支持对长度相关性能的分析。
- 精心选择自动评估指标以确保准确性和可复现性,避免依赖人工标注。
- 对普通 LLM(如 ChatGPT、Vicuna)应用上下文压缩技术,以与原生长上下文模型进行性能对比。
- 对指令遗忘、格式错误、推理失败以及罕见任务上的表现进行定性分析。
实验结果
研究问题
- RQ1当前长上下文 LLM 在多样化长文本任务中的表现如何,其主要故障模式是什么?
- RQ2输入长度在多大程度上影响模型性能,是否存在一种‘扩展税’,即长上下文适配损害了短上下文性能?
- RQ3任务指令在长输入中的位置如何影响模型的遵循程度和性能?
- RQ4上下文压缩技术是否能有效提升标准 LLM 在长上下文任务中的表现?
- RQ5为何 LLM 即使在提供正确信息的情况下,仍会在非标准任务(如文本排序和代码补全)上表现不佳?
主要发现
- ChatGPT-16k 在大多数 BAMBOO 数据集上表现最佳,而其他模型(包括微调变体)在不熟悉任务上表现出显著的性能下降。
- 性能通常随输入长度增加而下降,表明存在一种‘扩展税’,即长上下文适配损害了短输入或简单输入上的性能。
- 当指令位于长输入开头时,尤其在小型模型中,会出现灾难性遗忘,原因是指令保留不足。
- 上下文压缩技术在部分任务(如 MeetingPred)上提升了性能,但在其他任务(如 SenHallu)上常导致结果下降,表明信息保留存在权衡。
- 即使提供了正确的证据,模型仍表现出较差的推理能力,表明推理限制——而非上下文长度——是主要瓶颈。
- 开源模型在非对话、非问答类任务(如文本排序和代码补全)上表现较差,原因是微调数据分布过于狭窄。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。