[论文解读] NeedleBench: Evaluating LLM Retrieval and Reasoning Across Varying Information Densities
NeedleBench 提出了一项全面的基准测试,用于评估长上下文大语言模型在多种长度(4k 至 100万+ token)和深度下的表现,重点关注双语(英语/中文)环境下的信息检索与推理能力。该研究提出‘祖先轨迹挑战’(ATC)以测试多步逻辑推理能力,揭示即使最先进的模型在长上下文中的复杂推理任务上仍存在显著困难,尽管其在基础检索任务上表现良好。
The capability of large language models to handle long-context information is crucial across various real-world applications. Existing evaluation methods often rely either on real-world long texts, making it difficult to exclude the influence of models' inherent knowledge, or introduce irrelevant filler content to artificially achieve target lengths, reducing assessment effectiveness. To address these limitations, we introduce NeedleBench, a synthetic framework for assessing retrieval and reasoning performance in bilingual long-context tasks with adaptive context lengths. NeedleBench systematically embeds key data points at varying depths to rigorously test model capabilities. Tasks are categorized into two scenarios: information-sparse, featuring minimal relevant details within extensive irrelevant text to simulate simple retrieval tasks; and information-dense (the Ancestral Trace Challenge), where relevant information is continuously distributed throughout the context to simulate complex reasoning tasks. Our experiments reveal that although recent reasoning models like Deepseek-R1 and OpenAI's o3 excel in mathematical reasoning, they struggle with continuous retrieval and reasoning in information-dense scenarios, even at shorter context lengths. We also characterize a phenomenon termed 'under-thinking', where models prematurely conclude reasoning despite available information. NeedleBench thus provides critical insights and targeted tools essential for evaluating and improving LLMs' long-context capabilities. All resources are available at OpenCompass: https://github.com/open-compass/opencompass.
研究动机与目标
- 解决现有长上下文评估基准与真实世界任务之间存在的错配问题,后者需要多步推理与信息整合。
- 开发一个可扩展、可定制的基准测试框架,支持在多样化上下文长度和深度区域中的渐进式评估。
- 引入‘祖先轨迹挑战’(ATC)作为长上下文场景中真实世界复杂推理任务的简化代理。
- 评估领先开源大语言模型在双语(英语/中文)长上下文理解中的表现,特别是在高复杂度推理条件下的表现。
- 识别当前模型在指令遵循、提示敏感性以及长上下文设置下推理鲁棒性方面的关键局限。
提出的方法
- 设计一个多长度、多深度的基准测试框架,在 4k、8k、32k、128k、200k、1M 及以上 token 的上下文中战略性地插入‘针头’(关键信息点)。
- 将‘祖先轨迹挑战’(ATC)作为复杂长上下文推理的简化代理,要求模型在多个分散的事实之间追踪逻辑依赖关系。
- 通过控制实验,改变提示位置(在上下文之前或之后),评估模型对提示的敏感性及指令遵循行为。
- 在多针头任务中,逐步增加所需关键信息点的数量,以测试模型的推理与回忆鲁棒性。
- 使用双语数据集(英语和中文)以确保对长上下文能力的跨语言评估。
- 分析模型在不同上下文长度和提示位置下的行为,识别性能下降模式与敏感性问题。

实验结果
研究问题
- RQ1当前的大语言模型能否可靠地从 100万 token 的上下文中检索出一个深嵌入的关键事实?
- RQ2所需检索点数量的增加如何影响模型在多针头推理任务中的表现?
- RQ3将问题提示置于长上下文之前或之后,是否显著改变模型的表现?
- RQ4模型在复杂、多步逻辑场景中,其推理能力在多大程度上能泛化到简单检索之外?
- RQ5在真实世界的长上下文应用中,长上下文大语言模型对提示位置和指令表述方式的敏感程度如何?
主要发现
- 所有领先的开源大语言模型在‘祖先轨迹挑战’(ATC)中均表现出显著的性能下降,即使在上下文长度低于 2K token 时也是如此,表明其在多步推理方面存在根本性缺陷。
- 当要求检索更多针头时,模型在初始针头召回率上反而出现悖论性提升,表明其指令遵循能力薄弱,且对检索能力的利用不一致。
- 提示位置具有显著影响:将问题提示置于上下文之前通常会降低性能,尽管某些模型如 InternLM2-7B-200K 在特定任务中受益于早期提示。
- 模型在检索任务中的表现无法泛化到推理任务,凸显了孤立的事实查找与集成逻辑推理之间的关键差距。
- 当前模型对提示位置和表述方式高度敏感,表明在真实世界条件下,其长上下文推理能力缺乏鲁棒性。
- 尽管在基本的 passkey 风格检索任务中表现良好,模型在复杂、多事实推理任务中仍会失败,揭示长上下文能力尚不足以支持实际、真实世界的应用。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。