[論文レビュー] NeedleBench: Evaluating LLM Retrieval and Reasoning Across Varying Information Densities
NeedleBenchは、4k〜100万トークン以上の複数の長さと深さをカバーし、二か国語(英語/中国語)の文脈における検索と推論に焦点を当てた、長文脈LLMを評価する包括的なベンチマークを導入する。Ancestral Trace Challenge(ATC)を提案し、複数段階の論理的推論をテストすることで、最新のモデルですら長文脈における複雑な推論に対して顕著な困難を示していることが明らかになった。
The capability of large language models to handle long-context information is crucial across various real-world applications. Existing evaluation methods often rely either on real-world long texts, making it difficult to exclude the influence of models' inherent knowledge, or introduce irrelevant filler content to artificially achieve target lengths, reducing assessment effectiveness. To address these limitations, we introduce NeedleBench, a synthetic framework for assessing retrieval and reasoning performance in bilingual long-context tasks with adaptive context lengths. NeedleBench systematically embeds key data points at varying depths to rigorously test model capabilities. Tasks are categorized into two scenarios: information-sparse, featuring minimal relevant details within extensive irrelevant text to simulate simple retrieval tasks; and information-dense (the Ancestral Trace Challenge), where relevant information is continuously distributed throughout the context to simulate complex reasoning tasks. Our experiments reveal that although recent reasoning models like Deepseek-R1 and OpenAI's o3 excel in mathematical reasoning, they struggle with continuous retrieval and reasoning in information-dense scenarios, even at shorter context lengths. We also characterize a phenomenon termed 'under-thinking', where models prematurely conclude reasoning despite available information. NeedleBench thus provides critical insights and targeted tools essential for evaluating and improving LLMs' long-context capabilities. All resources are available at OpenCompass: https://github.com/open-compass/opencompass.
研究の動機と目的
- 現存する長文脈評価ベンチマークと、複数段階の推論と情報統合を要する実世界のタスクとの間の不一致を是正すること。
- 多様な文脈長さと深さゾーンにわたる段階的評価を可能にするスケーラブルでカスタマイズ可能なベンチマークフレームワークの開発。
- 長文脈シナリオにおける実世界の複雑な推論タスクの代理としてのAncestral Trace Challenge(ATC)の導入。
- 特に高複雑度の推論条件下における、先端のオープンソースLLMの二か国語(英語/中国語)における長文脈理解能力の評価。
- 現在のモデルの命令従いの能力、プロンプト感受性、および長文脈設定における推論の頑健性に関する重要な制限の同定。
提案手法
- 4k、8k、32k、128k、200k、100万、それ以上という複数の長さの文脈に、戦略的に埋め込まれた「ニードル」(重要な情報ポイント)を有するマルチ長さ・マルチ深さのベンチマークフレームワークを設計。
- 複雑な長文脈推論の簡易的代理としてのAncestral Trace Challenge(ATC)を実装し、複数に散らばった事実間の論理的依存関係を追跡する能力を要件とする。
- プロンプトの配置(文脈の前後)を変化させた制御実験を実施し、モデルの感受性と命令従いの行動を評価。
- 必要なキーポイント数を増加させたマルチニードルタスクにおける検索性能を評価し、推論と記憶想起の頑健性をテスト。
- 長文脈能力の両言語評価を保証するため、英語および中国語のデータセットを用いる。
- 異なる文脈長さとプロンプト配置におけるモデル行動を分析し、性能低下のパターンと感受性の問題を同定。

実験結果
リサーチクエスチョン
- RQ1100万トークンの文脈から、深く埋め込まれた1つのキーファクトを、現在のLLMが信頼性を持って検索できるか?
- RQ2必要な検索ポイントの数が、マルチニードル推論タスクにおけるモデルのパフォーマンスにどのように影響するか?
- RQ3質問プロンプトを文脈の前後に配置することで、モデルのパフォーマンスに顕著な差が生じるか?
- RQ4モデルは、単純な検索を越えて、特に複雑で複数段階の論理的シナリオにおいて、推論能力を一般化できるか?
- RQ5実世界の長文脈アプリケーションにおいて、長文脈LLMはプロンプトの配置や表現にどれほど感受性を示すか?
主な発見
- すべての先端オープンソースLLMが、2000トークン未満の文脈長でもAncestral Trace Challenge(ATC)で顕著なパフォーマンス低下を示しており、複数段階の推論における根本的な弱みが明らかになった。
- より多くのニードルを検索するように求められた際、初期のニードルの記録性能が逆に向上するという逆説的傾向が観察され、命令従いの頑健性の欠如と、検索能力の一貫性の欠如が示唆された。
- プロンプトの配置が顕著な影響を与える:質問を文脈の前に置くと一般的にパフォーマンスが低下するが、InternLM2-7B-200Kのような一部のモデルは特定のタスクで早期プロンプトの恩恵を受ける。
- 検索タスクにおけるモデルのパフォーマンスは、推論タスクへの一般化ができないことが判明し、孤立した事実特定と統合的論理推論の間には重要なギャップがあることが浮き彫りになった。
- 現在のモデルは、実世界の長文脈設定において、プロンプトの配置や表現に極めて感受性を示しており、長文脈推論における頑健性の欠如が明らかになった。
- 基本的なパスキー形式の検索では高いパフォーマンスを示すが、複雑な複数事実の推論タスクでは失敗しており、長文脈能力が実用的で現実世界の応用にはまだ十分ではないことが判明した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。