[论文解读] OffSeeker: Online Reinforcement Learning Is Not All You Need for Deep Research Agents
OffSeeker 显示完全离线训练(SFT + DPO)可以匹配或超越在线强化学习系统在深度研究代理上的表现,得益于开源的 DeepForge 数据套件和 8B 参数模型。
Deep research agents have shown remarkable potential in handling long-horizon tasks. However, state-of-the-art performance typically relies on online reinforcement learning (RL), which is financially expensive due to extensive API calls. While offline training offers a more efficient alternative, its progress is hindered by the scarcity of high-quality research trajectories. In this paper, we demonstrate that expensive online reinforcement learning is not all you need to build powerful research agents. To bridge this gap, we introduce a fully open-source suite designed for effective offline training. Our core contributions include DeepForge, a ready-to-use task synthesis framework that generates large-scale research queries without heavy preprocessing; and a curated collection of 66k QA pairs, 33k SFT trajectories, and 21k DPO pairs. Leveraging these resources, we train OffSeeker (8B), a model developed entirely offline. Extensive evaluations across six benchmarks show that OffSeeker not only leads among similar-sized agents but also remains competitive with 30B-parameter systems trained via heavy online RL.
研究动机与目标
- 通过提供一个开放的综合框架(DeepForge)来解决深度研究代理开发中的数据与成本障碍。
- 发布一个大规模的开放数据集以支持离线训练(QA 对、SFT 轨迹、DPO 对)。
- 证明一个离线训练的 8B 参数模型(OffSeeker)能够在深度研究基准上取得有竞争力的表现。
- 量化在线 RL 的成本并显示离线训练在成本更低、可重复性更高的情况下也能取得显著结果。
提出的方法
- 将 DeepForge 引入为一个端到端、轻量级的管线,通过真实世界的网页交互来合成大规模的深度研究任务。
- 创建 DeepForge-QA,以生成 66k 个具有真实答案的多步深度检索问题。
- 收集 33k 条 SFT 轨迹和 21k 对 DPO 偏好对,用于离线训练。
- 使用完全离线的监督微调对 OffSeeker(8B)进行训练,随后进行离线 Direct Preference Optimization(DPO)。
- 在六个深度研究基准(GAIA、BrowseComp、HLE、XBench-DeepSearch、WebWalkerQA)上进行评估,使用 pass@1 结合 LLM 评审。
- 分析上下文窗口大小、模型规模以及数据质量对离线性能的影响。

实验结果
研究问题
- RQ1离线训练(SFT + DPO)是否能在标准基准上达到或超过深度研究代理的在线 RL 表现?
- RQ2数据综合质量(通过 DeepForge)如何影响离线学习结果?
- RQ3对需要长时远距离推理的深度研究任务而言,上下文窗口大小的影响是什么?
- RQ4用高质量离线数据训练的较小离线模型是否能推广到更广泛的深度研究任务?
主要发现
- OffSeeker 在相当规模的代理中取得顶级表现,并且可与使用在线 RL 训练的 30B 参数系统相媲美。
- 使用 SFT + DPO 的离线训练在各基准上持续带来提升(GAIA、BrowseComp-zh、BrowseComp-en、HLE、XBench-DeepSearch、WebWalkerQA)。
- 离线方法的训练成本几乎为零,避免了与在线 RL 相关的 API 成本和速率限制风险。
- OffSeeker-8B(DPO)在 BrowseComp-zh 上达到 26.6,在 WebWalkerQA 上达到 61.7,接近更大规模的在线 RL 系统。
- DeepForge 的数据质量使学习更高效:更大的 SFT 数据集提升准确性,离线数据与训练规模呈正相关。
- 上下文窗口大小对性能有显著影响,较大上下文在复杂的多跳任务上带来显著提升。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。