QUICK REVIEW
[论文解读] BioXP-0.5B: Explainable Medical-AI via RL-GRPO
Zhihong Shao, Peiyi Wang|arXiv (Cornell University)|Feb 5, 2024
Mathematics, Computing, and Information Processing被引用 66
一句话总结
介绍 BioXP-0.5B,一种可解释的医学人工智能模型,采用 RL-GRPO 构建,以提升推理和记忆效率,在医学数学和推理基准上表现出色。
ABSTRACT
BioXP-0.5B is a 🤗 Medical-AI model trained using our two-stage fine-tuning approach: Supervised Fine-Tuning (SFT): The model was initially fine-tuned on labeled data(MedMCQA) to achieve strong baseline accuracy on multiple-choice medical QA tasks. Group Relative Policy Optimization (GRPO): In the second stage, GRPO was applied to further align the model with human-like reasoning patterns. This reinforcement learning technique enhances the model’s ability to generate coherent, high-quality explanations and improve answer reliability.
研究动机与目标
- 打造具可解释输出的医疗推理领域专用语言模型。
- 展示使用大型、经精心筛选的语料库进行可扩展的数学预训练。
- 开发并评估一种高效的 RL 方法(GRPO),在降低内存开销的同时提升数学推理能力。
- 证明以数学为中心的预训练能提升数学推理和一般推理基准。
提出的方法
- 从 Common Crawl 创建一个以数学为焦点的预训练语料库(DeepSeekMath Corpus),使用以 OpenWebMath 作为种子训练的 fastText 分类器。
- 以 DeepSeek-Coder-Base-v1.5 7B 初始化的 DeepSeekMath-Base 7B 为基线进行 500B tokens 的预训练。
- 应用数学指令微调(CoT、PoT、工具整合推理)以获得 DeepSeekMath-Instruct 7B。
- 开发 Group Relative Policy Optimization (GRPO),一种使用组分数作为基线且省略单独价值函数的 PPO 变体。
- 在英语和汉语基准上评估数学求解(有工具/无工具)、形式证明,以及一般的 NLU/Code 任务。
- 提供一个统一框架来比较 RFT、DPO、PPO 和 GRPO,并分析 RL 要素。
实验结果
研究问题
- RQ1在多语言语料上进行大规模数学预训练如何影响英语和中文基准上的数学推理?
- RQ2GRPO 是否能在不使用单独评估者模型的情况下提升数学强化学习的效率和性能?
- RQ3以数学为中心的预训练是否能提升超越数学之外的一般推理和编码能力?
- RQ4在开源模型上使用 CoT/PoT/工具驱动推理的指令微调有何影响?
- RQ5不同的 RL 监督策略(结果导向 vs 过程导向)对数学任务的性能有何影响?
主要发现
- DeepSeekMath-Base 7B 在英语和中文数学任务上表现出色,超越了多项基线开源模型。
- DeepSeekMath-Instruct 7B 与 DeepSeekMath-RL 7B 实现了开源模型的顶尖表现,RL 在 MATH 及其他任务上带来显著提升。
- GRPO(内存高效的 PPO 变体)仅使用英语指令微调数据就取得显著改善,提升了领域内外的数学性能。
- 在 DeepSeekMath Corpus 上的数学预训练提升了数学相关和一般推理能力,包括 MMLU 和 BBH 基准。
- 工具驱动的推理和连锁思维提示进一步提升数学问题求解,DeepSeekMath-RL 在比它大或相仿规模的模型中表现突出。
- 作者提出一个统一范式,展示 RFT、DPO、PPO 和 GRPO 如何作为直接或简化的 RL 方法相关联,并讨论 RL 有效性的原因。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。