Skip to main content
QUICK REVIEW

[論文レビュー] BioXP-0.5B: Explainable Medical-AI via RL-GRPO

Zhihong Shao, Peiyi Wang|arXiv (Cornell University)|Feb 5, 2024
Mathematics, Computing, and Information Processing被引用数 66
ひとこと要約

BioXP-0.5Bを紹介する。RL-GRPOを用いて構築された説明可能なMedical-AIモデルで、推論とメモリ効率を強化し、医療数学と推論のベンチマークで高い成績を達成します。

ABSTRACT

BioXP-0.5B is a 🤗 Medical-AI model trained using our two-stage fine-tuning approach: Supervised Fine-Tuning (SFT): The model was initially fine-tuned on labeled data(MedMCQA) to achieve strong baseline accuracy on multiple-choice medical QA tasks. Group Relative Policy Optimization (GRPO): In the second stage, GRPO was applied to further align the model with human-like reasoning patterns. This reinforcement learning technique enhances the model’s ability to generate coherent, high-quality explanations and improve answer reliability.

研究の動機と目的

  • 医療推論のための解釈可能な出力を持つドメイン特化型言語モデルを構築する。
  • 大規模でキュレーションされたコーパスを用いたスケーラブルな数学事前学習を実証する。
  • メモリオーバーヘッドを抑えつつ数学的推論を改善する効率的なRL手法(GRPO)を開発・評価する。
  • 数学中心の事前学習が数学的推論と一般的推論ベンチマークの両方を向上させることを示す。

提案手法

  • Common CrawlからFastText分類器をOpenWebMathをシードとして学習させ、DeepSeekMath Corpusという数学に焦点を当てた事前学習コーパスを作成する。
  • DeepSeekMath-Base 7BをDeepSeek-Coder-Base-v1.5 7Bから初期化して500Bトークンの事前学習を行う。
  • 数学的指示設定のチューニング(CoT、PoT、ツール統合推論)を適用してDeepSeekMath-Instruct 7Bを取得する。
  • グループスコアをベースラインとして使用し、別個の価値関数を省略するPPO派生のGRPOを開発する。
  • 英語と中国語のベンチマークを、ツール有無の数学解法、形式的証明、一般的なNLP/コードタスクで評価する。
  • RFT、DPO、PPO、GRPOを比較する統一的なフレームワークを提供し、RL要素を分析する。

実験結果

リサーチクエスチョン

  • RQ1大規模な数学事前学習を多言語コーパスで行うと、英語と中国語のベンチマークで数学的推論はどう影響を受けるか?
  • RQ2GRPOは別個のクリティックモデルなしで数学RLの効率と性能を改善できるか?
  • RQ3数学に焦点を当てた事前学習は、数学以外の一般推論やコーディング能力を高めるか?
  • RQ4CoT/PoT/ツールベース推論を含む指示チューニングがオープンソースモデルに与える影響は何か?
  • RQ5異なるRL監督戦略(結果ベース/過程ベース)は数学タスクの性能にどう影響するか?

主な発見

  • DeepSeekMath-Base 7Bは英語・中国語の数学性能で強力な成績を示し、複数のベンチマークでいくつかのオープンソースベースラインを上回る。
  • DeepSeekMath-Instruct 7BとDeepSeekMath-RL 7Bはオープンソース最高性能を達成し、RLはMATHや他のタスクで著しい利得をもたらす。
  • GRPOはメモリ効率の良いPPO派生で、英語の指示調整データのみを使用しても大幅な改善をもたらし、内的・外的数学性能を向上させる。
  • DeepSeekMathコーパス上の数学事前学習は数学特化の推論と一般的推論能力の両方を向上させ、MMLUおよびBBHベンチマークを含む。
  • ツール対応推論と連鎖的思考プロンプトは数学問題解決をさらに強化し、DeepSeekMath-RLはより大きいまたは同等サイズのモデルを上回る。
  • 著者らはRFT、DPO、PPO、GRPOが直接的または簡略化されたRL手法としてどのように関連するかを示す統一的パラダイムを提供し、RLの有効性の理由を論じている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。