Skip to main content
QUICK REVIEW

[論文レビュー] BinaryPPO: Efficient Policy Optimization for Binary Classification

Punya Syon Pandey, Zhijing Jin|arXiv (Cornell University)|Feb 2, 2026
Artificial Intelligence in Healthcare and Education被引用数 0
ひとこと要約

BinaryPPO は、信頼度加重報酬を用いたオフライン強化学習問題として二値分類を再定義し、 eight domain benchmarks に渡る監督付きベースラインより大きな精度向上を達成します。

ABSTRACT

Supervised fine-tuning (SFT) is the standard approach for binary classification tasks such as toxicity detection, factuality verification, and causal inference. However, SFT often performs poorly in real-world settings with label noise, class imbalance, or sparse supervision. We introduce BinaryPPO, an offline reinforcement learning large language model (LLM) framework that reformulates binary classification as a reward maximization problem. Our method leverages a variant of Proximal Policy Optimization (PPO) with a confidence-weighted reward function that penalizes uncertain or incorrect predictions, enabling the model to learn robust decision policies from static datasets without online interaction. Across eight domain-specific benchmarks and multiple models with differing architectures, BinaryPPO improves accuracy by 40-60 percentage points, reaching up to 99%, substantially outperforming supervised baselines. We provide an in-depth analysis of the role of reward shaping, advantage scaling, and policy stability in enabling this improvement. Overall, we demonstrate that confidence-based reward design provides a robust alternative to SFT for binary classification. Our code is available at https://github.com/psyonp/BinaryPPO.

研究の動機と目的

  • モチベーション: ラベルノイズ、クラス不均衡、二値タスクにおける sparse supervision が監督付きファインチューニングを難しくする。
  • 目的: モデルの信頼度と正確性をエンコードした報酬信号を最大化することによって頑健な二値決定ポリシーを学習する。
  • 範囲: 毒性検出、事実性、因果推論を横断する eight domain benchmarks を、複数のモデルアーキテクチャで評価する。
  • 主張: 信頼度加重報酬設計はオンライン相互作用なしに頑健なオフラインポリシー最適化を可能にする。

提案手法

  • 不確実性の下での意思決定問題として二値分類を再定式化し、PPO の変種で最適化する。
  • モデルの信頼度に応じてスケールする確率的報酬 r(x,a,y) を定義する。これは f(π_old(a|x)) と正確性信号 s(a,y) によって決まる。
  • 価値ネットワーク V_φ(x) を用いて利得 A(x,a,y)=r(x,a,y)−V_φ(x) を計算する。
  • PPO 損失、価値損失、教師付きクロスエントロピー正則化、探索を促すエントロピー正則化を含む結合目的を最適化する。
  • エントロピー正則化と等データサンプリングアブレーションを組み込み、安定性と一般化を検討する。
  • オンラインフィードバックなしで既存データセットに適用可能なオフライン訓練フレームワークを提供する。

実験結果

リサーチクエスチョン

  • RQ1信頼度加重のオフライン強化学習は、標準的な監督付きファインチューニングおよび PPO ベースラインより二値分類の精度を向上させるか。
  • RQ2報酬設計、利得スケーリング、ポリシー安定性は、ドメイン間の学習と一般化にどう影響するか。
  • RQ3BinaryPPO はタスクの精度を改善しつつ、規範的な安全性と公平性を保持するか。
  • RQ4分布シフトやクロスドメイン一般化(OOD シナリオ)に対して、モデルアーキテクチャ間で手法は堅牢か。

主な発見

  • BinaryPPO は eight benchmarks 全体で、監督ベースラインに対して大幅な精度向上を達成する。
  • Qwen-2.5-3B および Gemma-2-2B では、複数タスクでほぼ飽和に近い精度(約 98–99%)を達成する。
  • エントロピー正則化は安定性に不可欠であり、これを除くと大幅な性能崩壊を招く一方、等データサンプリングは改善をもたらすが完全な BinaryPPO には及ばない。
  • BinaryPPO は因果性およびモデレーションタスクでOOD一般化を示し、モデル間で移植可能な決定境界を示唆する。
  • 規範的評価では、BinaryPPO は毒性耐性と真実性を大きく維持し、データセット固有の退行は限定的である。
  • 訓練ダイナミクスは、ポリシーエントロピーと KL 発散が早期に安定化し、安定した収束を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。