Skip to main content
QUICK REVIEW

[논문 리뷰] BinaryPPO: Efficient Policy Optimization for Binary Classification

Punya Syon Pandey, Zhijing Jin|arXiv (Cornell University)|2026. 02. 02.
Artificial Intelligence in Healthcare and Education인용 수 0
한 줄 요약

BinaryPPO는 확신 가중 보상을 사용하는 오프라인 강화 학습 문제로 이진 분류를 재구성하여 여덟 개 도메인 벤치마크에서 지도 학습 기반 대조군 대비 큰 정확도 향상을 달성합니다.

ABSTRACT

Supervised fine-tuning (SFT) is the standard approach for binary classification tasks such as toxicity detection, factuality verification, and causal inference. However, SFT often performs poorly in real-world settings with label noise, class imbalance, or sparse supervision. We introduce BinaryPPO, an offline reinforcement learning large language model (LLM) framework that reformulates binary classification as a reward maximization problem. Our method leverages a variant of Proximal Policy Optimization (PPO) with a confidence-weighted reward function that penalizes uncertain or incorrect predictions, enabling the model to learn robust decision policies from static datasets without online interaction. Across eight domain-specific benchmarks and multiple models with differing architectures, BinaryPPO improves accuracy by 40-60 percentage points, reaching up to 99%, substantially outperforming supervised baselines. We provide an in-depth analysis of the role of reward shaping, advantage scaling, and policy stability in enabling this improvement. Overall, we demonstrate that confidence-based reward design provides a robust alternative to SFT for binary classification. Our code is available at https://github.com/psyonp/BinaryPPO.

연구 동기 및 목표

  • 동기: 이진 태스크에서 레이블 노이즈, 클래스 불균형 및 희소 감독이 지도 미세 조정에 어려움을 줍니다.
  • 목표: 모델의 확신도와 정답성을 인코딩하는 보상 신호를 최대화하여 강력한 이진 의사결정 정책을 학습합니다.
  • 범위: 독성 탐지, 사실성, 인과 추론에 걸친 여덟 개 도메인 벤치마크에서 다중 모델 구조를 대상으로 평가합니다.
  • 주장: 확신 가중 보상 설계가 온라인 상호작용 없이도 강력한 오프라인 정책 최적화를 가능하게 합니다.]
  • method:["이진 분류를 불확실성 하의 의사결정 문제로 재공식화하고 PPO의 변형으로 최적화합니다.","확률적 보상 r(x,a,y)를 모델의 확신도 via f(π_old(a|x))와 정답 신호 s(a,y)로 스케일링하여 정의합니다.","가치 네트워크 V_φ(x)를 사용해 이점 A(x,a,y)=r(x,a,y)−V_φ(x)를 계산합니다.","PPO 손실, 가치 손실, 감독식 교차 엔트로피 정규화, 탐색을 장려하는 엔트로피 정규화를 포함하는 결합 목표를 최적화합니다.","엔트로피 정규화와 동등 데이터 샘플링 제거를 포함한 정합성 연구를 수행합니다.","온라인 피드백 없이 기존 데이터세트에 적용 가능한 오프라인 학습 프레임워크를 제공합니다."]
  • research_questions:[

실험 결과

주요 결과

  • BinaryPPO는 여덟 벤치마크에 걸쳐 지도 기반 대조군에 비해 큰 정확도 개선을 달성합니다.
  • Qwen-2.5-3B와 Gemma-2-2B에서 BinaryPPO는 여러 작업에서 근사 포화 정확도(약 98–99%)에 도달합니다.
  • 엔트로피 정규화는 안정성에 필수적이며 이를 제거하면 성능이 급격히 저하하고, 동등 데이터 샘플링은 개선되지만 전체 BinaryPPO와는 차이가 있습니다.
  • BinaryPPO는 인과성 및 조정 작업에서 분포 외 일반화 성능을 보여 모델 간으로 전이 가능한 의사경계가 있음을 시사합니다.
  • 정규성 평가에서 BinaryPPO는 독성 저항성과 진실성의 보존에 크게 기여하며 데이터세트 특이적 회귀는 제한적입니다.
  • 훈련 역학은 정책 엔트로피와 KL 발산이 초기에 안정화되어 안정적인 수렴을 시사합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.