Skip to main content
QUICK REVIEW

[논문 리뷰] SemiReward: A General Reward Model for Semi-supervised Learning

Siyuan Li, Weiyang Jin|arXiv (Cornell University)|2023. 10. 04.
Advanced Statistical Methods and Models인용 수 4
한 줄 요약

SemiReward는 반감독 학습에서 확인 편향을 완화하기 위해 생성자와 보상자 네트워크를 사용하는 이중 단계 학습 파이프라인을 통해 고품질의 가짜 레이블을 평가하고 필터링할 수 있는 일반적이고 플러그인 방식의 보상 모델을 제안한다. 이는 시각, 자연어 처리, 오디오 작업을 포함하는 13개의 다양한 SSL 벤치마크에서 상당한 성능 향상과 더 빠른 수렴을 달성하며, Pseudo Label, FlexMatch, Free/SoftMatch와 같은 최신 기술들을 능가한다.

ABSTRACT

Semi-supervised learning (SSL) has witnessed great progress with various improvements in the self-training framework with pseudo labeling. The main challenge is how to distinguish high-quality pseudo labels against the confirmation bias. However, existing pseudo-label selection strategies are limited to pre-defined schemes or complex hand-crafted policies specially designed for classification, failing to achieve high-quality labels, fast convergence, and task versatility simultaneously. To these ends, we propose a Semi-supervised Reward framework (SemiReward) that predicts reward scores to evaluate and filter out high-quality pseudo labels, which is pluggable to mainstream SSL methods in wide task types and scenarios. To mitigate confirmation bias, SemiReward is trained online in two stages with a generator model and subsampling strategy. With classification and regression tasks on 13 standard SSL benchmarks across three modalities, extensive experiments verify that SemiReward achieves significant performance gains and faster convergence speeds upon Pseudo Label, FlexMatch, and Free/SoftMatch. Code and models are available at https://github.com/Westlake-AI/SemiReward.

연구 동기 및 목표

  • 낮은 품질의 가짜 레이블로 인해 발생하는 확인 편향 문제를 해결하기 위해.
  • 수작업 또는 작업에 특화된 정책에 의존하지 않고도 고품질의 가짜 레이블을 선택할 수 있는 일반적이고 작업에 관계없는 방법을 개발하기 위해.
  • 분류 및 회귀 작업을 포함한 다양한 모odal 및 작업에서 반감독 학습에서의 수렴 속도 향상과 일관된 성능 향상을 보장하기 위해.
  • 기존의 SSL 방법과 원활하게 통합될 수 있는 경량이며 플러그인 방식의 프레임워크를 설계하기 위해.
  • 이중 단계 파이프라인과 생성자 네트워크를 사용하여 최소한의 계산 부담으로 온라인으로 보상 모델을 훈련시키기 위해.

제안 방법

  • 보상자 네트워크는 가짜 레이블과 진짜 레이블 간의 코사인 유사도를 기반으로 매끄럽고 잘 校정된 보상 점수를 예측하도록 훈련된다.
  • 보상자는 두 단계로 훈련된다: 첫 번째로 생성자에 의해 '가짜 레이블'을 생성하는 데 사용되는 라벨된 데이터를 기반으로 사전 훈련하고, 두 번째로 라벨된 데이터와 선택된 무라벨 데이터의 부분 집합을 기반으로 미세 조정한다.
  • 사전 훈련 단계에서 생성자 네트워크가 합성 가짜 레이블을 생성하여 보상자 훈련을 학생 모델에서 분리하고 확인 편향을 줄인다.
  • 보상자는 진짜 보상 점수를 회귀 손실을 사용하여 예측하도록 훈련되어 보다 校정되고 신뢰할 수 있는 레이블 필터링을 보장한다.
  • 프레임워크는 플러그 앤 플레이 방식이며, Pseudo Label, FlexMatch, Free/SoftMatch와 같은 주류 SSL 방법과 호환된다.
  • 2단계에서 샘플링 전략을 적용하여 낮은 품질의 가짜 레이블을 예측된 보상 점수에 기반해 필터링하면서도 높은 샘플링 비율을 유지한다.

실험 결과

연구 질문

  • RQ1가짜 레이블과 진짜 레이블 간의 코사인 유사도를 기반으로 학습된 보상 점수는 분류 및 회귀 작업 모두에서 가짜 레이블 품질을 위한 신뢰할 수 있고 일반적인 지표로 기능할 수 있는가?
  • RQ2자기 훈련 기반의 반감독 학습에서 확인 편향을 피하면서도 최소한의 계산 비용으로 온라인으로 보상 모델을 훈련할 수 있는 방법은 무엇인가?
  • RQ3플러그인 방식의 보상 모듈은 다양한 SSL 벤치마크와 모달리티에서 성능 향상과 수렴 속도 향상에 어느 정도 기여하는가?
  • RQ4생성자와 보상자 네트워크를 포함한 이중 단계 훈련 파이프라인은 보상자 훈련을 학생 모델에서 효과적으로 분리하고 일반화 능력을 향상시키는가?
  • RQ5보상자는 작업에 특화된 적응 없이도 다양한 SSL 알고리즘과 데이터셋에서 일반화 가능한가?

주요 결과

  • SemiReward는 시각, 자연어 처리, 오디오 모달리티를 포함한 13개의 표준 SSL 벤치마크에서 기준 SSL 방법보다 평균 +1.9%에서 +3.7%의 정확도 향상을 달성한다.
  • 정점 성능에 도달하는 데 필요한 학습 반복 횟수를 기준선 대비 최소 1.7배 이상 줄여 더 빠른 수렴을 보여준다.
  • 컴퓨터 비전, 자연어 처리, 오디오 데이터셋에서 SemiReward는 분류 및 회귀 작업 전반에서 Pseudo Label, FlexMatch, Free/SoftMatch와 같은 SOTA 방법을 일관되게 능가한다.
  • SemiReward가 예측한 보상 점수는 잘 校정되어 있으며, 실증 분석을 통해 고품질의 가짜 레이블을 신뢰성 있게 식별함을 입증했다.
  • 생성자와 보상자 네트워크를 포함한 이중 단계 훈련 파이프라인은 확인 편향을 효과적으로 완화하여 안정적이고 정확한 보상 모델 훈련을 가능하게 했다.
  • 프레임워크는 매우 일반화 가능하며, 아키텍처나 초모수 조정 없이도 다양한 데이터셋과 작업 유형에서 일관된 성능 향상을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.