Skip to main content
QUICK REVIEW

[논문 리뷰] Two-Stage Fine-Tuning: A Novel Strategy for Learning Class-Imbalanced Data

Taha ValizadehAslani, Yiwen Shi|arXiv (Cornell University)|2022. 07. 22.
Imbalanced Data Classification Techniques인용 수 4
한 줄 요약

이 논문은 텍스트 분류에서 클래스 불균형 문제를 해결하기 위해 이중 단계 미세조정 전략을 제안한다. 여기서 최종 레이어는 표준 미세조정 이전에 클래스 균형 잡힌 재가중 손실을 사용하여 미세조정된다. 이 방법은 초기 표현 학습 동안 소수 클래스를 보호함으로써 꼬리 클래스 성능을 향상시켜 합성 및 실제 ADME 의미 레이블링 데이터셋에서 표준 및 재가중 미세조정보다 우수한 성능을 달성한다.

ABSTRACT

Classification on long-tailed distributed data is a challenging problem, which suffers from serious class-imbalance and hence poor performance on tail classes with only a few samples. Owing to this paucity of samples, learning on the tail classes is especially challenging for the fine-tuning when transferring a pretrained model to a downstream task. In this work, we present a simple modification of standard fine-tuning to cope with these challenges. Specifically, we propose a two-stage fine-tuning: we first fine-tune the final layer of the pretrained model with class-balanced reweighting loss, and then we perform the standard fine-tuning. Our modification has several benefits: (1) it leverages pretrained representations by only fine-tuning a small portion of the model parameters while keeping the rest untouched; (2) it allows the model to learn an initial representation of the specific task; and importantly (3) it protects the learning of tail classes from being at a disadvantage during the model updating. We conduct extensive experiments on synthetic datasets of both two-class and multi-class tasks of text classification as well as a real-world application to ADME (i.e., absorption, distribution, metabolism, and excretion) semantic labeling. The experimental results show that the proposed two-stage fine-tuning outperforms both fine-tuning with conventional loss and fine-tuning with a reweighting loss on the above datasets.

연구 동기 및 목표

  • 장기적 꼬리 분포를 가진 불균형 텍스트 분류 데이터셋에서 꼬리 클래스 성능이 열 劣하는 문제를 해결하기 위해.
  • 사전 훈련된 모델의 표준 미세조정 과정에서 부족하게 표현되는 클래스가 겪는 열 劣를 완화하기 위해.
  • 전체 모델을 다시 훈련하지 않고도 소수 클래스 학습을 향상시키는 단순하면서도 효과적인 표준 미세조정의 수정을 개발하기 위해.
  • 합성 및 실제 텍스트 분류 벤치마크(ADME 의미 레이블링 포함)에서 이 방법을 평가하기 위해.
  • 초기 단계에서 클래스 균형 잡힌 손실을 사용한 미세조정이 장기적 불균형 데이터 분포에서의 최종 성능을 향상시킨다는 것을 입증하기 위해.

제안 방법

  • 사전 훈련된 모델의 최종 분류 레이어를 클래스 균형 잡힌 재가중 손실을 사용하여 미세조정하여 부족한 클래스를 우선시한다.
  • 재가중 손실은 소수 클래스의 손실 기여도에 더 높은 가중치를 할당하여 그들의 희소성에 대비한다.
  • 첫 번째 단계 이후, 전체 모델은 두 번째 단계에서 표준 교차 엔트로피 손실을 사용하여 미세조정된다.
  • 첫 번째 단계 동안 나머지 모델 파라미터는 동결되어 사전 훈련된 표현을 유지한다.
  • 두 번째 단계에서는 전체 모델 용량을 활용하면서도 초기 학습이 클래스 불균형에 집중되도록 한다.
  • 이 방법은 최소한의 아키텍처 변경으로 다중 클래스 및 이중 클래스 텍스트 분류 작업에 적용된다.

실험 결과

연구 질문

  • RQ1이중 단계 미세조정 전략은 장기적 꼬리 분포를 가진 텍스트 분류 데이터셋에서 소수 클래스 성능을 향상시킬 수 있는가?
  • RQ2클래스 균형 잡힌 재가중 손실을 사용한 초기 미세조정이 표준 미세조정보다 소수 클래스에 대해 더 나은 표현 학습을 이끌 수 있는가?
  • RQ3제안된 방법은 표준 미세조정 및 재가중 손실을 사용한 미세조정과 비교할 때 꼬리 클래스 성능에서 어떻게 다를까?
  • RQ4이중 단계 전략은 합성 및 실제 텍스트 분류 작업 모두에서 클래스 불균형이 존재하는 경우에 효과적인가?
  • RQ5첫 번째 단계에서 전체 모델을 미세조정하지 않아도 이 방법이 더 나은 성능을 달성할 수 있는가?

주요 결과

  • 이중 단계 미세조정 방법은 합성 이중 클래스 및 다중 클래스 텍스트 분류 데이터셋에서 표준 미세조정 및 재가중 손실을 사용한 미세조정보다 꼬리 클래스에서 뛰어난 성능을 달성했다.
  • ADME 의미 레이블링 작업에서 제안된 방법은 소수 클래스의 F1 점수를 크게 향상시켜 실제 응용 분야에서의 효과성을 입증했다.
  • 첫 번째 단계의 재가중 손실은 초기 학습 동안 소수 클래스가 압도당하는 것을 효과적으로 방지하여 더 나은 일반화를 이끌어냈다.
  • 모델은 헤드 클래스 성능을 유지하면서도 꼬리 클래스 성능을 크게 향상시켜 클래스 분포 전반에 걸쳐 균형 잡힌 향상이 이루어졌음을 보여주었다.
  • 제거 실험을 통해 이중 단계 과정이 필수적임을 확인했으며, 첫 번째 단계를 생략할 경우 소수 클래스 성능이 악화됨을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.