[논문 리뷰] Calibrated Language Model Fine-Tuning for In- and Out-of-Distribution Data
이 논문은 사전 훈련된 언어 모델을 위한 정규화된 미세조정 방법을 제안하며, 데이터가 분포 내 및 분포 외(OOD)일 경우 모두 캘리브레이션을 향상시키기 위해 두 가지 새로운 정규화 기법을 사용한다: 데이터의 다양성 다각형 내에서 특성 공간의 선형 보간을 통한 온-맨폴드 정규화로 분포 내 매끄러움을 향상시키고, 큰 변형을 가한 샘플을 통한 오프-맨폴드 정규화로 OOD에 대한 과신뢰도를 감소시킨다. 이 방법은 기대 캘리브레이션 오차를 크게 감소시키며, 여섯 개의 데이터셋에서 OOD 탐지 성능을 향상시킨다.
Fine-tuned pre-trained language models can suffer from severe miscalibration for both in-distribution and out-of-distribution (OOD) data due to over-parameterization. To mitigate this issue, we propose a regularized fine-tuning method. Our method introduces two types of regularization for better calibration: (1) On-manifold regularization, which generates pseudo on-manifold samples through interpolation within the data manifold. Augmented training with these pseudo samples imposes a smoothness regularization to improve in-distribution calibration. (2) Off-manifold regularization, which encourages the model to output uniform distributions for pseudo off-manifold samples to address the over-confidence issue for OOD data. Our experiments demonstrate that the proposed method outperforms existing calibration methods for text classification in terms of expectation calibration error, misclassification detection, and OOD detection on six datasets. Our code can be found at https://github.com/Lingkai-Kong/Calibrated-BERT-Fine-Tuning.
연구 동기 및 목표
- 분포 내 및 분포 외 데이터에서 미세조정된 사전 훈련된 언어 모델의 심각한 캘리브레이션 문제를 해결하기 위해.
- 분포 내 입력에 대해 예측 확률이 진짜 가능성에 맞게 반영되도록 모델 신뢰도를 향상시키기 위해.
- 분포 외 입력에 대한 예측에서 과신뢰도를 줄이기 위해 출력 분포를 균일하게 유지하도록 유도하기 위해.
- 데이터 증강 기반 정규화를 통해 과적합을 완화하고 일반화 능력을 향상시키기 위해.
- 후처리 캘리브레이션 및 베이지안 방법보다 뛰어난 성능을 보이며, 추론 비용을 증가시키지 않는 확장 가능한 훈련 시점 솔루션을 제공하기 위해.
제안 방법
- 훈련 데이터의 히든 특성 공간에서 선형 보간을 통해 가짜 샘플을 생성함으로써 온-맨폴드 정규화를 도입한다.
- 이 보간된 샘플을 이용해 데이터 맨폴드 내에서 모델의 결정 경계에 매끄러움 제약을 부여한다.
- 데이터 맨폴드에서 멀리 떨어진 악성 유사 변형을 생성하여 오프-맨폴드 정규화를 적용함으로써 분포 외 입력에 대한 출력 확률이 균일하도록 유도한다.
- 분포 내 및 OOD 캘리브레이션을 균형 있게 유지하기 위해 교차 엔트로피 손실과 두 정규화 기법을 모두 포함한 공동 목적 함수를 최적화한다.
- 이중 단계 최적화 프로세스를 활용: 먼저 내부의 미니맥스 문제를 통해 강력한 가짜 샘플을 생성하고, 이후 정규화된 손실을 사용한 표준적인 미세조정을 수행한다.
- 두 정규화 기법의 하이퍼파rameter를 함께 튜닝하여 캘리브레이션 성능에 보완적인 효과를 확보한다.
실험 결과
연구 질문
- RQ1온-맨폴드 보간을 통한 데이터 증강이 미세조정된 언어 모델의 분포 내 캘리브레이션을 향상시킬 수 있는가?
- RQ2오프-맨폴드 정규화가 분포 외 입력에 대한 과신뢰도를 효과적으로 줄일 수 있는가?
- RQ3두 정규화 기법을 결합하면 개별 구성 요소나 기준 방법보다 더 나은 종합 캘리브레이션 성능을 달성할 수 있는가?
- RQ4온-맨폴드 및 오프-맨폴드 정규화 기법의 하이퍼파rameter는 어떻게 상호작용하며, 공동 튜닝이 필수적인가?
- RQ5이 방법은 추론 비용을 증가시키지 않으면서도 분포 내 캘리브레이션과 OOD 탐지에서 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- 제안된 방법은 20NG 15 데이터셋에서 BERT 기준선 대비 기대 캘리브레이션 오차(ECE)를 최대 60% 감소시켜 9.24%에서 3.69%로 감소시켰다.
- 20NG 데이터셋에서 OOD 탐지 AUC는 BERT 기준 21.65%에서 두 정규화 기법을 모두 적용한 후 63.92%로 향상되어 강력한 OOD 일반화 능력을 입증했다.
- 오프-맨폴드 정규화를 제거하면 OOD AUC가 63.92%에서 43.87%로 20.05% 감소하여, 이 기법이 OOD 캘리브레이션에서 핵심적인 역할을 한다는 것을 입증했다.
- 온-맨폴드 정규화만 적용해도 20NG에서 ECE가 5.00%로 감소하여 분포 내 캘리브레이션 향상에 효과적임을 보였다.
- 두 정규화 기법의 공동 튜닝이 필수적임을 입증하였으며, 아블레이션 결과에서 구성 요소를 제거하거나 별도로 튜닝할 경우 성능이 열등함을 확인했다.
- 여섯 개의 다양한 텍스트 분류 데이터셋에서 ECE 및 OOD 탐지 성능 모두에서 기존의 캘리브레이션 기준선을 뛰어넘는 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.