[논문 리뷰] Data Selection for Fine-tuning Large Language Models Using Transferred Shapley Values
이 논문은 대규모 언어 모델의 미세조정을 위한 데이터 선택을 계산적으로 효율적으로 수행하기 위해 샘플링 기반 집계와 목표 모델 표현에서 훈련된 경량 분류기로 전이된 샘플링 값(Shapley values)을 활용하는 TS-DShapley를 제안한다. 이 방법은 전체 미세조정 데이터셋을 사용할 때보다 RoBERTa와 DistilBERT의 정확도를 최대 3.4% 향상시키며, 단지 데이터의 2%만을 사용함으로써 최신 기술 수준의 성능을 달성한다.
Although Shapley values have been shown to be highly effective for identifying harmful training instances, dataset size and model complexity constraints limit the ability to apply Shapley-based data valuation to fine-tuning large pre-trained language models. To address this, we propose TS-DShapley, an algorithm that reduces computational cost of Shapley-based data valuation through: 1) an efficient sampling-based method that aggregates Shapley values computed from subsets for valuation of the entire training set, and 2) a value transfer method that leverages value information extracted from a simple classifier trained using representations from the target language model. Our experiments applying TS-DShapley to select data for fine-tuning BERT-based language models on benchmark natural language understanding (NLU) datasets show that TS-DShapley outperforms existing data selection methods. Further, TS-DShapley can filter fine-tuning data to increase language model performance compared to training with the full fine-tuning dataset.
연구 동기 및 목표
- 대규모 언어 모델 미세조정을 위한 정확한 샘플링 값 계산의 높은 계산 비용을 해결하기 위해.
- 주요 모델을 재학습하지 않고도 비용이 많이 드는 모델 재학습의 필요성을 줄이기 위해, 단순한 대체 모델에서 추정된 값을 전이함으로써 데이터 평가를 수행하기 위해.
- 작은 데이터 부분집합에서의 샘플링 값을 집계하여, 미세조정을 위한 확장 가능한 데이터 선택을 가능하게 하기 위해.
- 샘플링 기반 평가를 통해 식별된 유해한 훈련 인스턴스를 제거하여 모델 성능을 향상시키기 위해.
제안 방법
- 작은 무작위 훈련 데이터 부분집합에서 샘플링 기반 방법으로 샘플링 값을 계산하고, 이를 집계하여 전체 데이터셋의 샘플링 값을 추정한다.
- 목표 언어 모델의 표현에서 훈련된 선형 분류기를 사용하여 값 전이 메커니즘을 도입함으로써, 주 모델의 재학습 없이도 데이터 값을 추정한다.
- 대체 모델에서 추정된 샘플링 값들을 활용해 낮은 가치이거나 잠재적으로 해로운 훈련 인스턴스를 식별하고 제거한다.
- 특히 부분집합 크기가 작을 경우 추정의 안정성과 정확도를 향상시키기 위해 다중 샘플링 체인을 활용한다.
- 대체 모델에서 유도된 최적의 데이터 제거 인덱스를 목표 모델의 미세조정 과정에 적용한다.
- 전이된 임베딩(예: RoBERTa, DistilBERT)을 대체 분류기의 입력 특징으로 사용하여 이동 가능성과 성능을 향상시킨다.
실험 결과
연구 질문
- RQ1효율적 샘플링과 값 전이를 통해 샘플링 기반 데이터 평가를 대규모 언어 모델 미세조정에 확장 가능하게 만들 수 있는가?
- RQ2목표 모델 표현에서 간단한 선형 분류기를 사용하는 것이 다른 임베딩보다 데이터 평가 정확도를 향상시키는가?
- RQ3전이된 샘플링 값을 활용한 데이터 선택이 전체 미세조정 데이터셋과 비교해 하류 작업 성능을 얼마나 향상시킬 수 있는가?
- RQ4샘플링 하이퍼파라미터(부분집합 크기 및 체인 수)가 데이터 선택 과정의 성능에 어떤 영향을 미치는가?
주요 결과
- TS-DShapley는 기존의 데이터 선택 기준 및 전체 미세조정 데이터셋 조차도 초월하는 성능을 보였다. 특히 벤치마크 NLU 작업에서.
- 2%의 훈련 데이터만을 사용하여 샘플링 값을 추정했을 때, QQP 데이터셋에서 DistilBERT의 성능이 전체 미세조정에 비해 최대 3.4% 향상되었다.
- 동일한 데이터셋에서 RoBERTa도 TS-DShapley를 사용함으로써 전체 미세조정 대비 1.3% 향상된 성능을 기록했다.
- 부분집합 크기가 훈련 세트의 2%를 초과할 경우, 샘플링 체인 수와 성능 간에 강한 정적 상관관계(r = 0.94)를 보였다.
- 대체 분류기의 입력으로 목표 언어 모델의 표현을 사용하는 것이 GloVe나 다른 사전 학습 임베딩보다 항상 뛰어난 데이터 선택 성능을 보였다.
- 이 방법은 실제로 해로운 인스턴스를 식별하고 제거하여, 미세조정된 모델의 일반화 능력과 강건성을 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.