[논문 리뷰] BERT on a Data Diet: Finding Important Examples by Gradient-Based Pruning
이 논문은 컴퓨터 비전 분야에서 개발된 기울기 기반 데이터 프루닝 메트릭인 GraNd와 EL2N을 자연어 처리(NLP)에 적응시켜, 최소한 한 에포크 이상을 거친 후 중요도가 높은 예시들(이들 메트릭을 통해 선별됨)의 부분집합으로 BERT를 미세조정하면 전체 데이터셋으로 훈련한 경우와 동일하거나 그 이상의 성능을 유지하거나 초월할 수 있음을 보여준다. 핵심 발견은 가장 높은 점수를 받는(잠재적으로 노이즈가 있는) 예시들을 프루닝하면 일반화 성능이 향상되며, 특히 MNLI에서 전체 데이터의 66%만을 사용할 경우 전체 데이터셋으로 훈련한 경우보다 높은 정확도를 기록한다는 점이다.
Current pre-trained language models rely on large datasets for achieving state-of-the-art performance. However, past research has shown that not all examples in a dataset are equally important during training. In fact, it is sometimes possible to prune a considerable fraction of the training set while maintaining the test performance. Established on standard vision benchmarks, two gradient-based scoring metrics for finding important examples are GraNd and its estimated version, EL2N. In this work, we employ these two metrics for the first time in NLP. We demonstrate that these metrics need to be computed after at least one epoch of fine-tuning and they are not reliable in early steps. Furthermore, we show that by pruning a small portion of the examples with the highest GraNd/EL2N scores, we can not only preserve the test accuracy, but also surpass it. This paper details adjustments and implementation choices which enable GraNd and EL2N to be applied to NLP.
연구 동기 및 목표
- 기존에 컴퓨터 비전 분야에서 사용되던 기울기 기반 데이터 중요도 메트릭인 GraNd와 EL2N을 자연어 처리(NLP) 분야로 확장하여 중요한 훈련 예시를 식별하는 데 목적이 있다.
- 이러한 메트릭이 BERT와 같은 사전학습된 언어모델(PLM)에서 고가치의 훈련 예시를 식별할 수 있는지 조사하는 것.
- 특히 GraNd/EL2N 점수가 높은 예시들(낮은 중요도로 간주됨)을 프루닝하여 모델 성능을 향상시키거나 유지할 수 있는지 평가하는 것.
- PLM의 고유한 동역학을 고려할 때, 이러한 점수를 미세조정 중 언제 계산하는 것이 가장 적절한지 규명하는 것.
- 높은 점수를 받는 예시들(잠재적으로 노이즈가 있는 것으로 간주됨)을 제거하면 전체 데이터셋으로 훈련하는 것보다 더 나은 일반화 성능을 달성할 수 있는지 평가하는 것.
제안 방법
- 모델 가중치에 대한 손실 기울기의 기대 L2 노름을 계산하여 GraNd 점수를 산정하며, 이는 다수의 무작위 가중치 초기화를 통해 추정한다.
- EL2N을 사용해 GraNd를 근사화하며, EL2N는 예측값과 one-hot 레이블 간의 오차의 기대 L2 노름으로 정의되며, 다수의 훈련 실행을 통해 계산된다.
- 각 훈련 예시에 대해 안정적이고 평균화된 EL2N 및 GraNd 점수를 도출하기 위해 서로 다른 랜덤 시드를 사용한 다섯 개의 독립된 훈련 실행을 수행한다.
- 한 번의 전체 미세조정 에포크 이후, EL2N 또는 GraNd 점수 기준 상위 k%의 훈련 예시를 선별하고, BERT-base를 해당 예시들로만 미세조정한다.
- 정확도를 평가 지표로 사용하여 AG News(주제 분류) 및 MNLI(자연어 추론) 작업에서 성능을 평가한다.
- 구조적 프루닝의 성과를 평가하기 위해 무작위 프루닝 베이스라인 및 전체 데이터셋 미세조정 결과와 비교한다.
실험 결과
연구 질문
- RQ1원래는 비전 분야에서 설계된 GraNd와 EL2N가 자연어 처리 및 BERT와 같은 사전학습된 언어모델에 효과적으로 적응될 수 있는가?
- RQ2PLM 맥락에서 신뢰할 수 있는 GraNd/EL2N 점수를 도출하기 위해 최소한 한 번의 전체 미세조정 에포크를 거쳐야 하는가?
- RQ3GraNd/EL2N로 측정한 가장 높은 점수를 받는 예시들을 프루닝하면 전체 데이터셋으로 훈련하는 것보다 더 나은 테스트 성능을 달성할 수 있는가?
- RQ4EL2N/GraNd 기반의 선택 방식을 사용할 경우, 유지하는 데이터의 비율에 따라 성능가 어떻게 변하는가?
- RQ5소량의 가장 높은 점수를 받는 예시들(잠재적으로 노이즈일 수 있음)을 제거하면 자연어 처리 작업에서 모델의 일반화 성능이 향상될 수 있는가?
주요 결과
- 비전 분야와 달리, NLP에서 GraNd 및 EL2N 점수가 데이터 서브셋 선택에 신뢰할 수 있게 되기 위해 최소한 한 번의 전체 미세조정 에포크가 필요하다.
- MNLI 데이터셋에서 상위 4%의 가장 높은 점수를 받는 예시들을 제거한 후 전체 데이터의 66%로만 훈련한 경우, 전체 데이터셋으로 훈련한 경우보다 더 높은 정확도를 기록한다.
- AG News에서는 가장 높은 점수를 받는 예시들을 프루닝하더라도 전체 훈련과 비교해 유사한 성능를 달성하지만, 사용하는 데이터는 전체의 67% 뿐이므로 데이터 효율성 향상이 확인된다.
- 단일 랜덤 시드에서 계산한 EL2N 및 GraNd 점수와 다섯 개의 시드에서 계산한 점수 간의 상관관계가 매우 높다(Spearman r = 0.9311)는 점을 고려하면, 각 시드당 한 에포크만으로도 신뢰할 수 있는 프루닝이 가능하다는 것을 시사한다.
- EL2N/GraNd 기반으로 선택된 상위-k% 예시들로 훈련한 모델의 성능는 유지하는 데이터 비율이 증가함에 따라 단조롭게 향상되며, 최소 70% 이상의 데이터를 유지할 경우 랜덤 프루닝을 초월한다.
- MNLI와 같은 일부 사례에서는 가장 높은 점수를 받는 예시들을 제거하는 것이 포함하는 것보다 더 나은 일반화 성능을 이끌어내므로, 높은 점수를 받는 예시들이 노이즈가 있거나 학습하기 어려운 인스턴스일 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.