Skip to main content
QUICK REVIEW

[논문 리뷰] Are Larger Pretrained Language Models Uniformly Better? Comparing Performance at the Instance Level

Ruiqi Zhong, Dhruba Ghosh|arXiv (Cornell University)|2021. 05. 13.
Topic Modeling참고 문헌 27인용 수 4
한 줄 요약

이 논문은 전체 정확도 향상에도 불구하고, 인스턴스 수준에서 더 큰 사전학습된 언어 모델이 더 작은 모델보다 항상 더 나은지 여부를 조사한다. 사전학습 및 미세조정 시 발생하는 노이즈를 고려하기 위해 통계적으로 엄밀한 방법을 사용한 결과, BERT-large는 MNLI, SST-2, QQP에서 최소 1–4%의 인스턴스에서 BERT-mini보다 성능이 열 劣함을 발견하여, 크기 증가에 따라 성능 향상이 항상 일어난다는 가정에 도전한다.

ABSTRACT

Larger language models have higher accuracy on average, but are they better on every single instance (datapoint)? Some work suggests larger models have higher out-of-distribution robustness, while other work suggests they have lower accuracy on rare subgroups. To understand these differences, we investigate these models at the level of individual instances. However, one major challenge is that individual predictions are highly sensitive to noise in the randomness in training. We develop statistically rigorous methods to address this, and after accounting for pretraining and finetuning noise, we find that our BERT-Large is worse than BERT-Mini on at least 1-4% of instances across MNLI, SST-2, and QQP, compared to the overall accuracy improvement of 2-10%. We also find that finetuning noise increases with model size and that instance-level accuracy has momentum: improvement from BERT-Mini to BERT-Medium correlates with improvement from BERT-Medium to BERT-Large. Our findings suggest that instance-level predictions provide a rich source of information; we therefore, recommend that researchers supplement model weights with model predictions.

연구 동기 및 목표

  • 모델 크기의 증가에 따라 전체 정확도를 넘어서 인스턴스 수준에서 더 큰 사전학습된 언어 모델이 더 작은 모델보다 항상 우월한지 여부를 확인하는 것.
  • 사전학습 및 미세조정 과정에서 발생하는 예측 노이즈(랜덤 시드에 기인)로 인해 진정한 모델 성능의 차이가 가려지는 문제를 해결하는 것.
  • 학습 과정의 확률적 성격을 고려한 통계적으로 강건한 인스턴스 수준 정확도 추정 방법을 개발하는 것.
  • 모델 크기의 변화에 따라 인스턴스 수준에서 성능 향상의 동력성 또는 분산 패턴이 나타나는지 조사하는 것.
  • 연구자들이 모델 예측 결과를 가중치와 함께 공개하여 모델 행동의 세밀한 분석을 가능하게 하도록 권장하는 것.

제안 방법

  • 랜덤 시드를 다르게 하여 각 크기(BERT-mini, BERT-base, BERT-large)의 BERT 모델 10개를 사전학습하여 사전학습 노이즈를 고려한다.
  • 각 사전학습된 모델을 다른 랜덤 시드로 5번씩 미세조정하여 미세조정 노이즈를 고려하고, (모델 크기, 인스턴스, 사전학습 시드, 미세조정 시드)의 4차원 예측 텐서를 생성한다.
  • 몬테카를로 평균을 사용하여 모든 랜덤 시드에서의 정확한 예측 비율의 기대값으로 인스턴스 수준 정확도를 추정한다.
  • 더 작은 모델이 더 큰 모델보다 성능이 뛰어난 인스턴스를 식별할 때의 거짓 발견률을 추정하기 위해 무작위 기준 모델을 개발한다.
  • 벤자민-하크버그 방법보다 우수한, 피셔의 정확 검정을 활용한 개선된 통계 절차를 적용하여 인스턴스 수준 비교에서의 거짓 발견 수를 상한선으로 제한한다.
  • 분산 성분 분석을 통해 예측 변동성의 원인을 사전학습 시드와 미세조정 시드로 분리하고, 모델 크기 간 성능 향상의 동력성을 분석한다.

실험 결과

연구 질문

  • RQ1더 큰 사전학습된 언어 모델이 더 작은 모델보다 인스턴스 수준에서 항상 더 나은가, 아니면 특정 입력에서 성능이 열 劣하는가?
  • RQ2모델 크기 간 관찰된 성능 차이의 몇 퍼센트가 진정한 모델 능력의 차이가 아니라 사전학습 및 미세조정 과정에서 발생하는 랜덤 노이즈 때문인가?
  • RQ3작은 모델에서 더 큰 모델으로의 성능 향상이 인스턴스 수준에서 동력성을 보이며, BERT-mini에서 BERT-medium로 향상되는 모델이 BERT-medium에서 BERT-large로도 향상되는가?
  • RQ4모델 크기에 따라 모델 예측의 분산은 어떻게 변화하며, 이 분산의 주요 원인은 사전학습 시드인지, 미세조정 시드인지?
  • RQ5어떤 종류의 인스턴스(예: 희귀, 논란의 여지가 있거나 모호한)가 더 큰 모델에서 잘못 분류될 가능성이 더 높은가?

주요 결과

  • MNLI, SST-2, QQP에서 BERT-large는 전체 정확도가 2–10% 향상되었음에도 불구하고 최소 1–4%의 인스턴스에서 BERT-mini보다 성능이 열 劣한다.
  • 더 큰 모델이 성능이 열 劣하는 인스턴스 비율은 무작위 기준과 통계 보정을 통해 기대치를 크게 초월하며, 이는 신뢰할 수 있는 결과임을 확인한다.
  • 인스턴스 수준의 정확도 향상은 동력성을 보인다: BERT-mini에서 BERT-medium로 성능 향상을 보인 모델이 BERT-medium에서 BERT-large로도 성능 향상을 보일 가능성이 높다.
  • 미세조정 노이즈는 모델 크기가 증가함에 따라 증가하며, 특히 큰 모델에서 사전학습 노이즈보다 예측 분산에 더 큰 기여를 한다.
  • 더 큰 모델이 성능을 열 劣하는 인스턴스 집합은 논란의 여지가 있거나 모호한 레이블뿐만 아니라 올바르게 레이블링된 예시를 포함하며, 실패 케이스에 단순한 패턴이 없음을 시사한다.
  • 이 연구는 연구자들이 모델 예측 결과를 가중치와 함께 공개하여 인스턴스 수준에서의 모델 행동을 더 깊이 있게 분석할 수 있도록 권장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.