[논문 리뷰] PMI-Masking: Principled masking of correlated spans
이 논문은 점별 상관도(PMI)를 사용하여 상관되는 단어 구간을 식별하고, 사전 훈련된 마스크된 언어 모델(MLM)에서 이들의 일관된 의미적 구간을 동시에 마스킹하는 원리적인 방법인 PMI-Masking를 제안한다. 무작위 토큰이 아닌 의미적으로 일관된 구간을 함께 마스킹함으로써, PMI-Masking는 수렴 속도를 가속화하여 이전 방법들이 훈련을 끝낼 때까지 반으로 줄여 성능을 달성하면서도, RACE와 SQuAD2.0를 포함한 여러 벤치마크에서 최종 성능을 향상시킨다.
Masking tokens uniformly at random constitutes a common flaw in the pretraining of Masked Language Models (MLMs) such as BERT. We show that such uniform masking allows an MLM to minimize its training objective by latching onto shallow local signals, leading to pretraining inefficiency and suboptimal downstream performance. To address this flaw, we propose PMI-Masking, a principled masking strategy based on the concept of Pointwise Mutual Information (PMI), which jointly masks a token n-gram if it exhibits high collocation over the corpus. PMI-Masking motivates, unifies, and improves upon prior more heuristic approaches that attempt to address the drawback of random uniform token masking, such as whole-word masking, entity/phrase masking, and random-span masking. Specifically, we show experimentally that PMI-Masking reaches the performance of prior masking approaches in half the training time, and consistently improves performance at the end of training.
연구 동기 및 목표
- 무작위 토큰 마스킹이 하위어 예측에 과도하게 최적화되고 전체 단어 이해력 훈련이 부족해지는 MLM의 비효율성을 해결한다.
- 전체 단어 마스킹이나 무작위 구간 마스킹과 같은 히우리스틱 마스킹 전략의 한계를 극복한다. 이는 범위를 제한하거나 노이즈가 많은 부분적인 연어어어구를 포함하기 때문이다.
- 통계적 연어어어구 기반의 원리적이고 데이터 기반의 마스킹 전략을 개발하여 신호 효율성과 모델 일반화 능력을 향상시킨다.
- PMI-Masking가 무작위 토큰 마스킹 및 무작위 구간 마스킹보다 수렴 속도가 빠르고 최종 성능이 뛰어나다는 것을 입증한다.
- 단일 토큰 예측을 목표로 하는 표준 MLM 목적함수는 최종 성능과 상관관계가 낮다는 점을 재평가하고, 더 효과적인 대안을 제안한다.
제안 방법
- 사전 훈련 코퍼스에서 높은 동시출현 빈도를 보이는 n-그램(예: 어구, 연어어어구)을 식별하기 위해 확장된 다항 Pointwise Mutual Information(PMI) 측도를 정의한다.
- 확장된 PMI 공식을 사용하여 개별 토큰 빈도를 초월해 통계적으로 유의미한 동시출현을 보이는 코퍼스 내 모든 n-그램을 식별한다.
- 각 고PMI n-그램을 하나의 마스킹 단위로 간주하고, 이러한 단위에 속하지 않는 표준 토큰은 개별적으로 마스킹 가능하도록 처리한다.
- 사전 훈련 중에 고PMI n-그램 또는 단일 토큰 중 하나를 무작위로 선택하여 마스킹함으로써 의미적으로 일관된 구간을 함께 마스킹한다.
- 기존 BERT 아키텍처에 변화 없이, 나머지 컨텍스트에서 마스킹된 구간(단일 토큰 또는 n-그램)을 예측하기 위해 표준 MLM 목적함수를 사용한다.
- 기준 모델과 동일한 하이퍼파라미터와 시퀀스 길이를 사용하여 훈련함으로써 마스킹 전략 간 공정한 비교를 보장한다.
실험 결과
연구 질문
- RQ1MLM에서의 무작위 토큰 마스킹은 하위어 예측 과제에 과도하게 최적화되어 하위어 예측에 치우치며, 전체 단어 이해력 훈련이 부족해 비효율적인 사전 훈련을 유도하는가?
- RQ2연어어어구 탐지 기반의 원리적이고 데이터 기반의 마스킹 전략이 사전 훈련 효율성과 최종 성능을 향상시킬 수 있는가?
- RQ3전체 단어 마스킹이나 무작위 구간 마스킹과 같은 히우리스틱 접근법과 비교할 때, PMI-Masking는 수렴 속도와 최종 성능 측면에서 어떻게 다른가?
- RQ4다양한 마스킹 전략을 사용할 경우, 표준 단일 토큰 퍼플렉서티가 최종 성능과 얼마나 상관관계가 깊은가?
- RQ5더 큰 코퍼스와 무작위 마스킹을 사용하는 경우보다, 더 작은 사전 훈련 코퍼스와 더 적은 훈련 예제를 사용할 때 PMI-Masking가 더 나은 최종 성능을 낼 수 있는가?
주요 결과
- PMI-Masking는 이전 마스킹 방법(예: SpanBERT, RoBERTa)의 최종 성능을 반 훈련 시간만에 도달한다.
- PMI-Masking Base 크기의 모델은 여러 최종 성능 테스크에서 SpanBERT BASE보다 1~2점 높은 성능을 보이며, 3배 작은 코퍼스와 6배 적은 훈련 예제를 사용함에도 불구하고 RoBERTa BASE를 초월한다.
- RACE 벤치마크에서, 동일한 수의 예제가 제공된 경우 PMI-Masking 모델은 무작위 구간 마스킹으로 훈련된 SpanBERT BASE 모델보다 2점 이상 높은 점수를 기록했다.
- PMI-Masking로 훈련된 모델는 100만 번째 스텝에서 단일 토큰 퍼플렉서티 21.85를 기록했으며, 이는 무작위 토큰 마스킹(2.96)보다 훨씬 높은 수치로, 표준 목적함수 최소화가 최종 성공과 상관관계가 없다는 것을 시사한다.
- PMI-Masking는 사전 훈련 기간 내 모든 평가 지점에서 무작위 구간 마스킹보다 뛰어난 성능을 보이며, 훈련의 절반 정도에서 이미 그 최종 성능에 도달한다.
- 더 큰 아키텍처나 더 큰 사전 훈련 코퍼스를 사용한 모델들과 비교해도 성능 향상이 이루어지며, 이는 이 방법의 효율성과 효과성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.