[논문 리뷰] Pretraining without Wordpieces: Learning Over a Vocabulary of Millions of Words
이 논문은 서브워드 단위(워드피ece)가 아닌 전체 단어의 어휘를 기반으로 훈련한 BERT 스타일 모델인 WordBERT을 제안한다. 이는 대용량 어휘를 처리하기 위해 샘플링 기반 훈련 전략을 사용한다. WordBERT는 클로즈 테스트와 기계적 독해 이해 테스트에서 뚜렷한 성능 향상을 보이며, POS 태깅, 추출, NER에서 BERT를 일관되게 능가한다. 또한 중국어 자연어 처리 작업에서 강력한 성능 향상을 보이며, 어휘 크기가 크더라도 BERT와 유사한 추론 속도를 유지한다.
The standard BERT adopts subword-based tokenization, which may break a word into two or more wordpieces (e.g., converting "lossless" to "loss" and "less"). This will bring inconvenience in following situations: (1) what is the best way to obtain the contextual vector of a word that is divided into multiple wordpieces? (2) how to predict a word via cloze test without knowing the number of wordpieces in advance? In this work, we explore the possibility of developing BERT-style pretrained model over a vocabulary of words instead of wordpieces. We call such word-level BERT model as WordBERT. We train models with different vocabulary sizes, initialization configurations and languages. Results show that, compared to standard wordpiece-based BERT, WordBERT makes significant improvements on cloze test and machine reading comprehension. On many other natural language understanding tasks, including POS tagging, chunking and NER, WordBERT consistently performs better than BERT. Model analysis indicates that the major advantage of WordBERT over BERT lies in the understanding for low-frequency words and rare words. Furthermore, since the pipeline is language-independent, we train WordBERT for Chinese language and obtain significant gains on five natural language understanding datasets. Lastly, the analyse on inference speed illustrates WordBERT has comparable time cost to BERT in natural language understanding tasks.
연구 동기 및 목표
- BERT의 서브워드 토크나이제이션의 한계, 즉 분할된 단어 표현과 클로즈 테스크에서 복합어 토큰을 예측하기 어려움을 해결하기 위해.
- 큰 어휘의 전체 단어를 직접 기반으로 훈련한 BERT 스타일 모델이 문맥 기반 표현 학습을 향상시키는지 탐색하기 위해.
- 영어 및 중국어를 포함한 여러 자연어 처리 작업과 언어에서 단어 수준의 사전 훈련 성능을 평가하기 위해.
- BERT에 비해 WordBERT가 낮은 빈도 또는 희귀어에 대해 더 나은 표현을 포착하는지 분석하기 위해.
- 대용량 어휘(최대 100만 단어)를 사용하더라도 단어 수준의 사전 훈련이 스케일링 가능하고 효율적인지 입증하기 위해.
제안 방법
- 서브워드 단위 대신 전체 단어 어휘를 사용해 BERT 스타일 모델을 훈련함으로써 워드피ece 토크나이제이션을 제거한다.
- 훈련 중 계산 비용을 줄이기 위해 샘플링 기반 훈련 전략을 도입하여 배치당 일부 워드 임베딩만 업데이트한다.
- 표준 트랜스포머 아키텍처를 사용하며, 마스크된 언어 모델링과 다음 문장 예측 목표를 전체 단어 입력에 맞게 조정한다.
- 다양한 어휘 크기(500K, 1M)와 초기화 전략(예: 사전 훈련된 GloVe 임베딩 포함)을 실험한다.
- 다양한 언어에서의 효과를 평가하기 위해 대규모 중국어 어휘를 기반으로 전용 중국어 WordBERT 모델을 훈련한다.
- 어휘 크기가 크더라도 성능 오버헤드를 최소화하기 위해 어휘 검색을 통한 워드 임베딩 추론을 사용한다.
실험 결과
연구 질문
- RQ1전체 단어 어휘를 기반으로 훈련한 BERT 스타일 모델이 하류 자연어 처리 작업에서 표준 서브워드 기반 BERT를 능가할 수 있는가?
- RQ2단어 수준의 사전 훈련이 클로즈 스타일 테스크에서 복합어나 희귀어를 예측하는 능력을 향상시키는가?
- RQ3WordBERT는 낮은 빈도 및 희귀어에 대해 BERT에 비해 어떻게 성능을 내는가? 특히 제로샷 프로빙 상황에서의 성능은?
- RQ4영어 및 중국어와 같은 다양한 언어에서 단어 수준의 사전 훈련 방식은 확장성과 효율성이 있는가?
- RQ5WordBERT의 더 큰 어휘 크기가 추론 시간을 증가시키는가, 아니면 BERT와 유사한가?
주요 결과
- WordBERT는 클로즈 테스트와 기계적 독해 이해 테스트에서 BERT에 비해 뚜렷한 성능 향상을 보이며, 큰 격차로 앞서간다.
- POS 태깅, 추출, NER에서 WordBERT는 여러 데이터셋에서 BERT보다 일관되게 높은 F1 스코어를 기록한다.
- 프로빙 분석 결과, WordBERT는 특히 희귀어나 낮은 빈도어에 대해 더 다양한 의미 있는 예측을 생성하지만, BERT는 일반 단어나 서브워드를 주로 출력한다.
- 중국어 WordBERT 모델은 CLUE 벤치마크에서 상당한 성능 향상을 보이며, 자원이 적고 형태소가 복잡한 언어에서의 접근 방식의 효과를 입증한다.
- 최대 7억 6,800만 개의 워드 임베딩 파라미터를 가짐에도 불구하고, 효율적인 사전 기반 검색과 짧은 입력 시퀀스 덕분에 WordBERT는 BERT와 유사한 추론 속도를 유지한다.
- 샘플링 기반 훈련 전략은 훈련 중 계산 비용을 효과적으로 줄여, 대용량 어휘 기반 훈련에 있어 금전적 비용이 과도하게 증가하지 않도록 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.