[논문 리뷰] Curriculum learning for language modeling
이 논문은 ELMo를 사용하여 Wikitext-2 및 Wikitext-103에서 언어 모델 미사전학습을 위한 커리큘럼 학습(Curriculum Learning, CL)을 조사한다. 언어학적으로 유용한 커리큘럼, 예를 들어 단어 빈도, 삼단어 어구 복잡도, 품사 태그의 어려움 히وري스틱을 능력 기반 커리큘럼(CBC)을 통해 적용한다. 광범위한 실험에도 불구하고, 저자들은 미사전학습의 어휘 어려움 또는 하류 GLUE 성능 향상이 일관되게 관찰되지 않음을 발견하였으며, 오히려 무작위 커리큘럼이 구조화된 커리큘럼과 동일하거나 더 효과적일 수 있음을 관찰하여, 이 맥락에서 커리큘럼 학습의 이점이 제한적임을 시사한다.
Language Models like ELMo and BERT have provided robust representations of natural language, which serve as the language understanding component for a diverse range of downstream tasks.Curriculum learning is a method that employs a structured training regime instead, which has been leveraged in computer vision and machine translation to improve model training speed and model performance. While language models have proven transformational for the natural language processing community, these models have proven expensive, energy-intensive, and challenging to train. In this work, we explore the effect of curriculum learning on language model pretraining using various linguistically motivated curricula and evaluate transfer performance on the GLUE Benchmark. Despite a broad variety of training methodologies and experiments we do not find compelling evidence that curriculum learning methods improve language model training.
연구 동기 및 목표
- 커리큘럼 학습이 언어 모델의 미사전학습 효율성과 성능을 향상시키는지 평가하는 것.
- 단어 빈도, n-그램 복잡도, 문장 길이, 품사 태그 등 언어학적으로 기반을 둔 커리큘럼이 ELMo 미사전학습에 어떤 영향을 미치는지 조사하는 것.
- 능력 기반 커리큘럼(CBC) 학습 방식이 GLUE 벤치마크에서의 전이 학습 성능을 향상시키는지 평가하는 것.
- 구조화된 커리큘럼이 언어 모델 미사전학습에서 랜덤 샘플링보다 우월한가를 판단하는 것.
- 미사전학습 어휘 어려움과 하류 전이 성능 사이의 괴리 현상을 탐구하는 것.
제안 방법
- 저자들은 모델의 능력이 시간이 지남에 따라 증가하고, 현재 능력 수준 이하의 샘플들만 사용되는 능력 기반 커리큘럼(CBC) 학습을 구현한다.
- 각 학습 샘플은 단어 빈도, 삼단어 어구 복잡도, 문장 길이, 품사 태그, 의존 구문 분석 깊이 등의 히وري스틱을 사용해 어려움 점수를 할당한다.
- 모델은 초기 능력 수준 λ₀에서 시작하며, 각 학습 단계 이후에 고정된 증분으로 능력 수준을 증가시켜, 초기에는 더 쉬운 예제들만 접근 가능하도록 제한한다.
- 커리큘럼 구조의 영향을 분리하기 위해, 고정된 학습 시간과 하이퍼파라미터를 사용하여 Wikitext-2 및 Wikitext-103에서 실험를 수행한다.
- 전이 성능은 SST, MRPC, QNLI, MNLI를 포함한 12개의 작업에서 GLUE 벤치마크에서 평가된다.
- 제거 분석에서는 CBC를 랜덤 커리큘럼, 커리큘럼 없음, 기초적인 확률적 샘플링과 비교한다.
실험 결과
연구 질문
- RQ1커리큘럼 학습이 Wikitext-2 및 Wikitext-103 데이터셋에서 언어 모델 미사전학습 성능을 향상시키는가?
- RQ2언어학적으로 기반을 둔 커리큘럼(예: 단어 빈도, 삼단어 어구, 품사 태그)이 랜덤 또는 비구조화된 샘플링보다 더 나은 하류 전이 성능을 이끌어내는가?
- RQ3CBC를 사용할 경우 표준 학습 대비 미사전학습 어휘 어려움에 측정 가능한 향상이 있는가?
- RQ4미사전학습 목표 성능이 하류 GLUE 성능과 상관이 있는가?
- RQ5랜덤 커리큘럼 선택이 구조화된 언어학적 커리큘럼과 동등하거나 더 좋은 결과를 낼 수 있는가?
주요 결과
- 모든 커리큘럼 방법에서 일관된 미사전학습 어휘 어려움 향상이 관찰되지 않았으며, 많은 CBC 기반 모델에서 높고 불안정한 어휘 어려움을 보이며 과적합 또는 수렴 불량을 시사한다.
- 낮은 미사전학습 성능에도 불구하고 CBC 방법으로 학습된 모델는 하류 GLUE 작업으로 잘 전이되었으며, 이는 미사전학습 손실이 전이 성능의 신뢰할 수 있는 예측자로 쓰이지 않는다는 것을 시사한다.
- 랜덤 커리큘럼은 MRPC 및 QNLI와 같은 여러 GLUE 작업에서 구조화된 커리큘럼과 동등하거나 더 나은 성능을 보였으며, 이는 구조화된 어려움 순서가 필수적이라는 가정을 도전한다.
- 삼단어 어구 기반 커리큘럼은 Wikitext-103에서 약간 더 나은 전반적인 성능을 보였지만, 모든 작업에서 유의미한 향상은 아니었으며 통계적으로 유의미하지 않았다.
- 품사 태그 및 의존 구문 기반 커리큘럼은 높은 변동성을 보이며 검증 어휘 어려움에서 불안정한 행동을 보였으며, 이는 이러한 히وري스틱에 대한 하이퍼파라미터 조정이 부적절하다는 것을 시사한다.
- 저자들은 특정 언어학적 히وري스틱(예: 단어 빈도, 삼단어 어구, 문장 길이)이 다른 것들보다 더 효과적이라는 증거를 발견하지 못했으며, 또한 랜덤 샘플링 대비 구조화된 커리큘럼에서 명백한 이점이 없다는 것을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.