[논문 리뷰] Making Neural Machine Reading Comprehension Faster
이 논문은 BERT를 더 작은 효율적인 아키텍처로 압축하기 위해 지식 정련을 사용하여 더 빠른 신경 기계 독해 모델을 제안한다: 컨볼루션 모델(CONV MODEL)과 정련된 BERT-small 버전(BERT SMALL). CONV MODEL은 추론 속도가 초당 774개 샘플이고 F1 점수는 79.80을 기록했으며, BERT SMALL는 초당 217개 샘플의 추론 속도로 F1 점수 85.57을 달성하여 이전 모델 대비 속도와 정확도의 상호 보완적 성능을著しく 뛰어넘었다.
This study aims at solving the Machine Reading Comprehension problem where questions have to be answered given a context passage. The challenge is to develop a computationally faster model which will have improved inference time. State of the art in many natural language understanding tasks, BERT model, has been used and knowledge distillation method has been applied to train two smaller models. The developed models are compared with other models which have been developed with the same intention.
연구 동기 및 목표
- 실시간 배포를 가능하게 하기 위해 계산 비용이 더 낮은 신경 기계 독해(MRC) 모델을 개발한다.
- 특히 긴 문맥에서의 추론 속도가 느린 RNN 기반 모델과 주의 집중이 집중된 모델(예: BERT)의 문제를 해결한다.
- 지식 정련을 활용하여 모델 용량을 늘리지 않고도 추론 효율성을 향상시키고 정답 정확도를 유지한다.
- 기존 순환 모델 대신 컨볼루션 아키텍처가 MRC에서 효과적인지 탐색한다.
- SQuAD 벤치마크에서 정련된 BERT와 컨볼루션 모델의 성능 및 속도의 상호 보완적 성능을 평가한다.
제안 방법
- 국소적이고 전반적인 맥락을 포착하기 위해 다중 윈도우 컨볼루션 레이어를 사용하여 RNN과 자기주의 집중을 대체하는 CONV MODEL을 훈련한다.
- 장거리 의존성을 모델링하기 위해 다중 윈도우 컨볼루션 뒤에 Transformer 인코더 레이어를 통합한다.
- 더 큰 모델인 미세조정된 BERT BASE 모델에서 지식 정련을 적용하여 더 작은 모델(CONV MODEL 및 BERT SMALL)에 지식을 전이한다.
- 학습 중에 교사 모델(BERT BASE)의 소프트 레이블을 사용하여 일반화 능력을 향상시키고 과적합을 줄인다.
- ADAM 최적화기를 사용하고, 선형 웜업과余弦 감쇠 학습률 스케줄링, L2 가중치 감쇠 및 드롭아웃을 함께 적용한다.
- 문맥 문단에서 정답의 시작 및 끝 위치를 예측하기 위해 스파이크 예측 레이어를 구현한다.
실험 결과
연구 질문
- RQ1컨볼루션 신경망 아키텍처가 MRC에서 RNN 기반 또는 주의 집중 전용 모델보다 더 빠른 추론 속도를 달성할 수 있는가?
- RQ2지식 정련이 모델 용량을 늘리지 않고도 더 작은 모델의 성능을 얼마나 향상시킬 수 있는가?
- RQ3단일 컨볼루션 윈도우 대비 다중 윈도우 컨볼루션 레이어가 F1 점수와 강건성 측면에서 어떻게 비교되는가?
- RQ4단지 6층으로 구성된 정련된 BERT 모델(BERT SMALL)이 계산 비용을 줄이며 BERT BASE 수준의 성능에 근접할 수 있는가?
- RQ5다양한 MRC 모델 아키텍처에서 추론 속도와 정답 정확도 사이의 상호 보완적 성능는 어떠한가?
주요 결과
- CONV MODEL은 추론 속도가 초당 774개 샘플이고 F1 점수 79.80을 기록하여, 속도 측면에서 FABIR(672개 샘플/초)와 QANet(163개 샘플/초)를 모두 앞서는 성능을 보였다.
- BERT SMALL 모델은 테스트된 모든 모델 중에서 가장 높은 F1 점수 85.57을 기록했으며, 단지 6층으로 구성되어 있음에도 불구하고 교사 모델 성능(88.32)에 근접하였다.
- 다중 윈도우 컨볼루션 레이어는 단일 7 커널 크기의 컨볼루션 대비 F1 점수를 1.33점 향상시켜 다양한 n-그램 패턴을 포착하는 데서 유의미한 이점을 보였다.
- 지식 정련을 통해 CONV MODEL의 F1 점수는 정련 없이 훈련한 경우의 72.33에서 79.80으로 상승했으며, 과적합이 감소하고 일반화 능력이 향상되었다.
- BERT SMALL 모델은 BERT BASE 대비 약 절반 수준의 계산 비용을 절감하면서도 강력한 성능을 유지하였다.
- 단일 7 커널 컨볼루션을 사용한 CONV MODEL은 초당 829개 샘플의 가장 빠른 추론 속도를 기록했지만, 전체 CONV MODEL 대비 F1 점수에서 1.33점 하락하는 대가를 치르었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.