Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring BERT Parameter Efficiency on the Stanford Question Answering Dataset v2.0

Eric Hulburd|arXiv (Cornell University)|2020. 02. 25.
Topic Modeling참고 문헌 9인용 수 6
한 줄 요약

이 논문은 SQuAD2.0 질문 응답 작업에서 BERT의 파rameter 효율성을 검토하기 위해 트랜스포머 레이어를 동 冻결하고 어댑터 모듈을 적용하며, 맥락 인식 컨볼루션 네트워크(CNN)를 테스트한다. 어댑터 모듈은 파라미터의 26%만 사용하면서도 높은 F1 성능(75.0%)을 달성하는 것으로 나타났지만, 맥락 인식 CNN은 성능이 열 劣하고 추론 시간이 크게 증가한다.

ABSTRACT

In this paper we explore the parameter efficiency of BERT arXiv:1810.04805 on version 2.0 of the Stanford Question Answering dataset (SQuAD2.0). We evaluate the parameter efficiency of BERT while freezing a varying number of final transformer layers as well as including the adapter layers proposed in arXiv:1902.00751. Additionally, we experiment with the use of context-aware convolutional (CACNN) filters, as described in arXiv:1709.08294v3, as a final augmentation layer for the SQuAD2.0 tasks. This exploration is motivated in part by arXiv:1907.10597, which made a compelling case for broadening the evaluation criteria of artificial intelligence models to include various measures of resource efficiency. While we do not evaluate these models based on their floating point operation efficiency as proposed in arXiv:1907.10597, we examine efficiency with respect to training time, inference time, and total number of model parameters. Our results largely corroborate those of arXiv:1902.00751 for adapter modules, while also demonstrating that gains in F1 score from adding context-aware convolutional filters are not practical due to the increase in training and inference time.

연구 동기 및 목표

  • 레이어 동 冻결 및 어댑터 모듈과 같은 기법을 사용하여 BERT의 SQuAD2.0에서의 파라미터 효율성을 평가하기 위해.
  • 모델 성능, 학습 시간, 추론 시간, 파라미터 수 간의 상호 교환 관계를 평가하기 위해.
  • 표준 BERT 미세조정 대비 맥락 인식 컨볼루션 네트워크(CACNN)가 성능 향상에 기여하는지 조사하기 위해.
  • 어댑터 모듈이 전체 미세조정 대비 파라미터 수를 줄이며 실용적인 대안이 되는지 확인하기 위해.
  • 초기 BERT 레이어를 동 冻결하는 것이 효율성과 성능에 미치는 영향을 탐색하기 위해.

제안 방법

  • 학습 중 나머지 레이어를 미세조정하면서 최종 BERT 트랜스포머 레이어의 수를 다양하게 동 冻결한다.
  • BERT 레이어 간에 어댑터 모듈을 삽입하고, BERT 가중치를 동 冻결한 상태에서 어댑터 파라미터만 학습한다.
  • BERT 이후에 맥락 인식 컨볼루션(CACNN) 필터를 적용하며, 맥락 벡터화 여부에 따라 실험한다.
  • 다양한 어댑터 크기(64, 768)를 사용하여 전체 미세조정 대비 성능을 비교한다.
  • 모든 구성에서 학습 시간, 추론 시간, F1 점수를 측정한다.
  • 임의의 작업 특화 수정 없이 표준 BERT-base 아키텍처를 기반 모델로 사용한다.

실험 결과

연구 질문

  • RQ1어댑터 모듈은 학습 가능한 파라미터 수를 줄이며 SQuAD2.0에서 경쟁력 있는 F1 점수를 달성할 수 있는가?
  • RQ2초기 BERT 레이어를 동 冻결하면 성능 저하 없이 학습 시간과 파라미터 수를 줄일 수 있는가?
  • RQ3맥락 인식 CNN은 표준 BERT 미세조정 대비 답변 구간 예측 성능을 향상시키는가?
  • RQ4다양한 어댑터 크기와 CACNN 구성에서 학습 및 추론 시간은 어떻게 변화하는가?
  • RQ5CACNN로 인한 성능 향상이 학습 및 추론 시간 증가에 비해 정당한가?

주요 결과

  • 모든 BERT 레이어를 동 冻결한 768 크기 어댑터 모델은 F1 점수 75.0%를 기록했으며, 전체 미세조정 BERT의 75.8%에 근접했고, 파라미터의 26%만 사용했다.
  • 어댑터 모델은 전체 미세조정 BERT와 거의 동일한 학습 시간을 요구했고, 추론 시간은 약 20% 증가했다(188.8초 대비 154.3초).
  • 200개의 특징 맵을 가진 맥락 인식 CNN은 추론 시간을 80% 증가시켰고(261.5초), F1 점수는 61.2%에 그쳐 어댑터 모델에 비해 뚜렷이 열 劣했다.
  • 가장 성능이 뛰어난 CACNN(200맵)은 예측 당 9.5ms의 추론 시간 증가를 보였으며, 저지연 시스템에서는 의미 있는 영향을 미칠 수 있다.
  • 첫 6개의 BERT 레이어를 동 冻결하면 학습 가능한 파라미터 수와 학습 시간이 감소했지만, 추론 시간이나 모델 크기에 영향을 주지 않았다.
  • 어댑터 모듈은 CACNN에 비해 뛰어난 파라미터 효율성을 보였으며, 일부 경우에서 고도의 파라미터 수를 사용함에도 불구하고 성능이 열 劣했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.