Skip to main content
QUICK REVIEW

[논문 리뷰] DeFormer: Decomposing Pre-trained Transformers for Faster Question Answering

Qingqing Cao, Harsh Trivedi|arXiv (Cornell University)|2020. 05. 02.
Topic Modeling참고 문헌 28인용 수 9
한 줄 요약

DeFormer은 사전 훈련된 트랜스포머를 분해하여 낮은 층에서 질문과 문장을 별도로 처리함으로써 질문 답변을 가속화한다. 이로 인해 문장 표현을 사전에 캐시할 수 있고, 정규화를 통해 최대 4.3배의 계산량 감소를 이룰 수 있으며 정확도 손실은 1%에 불과하다. 사전 훈련된 가중치를 초기화하고 최종 작업에 직접 미세조정함으로써 모델 성능을 유지한다.

ABSTRACT

Transformer-based QA models use input-wide self-attention -- i.e. across both the question and the input passage -- at all layers, causing them to be slow and memory-intensive. It turns out that we can get by without input-wide self-attention at all layers, especially in the lower layers. We introduce DeFormer, a decomposed transformer, which substitutes the full self-attention with question-wide and passage-wide self-attentions in the lower layers. This allows for question-independent processing of the input text representations, which in turn enables pre-computing passage representations reducing runtime compute drastically. Furthermore, because DeFormer is largely similar to the original model, we can initialize DeFormer with the pre-training weights of a standard transformer, and directly fine-tune on the target QA dataset. We show DeFormer versions of BERT and XLNet can be used to speed up QA by over 4.3x and with simple distillation-based losses they incur only a 1% drop in accuracy. We open source the code at https://github.com/StonyBrookNLP/deformer.

연구 동기 및 목표

  • 사전 훈련된 트랜스포머 기반 질문 답변 모델의 추론 지연과 메모리 사용량을 재학습 없이 줄이는 것.
  • 입력 전체에 대한 자기주의 attention이 낮은 층에서 질문 및 문장 별 자기주의 attention으로 대체될 수 있는지 탐색하는 것, 성능 저하 없이 가능할 경우.
  • 질문과 무관하게 사전에 문장 표현을 계산하고 캐시하여 추론 속도를 향상시키는 것.
  • 정규화 기반 손실을 사용하여 원본 모델과의 출력을 일치시킴으로써 분해된 모델의 높은 정확도를 유지하는 것.
  • 실제 배포에 적합한 즉시 사용 가능한 방법을 제공하여 기존의 BERT 및 XLNet과 같은 사전 훈련된 모델을 가속화하는 것.

제안 방법

  • DeFormer은 첫 k개의 레이어에서 전체 입력에 대한 자기주의 attention을 별도의 질문 전용 및 문장 전용 self-attention 메커니즘으로 대체한다.
  • 문장 표현은 k번째 레이어 이후에 사전에 계산되어 캐시되며, 여러 질문 간에 재사용 가능하다.
  • 추론 중에는 질문이 첫 k개 레이어를 통과하고, 캐시된 문장 표현이 (k+1)-번째 레이어에서 입력을 병합하는 데 사용된다.
  • 모델는 표준 BERT 또는 XLNet의 사전 훈련된 가중치를 사용하여 초기화하고, 최종 작업 QA 데이터셋에 직접 미세조정한다.
  • 두 가지 정규화 손실이 도입된다: 하나는 출력 수준의 분산을 최소화하고, 다른 하나는 DeFormer과 원본 모델 간의 레이어 수준 표현 분산을 최소화한다.
  • 정규화 과정을 통해 DeFormer의 상위 레이어가 원본 모델의 표현과 유사하게 학습되어 정확도 손실를 최소화한다.

실험 결과

연구 질문

  • RQ1Transformer의 낮은 층에서 입력 전체에 대한 자기주의 attention을 질문 및 문장 별 자기주의 attention으로 대체할 경우, 성능 저하 없이 추론 지연을 줄일 수 있는가?
  • RQ2질문 답변 시스템에서 런타임 계산을 줄이기 위해 얼마나 많은 문장 표현을 사전에 계산하고 캐시할 수 있는가?
  • RQ3정규화가 분해된 모델의 출력 및 중간 표현을 원본 모델과 일치시키는 데 얼마나 효과적인가?
  • RQ4DeFormer은 더 작은 기준 모델보다 더 빠른 추론을 달성하면서도 더 높은 정확도를 유지할 수 있는가?
  • RQ5다양한 질문 답변 작업과 모델 아키텍처에서 속도 향상, 메모리 감소, 정확도 손실 간의 상호 상충 관계는 어떠한가?

주요 결과

  • DeFormer은 BERT 및 XLNet에 적용되었을 때 여러 QA 데이터셋에서 추론 시간을 2.7배에서 4.3배 가속화한다.
  • 중간 문장 표현을 제거함으로써 메모리 사용량이 65.8%에서 72.9% 감소한다.
  • 정규화를 통해 DeFormer의 F1 스코어는 원본 모델 대비 0.6%에서 1.8% 감소하며, 일부 벤치마크에서는 최대 1%의 정확도 손실만 발생한다.
  • BERT-large의 DeFormer 버전은 원본 BERT-base보다 더 빠르게 작동하면서도 더 높은 정확도를 유지하여 효율성-정확도 균형에서 뛰어난 성능을 보인다.
  • 제거 실험 결과, 정규화 손실이 성능 향상에 크게 기여하며 특히 원본 모델과의 표현 일치 유지에 효과적임을 확인한다.
  • 이 방법은 독해력 검사 및 문장 쌍 매칭과 같은 다양한 작업에 효과적이며, 입력 전체에 대한 자기주의 attention에 의존하는 모든 모델에 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.