Skip to main content
QUICK REVIEW

[논문 리뷰] BERTQA -- Attention on Steroids

Ankit Chadha, Rewa Sood|arXiv (Cornell University)|2019. 12. 14.
Topic Modeling참고 문헌 6인용 수 5
한 줄 요약

BERTQA는 BERT에 방향성 있는 공주의 기반인 Context-to-Query (C2Q) 및 Query-to-Context (Q2C)를 도입하여 SQuAD 2.0에서 답변 구간 탐지 성능을 향상시켰다. 잔차 연결과 1D 컨볼루션을 통합하여 局부적 특징을 추출함으로써, 기본 아키텍처에서 F1 77.03, 앙상블에서는 F1 82.317/EM 79.442를 기록하여, 백번역된 데이터셋(SQUAD 2.Q)을 통해 무답변 질문 탐지 및 일반화 능력을 크게 향상시켰다.

ABSTRACT

In this work, we extend the Bidirectional Encoder Representations from Transformers (BERT) with an emphasis on directed coattention to obtain an improved F1 performance on the SQUAD2.0 dataset. The Transformer architecture on which BERT is based places hierarchical global attention on the concatenation of the context and query. Our additions to the BERT architecture augment this attention with a more focused context to query (C2Q) and query to context (Q2C) attention via a set of modified Transformer encoder units. In addition, we explore adding convolution-based feature extraction within the coattention architecture to add localized information to self-attention. We found that coattention significantly improves the no answer F1 by 4 points in the base and 1 point in the large architecture. After adding skip connections the no answer F1 improved further without causing an additional loss in has answer F1. The addition of localized feature extraction added to attention produced an overall dev F1 of 77.03 in the base architecture. We applied our findings to the large BERT model which contains twice as many layers and further used our own augmented version of the SQUAD 2.0 dataset created by back translation, which we have named SQUAD 2.Q. Finally, we performed hyperparameter tuning and ensembled our best models for a final F1/EM of 82.317/79.442 (Attention on Steroids, PCE Test Leaderboard).

연구 동기 및 목표

  • 방향성 있는 공주의 기반(C2Q 및 Q2C)을 도입하여 BERT의 SQuAD 2.0 성능, 특히 무답변 질문 탐지 능력을 향상시키기.
  • BERT의 전역 주의 메커니즘의 한계를 보완하기 위해 질문과 문맥 간의 계층적, 문맥 인식 주의 흐름에 집중하기.
  • 1D 컨볼루션을 통합하여 국소 텍스트 패턴을 캡처함으로써 특징 표현을 향상시키기.
  • 백번역을 활용한 데이터 증강을 통해 더 다양한 훈련 세트(SQUAD 2.Q)를 만들고 일반화 능력을 향상시키기.
  • 최적화 및 앙상블 모델링을 통해 SQuAD 2.0 개발 세트에서 최신 기술 성능을 달성하고, 특히 무답변 F1에서의 성능 향상에 초점하기.

제안 방법

  • 질문과 문맥 표현을 방향성 있는 계층적 방식으로 처리하는 전용 C2Q 및 Q2C 공주의 모듈을 BERT의 자기주의 메커니즘에 통합하기.
  • 공주의 레이어 이후 잔차(스킵) 연결을 도입하여 학습 안정성과 기울기 흐름 향상시키기.
  • 공주의 아키텍처 내부에 1D 컨볼루션 레이어를 삽입하여 국소적 n-gram 특징을 추출하고, 짧은 범위의 의존성 표현을 강화하기.
  • 시작 및 끝 구간 예측 헤드를 조합하여 수정된 BERT 아키텍처를 SQuAD 2.0에서 피지컬 트레이닝을 수행하고, 시작 및 끝 위치에 대해 별도의 로짓을 사용하기.
  • NMT를 통해 SQuAD 2.0 예제를 영어로 백번역하여 언어 다양성과 강건성을 향상시킨 증강 데이터셋 SQUAD 2.Q를 생성하기.
  • 하이퍼파rameter 튜닝 및 상위 3개 모델의 앙상블을 수행하여 일반화 및 강건성을 향상시키고, 특히 무답변 질문에 대해 성능 향상에 기여하기.

실험 결과

연구 질문

  • RQ1방향성 있는 공주의 기반(C2Q 및 Q2C)이 SQuAD 2.0에서 무답변 질문 탐지 능력 향상에 기여하는가?
  • RQ2공주의 기반에 1D 컨볼루션 레이어를 통합하면 국소적 텍스트 패턴을 캡처함으로써 성능 향상에 기여하는가?
  • RQ3백번역을 통한 데이터 증강(SQUAD 2.Q)이 모델의 일반화 및 강건성 향상에 어느 정도 기여하는가?
  • RQ4스킵 연결과 앙상블 학습이 무답변 질문에 대해 F1 및 EM 점수에 어떤 영향을 미치는가?
  • RQ5qualitative 분석에서 표준 BERT 주의 메커니즘보다 공주의 기반 메커니즘이 단어 쌍 간의 관계를 더 잘 유지하는가?

주요 결과

  • C2Q 및 Q2C 공주의 기반 도입으로 기본 BERT 모델에서 무답변 F1이 4점 향상되었고, 라지 모델에서는 1점 향상되었다.
  • 잔차 연결은 has-answer F1을 떨어뜨리지 않고도 무답변 F1을 추가로 향상시켜 더 나은 일반화 및 학습 안정성을 나타냈다.
  • 기본 모델는 공주의 기반 및 컨볼루션 특징 추출을 통합한 후 개발 세트에서 F1 77.03을 달성했다.
  • 최종 앙상블 모델은 SQuAD 2.0 테스트 세트에서 개발 F1 82.317 및 EM 79.442를 기록하여 BERT Large 대비 3.5점 향상된 성능을 보였다.
  • qualitative 분석 결과, 모델는 'spirit'과 'Christian'을 별개의 개념으로 유지함으로써 무답변 질문을 정확히 식별했고, BERT Large는 이들을 잘못 조합하여 오류를 일으켰다.
  • 오류 분석 결과, 모델는 'What' 질문에서 기준 모델 대비 30개의 오류를 줄였지만, 'Which' 및 'What' 유형 간의 혼동이 백번역 아티팩트로 인해 발생하여 성능 저하가 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.