[논문 리뷰] Knowledge Enhanced Attention for Robust Natural Language Inference
이 논문은 외부 어휘 지식을 다중 헤드 어텐션 레이어에 통합함으로써 자연어 추론(NLI)에서의 강건성을 향상시키는 지식 기반 어텐션 메커니즘을 제안한다. 구조화된 지식 임베딩을 사용해 원시 어텐션 점수를 변환함으로써 추가 파rameter 없이도 성능을 크게 향상시키며, BERT와 결합할 경우 적대적 SNLI 세트에서 인간 수준의 정확도를 달성한다.
Neural network models have been very successful at achieving high accuracy on natural language inference (NLI) tasks. However, as demonstrated in recent literature, when tested on some simple adversarial examples, most of the models suffer a significant drop in performance. This raises the concern about the robustness of NLI models. In this paper, we propose to make NLI models robust by incorporating external knowledge to the attention mechanism using a simple transformation. We apply the new attention to two popular types of NLI models: one is Transformer encoder, and the other is a decomposable model, and show that our method can significantly improve their robustness. Moreover, when combined with BERT pretraining, our method achieves the human-level performance on the adversarial SNLI data set.
연구 동기 및 목표
- 적대적 예제에서 성능이 20퍼센트 이상 감소하는 최신 NLI 모델의 열악한 강건성 문제를 해결한다.
- 모델에 특화되어 있고 아키텍처 변경이 필요한 기존 지식 통합 방법의 한계를 극복한다.
- 다양한 NLI 아키텍처에 걸쳐 어텐션 메커니즘에 외부 지식을 통합할 수 있는 일반적이고 파rameter가 없는 방법을 개발한다.
- 강건성 향상에 있어 추론 및 학습 시 지식 통합이 필수적임을 입증한다.
- 간단하고 이식 가능한 어텐션 수정을 통해 사전 훈련된 모델(BERT 등)과 결합하여 적대적 SNLI 벤치마크에서 인간 수준의 성능을 달성한다.
제안 방법
- 외부 지식 소스(예: WordNet)에서 유래한 구조화된 임베딩을 활용해 어텐션 점수 계산 방식을 수정하는 지식 기반 어텐션 메커니즘을 도입한다.
- 외부 지식 임베딩의 학습된 투영을 사용해 원시 어텐션 점수를 변환함으로써, 입력 분포를 초월해 의미적으로 관련된 토큰에 어텐션을 기울일 수 있도록 한다.
- 모델 아키텍처나 파arameter를 변경하지 않고도 분해 가능 어텐션 모델과 트랜스포머 기반 모델(예: BERT) 모두에 수정된 어텐션 레이어를 적용한다.
- 모델이 외부 지식의 효과적인 활용을 배울 수 있도록 학습 및 추론 모두에서 지식 통합이 이루어지도록 보장한다.
- 기본 아키텍처로 사전 훈련된 모델인 BERT와 OpenAI GPT를 사용하고, 지식 기반 어텐션을 그들의 다중 헤드 어텐션 레이어에 적용한다.
- 동의어, 하위어, 반의어와 같은 어휘 지식을 활용해 적대적 예제를 생성하고 어텐션 메커니즘의 정렬을 향상시킨다.
실험 결과
연구 질문
- RQ1어텐션 메커니즘에 외부 어휘 지식을 통합하면 적대적 예제에서 NLI 모델의 강건성이 향상되는가?
- RQ2제안된 방법은 분해 가능 모델과 트랜스포머를 포함한 다양한 NLI 아키텍처로 일반화되는가?
- RQ3지식 통합으로 인한 성능 향상은 학습 및 추론 모두에 적용되었을 때에만 발생하는가?
- RQ4사전 훈련된 모델(BERT 등)과 결합했을 때 이 방법이 적대적 NLI 벤치마크에서 인간 수준의 성능을 달성할 수 있는가?
- RQ5간편성, 이식 가능성, 효과성 측면에서 이 방법은 모델에 특화된 지식 통합 기법보다 어떻게 비교되는가?
주요 결과
- 지식 기반 어텐션 메커니즘은 SNLI 데이터셋에서 적대적 정확도를 20퍼센트 이상 향상시키며, Model I는 지식이 없는 경우 63.2% 대비 적대적 SNLI에서 84.4%의 정확도를 기록한다.
- BERT와 결합했을 때, 이 방법은 적대적 SNLI 테스트 세트에서 93.9%의 정확도를 달성했으며, Glockner 등(2018)에서 보고한 추정 인간 수준의 성능과 일치한다.
- BERT에서 중립 클래스의 리콜이 11%에서 23%로, 함의 예제의 정밀도가 74%에서 85%로 향상되어 일반화 능력 향상이 뚜렷하다.
- 추론 단계에서만 지식 통합을 수행하는 사후 통합은 강건성을 향상시키지 못하며, 효과적인 지식 통합을 위해서는 학습 및 추론 모두에서 통합이 이루어져야 한다는 점을 입증한다.
- 표준 BERT 대비 적대적 SNLI에서 3%의 정확도 향상을 기록하며, 심지어 대규모 사전 훈련된 모델이라도 지식 기반 어텐션 메커니즘이 유의미한 이점을 제공한다는 것을 보여준다.
- 이 방법은 모델에 종속되지 않고 파arameter가 없어, 아키텍처 수정 없이도 어떤 어텐션 기반 모델에도 널리 적용 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.