[논문 리뷰] Supervising Model Attention with Human Explanations for Robust Natural Language Inference
이 논문은 e-SNLI 데이터셋의 인간이 생성한 설명을 사용하여 주의 메커니즘을 감독함으로써 자연어 추론(NLI) 모델의 견고성을 향상시키는 방법을 제안한다. 설명에서 강조된 단어—특히 명사와 동사와 같은 내용어에 더 초점을 맞추도록 유도함으로써, SNLI에서 최고 성능을 기록하고 분포 외 데이터셋으로의 일반화 능력도 향상시키며, 동시에 주의 분포가 정지어와标 punctuations에 대해 덜 편향되고 더 해석 가능해진다.
Natural Language Inference (NLI) models are known to learn from biases and artefacts within their training data, impacting how well they generalise to other unseen datasets. Existing de-biasing approaches focus on preventing the models from learning these biases, which can result in restrictive models and lower performance. We instead investigate teaching the model how a human would approach the NLI task, in order to learn features that will generalise better to previously unseen examples. Using natural language explanations, we supervise the model's attention weights to encourage more attention to be paid to the words present in the explanations, significantly improving model performance. Our experiments show that the in-distribution improvements of this method are also accompanied by out-of-distribution improvements, with the supervised models learning from features that generalise better to other NLI datasets. Analysis of the model indicates that human explanations encourage increased attention on the important words, with more attention paid to words in the premise and less attention paid to punctuation and stop-words.
연구 동기 및 목표
- 데이터셋 편향에 의존하는 대신 인간의 추론 방식을 모방하도록 가르침으로써 NLI 모델의 분포 외 데이터에 대한 일반화 능력이 열 劣하는 문제를 해결하기 위해.
- 인간의 설명을 주의 메커니즘의 감독 신호로 활용하여 분포 내 및 분포 외 성능을 모두 향상시키기 위해.
- 가설 전용 편향을 줄이기 위해 모델이 전제 문장의 단어에 더 많은 주의를 기울이고, 정지어와标 punctuations에 덜 주목하도록 유도하기 위해.
- 사람이 식별한 중요 단어와 일치하는 더 해석 가능한 주의 패턴을 생성하기 위해.
제안 방법
- DeBERTa의 자기주의 메커니즘 레이어에서 [CLS] 토큰의 주의 가중치를 감독하기 위해 대조 손실 항목을 도입하여, 인간 설명에 포함된 단어에 대해 더 높은 주의를 유도한다.
- 최상위 자기주의 레이어에 감독을 적용하며, 설명과 관련된 단어에 대응하도록 별도의 주의 메커니즘을 학습시킨다.
- Pruthi 등(2020)이 제안한 설명 기반 융합을 사용하는 방법을 적응하여 NLI 환경에서의 유효성을 시험한다.
- e-SNLI 데이터셋의 자유형 텍스트 설명을 사용해 각 전제-가설 쌍에서 중요한 단어를 식별하고, 주의 감독을 위한 신호를 구성한다.
- NLI 분류 손실과 설명 기반 주의 정규화를 조합하여 모델을 훈련시키며, 다양한 주의 헤드를 활용해 분석을 수행한다.
- 품사 태깅과 단어 빈도 분석을 통해 주의 패턴을 평가하여, 내용어로의 주의 이동과 기능어에서의 주의 감소 여부를 분석한다.
실험 결과
연구 질문
- RQ1인간의 설명을 사용해 모델의 주의를 감독하면, NLI에서 분포 내 및 분포 외 성능 향상에 기여할 수 있는가?
- RQ2인간 설명 기반 주의 감독은 더 해석 가능하고 인간과 일치하는 주의 패턴을 유도하는가?
- RQ3모델이 설명과 관련된 단어에 주의를 기울이도록 훈련할 경우, 품사 태그 측면에서 주의 분포가 어떻게 변화하는가?
- RQ4주의 감독을 통해 표준 NLI 모델에서 관찰되는 가설 전용 편향을 줄일 수 있는가?
- RQ5감독 주의 헤드를 적게 사용해도 유의미한 성능 향상이 이루어지는가? 이는 주의 헤드 간 레이어 간 전이가 어떻게 이루어지는지를 시사하는가?
주요 결과
- 상위 레이어의 12개 주의 헤드를 감독함으로써, [CLS] 토큰의 전제 문장에 대한 주의 비율이 22.86%에서 50.89%로 상승하여 일반화 능력이 크게 향상되었다.
- 단지 3개의 헤드만 감독해도 이전 레이어의 전제 문장 주의 비율이 54.8%로 상승하여 감독 신호가 하위 레이어로 전파됨을 시사한다.
- 감독된 모델은 강조된 단어 중 46%가 명사, 동사, 형용사에 해당하며, 문장 부호, 관형사, 정지어에 대한 주의를 줄였다.
- DeBERTa와 결합했을 때 SNLI 벤치마크에서 새로운 최고 성능(SOTA)을 달성하여 이전 방법들을 능가했다.
- 감독된 모델의 주의 가중치는 인간 설명에 나타날 단어를 효과적으로 예측했으며, 전용 설명 예측 모델 수준의 성능을 보였다.
- SNLI-hard라는 도전적인 분포 외 데이터셋에서도 성능 향상을 보여, 분포 이탈에 대한 더 높은 견고성 확보를 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.