Skip to main content
QUICK REVIEW

[논문 리뷰] Does BERT Make Any Sense? Interpretable Word Sense Disambiguation with Contextualized Embeddings

Gregor Wiedemann, Steffen Remus|arXiv (Cornell University)|2019. 09. 23.
Natural Language Processing Techniques참고 문헌 37인용 수 121
한 줄 요약

맥락화된 단어 임베딩이 간단한 kNN 접근을 통해 단어 의미 구분(WSD)을 효과적으로 가능하게 하며, BERT가 어휘 샘플 WSD 데이터셋에서 새로운 최첨단 성능을 달성하고 임베딩 공간에서 의미의 클러스터링을 보여준다.

ABSTRACT

Contextualized word embeddings (CWE) such as provided by ELMo (Peters et al., 2018), Flair NLP (Akbik et al., 2018), or BERT (Devlin et al., 2019) are a major recent innovation in NLP. CWEs provide semantic vector representations of words depending on their respective context. Their advantage over static word embeddings has been shown for a number of tasks, such as text classification, sequence tagging, or machine translation. Since vectors of the same word type can vary depending on the respective context, they implicitly provide a model for word sense disambiguation (WSD). We introduce a simple but effective approach to WSD using a nearest neighbor classification on CWEs. We compare the performance of different CWE models for the task and can report improvements above the current state of the art for two standard WSD benchmark datasets. We further show that the pre-trained BERT model is able to place polysemic words into distinct 'sense' regions of the embedding space, while ELMo and Flair NLP do not seem to possess this ability.

연구 동기 및 목표

  • 맥락화된 단어 임베딩(CWEs)을 테스트베드로 삼아 단어 의미 구분을 제시한다.
  • 다양한 모델(Flair, ELMo, BERT)이 의미를 어떻게 인코딩하는지 평가한다.
  • 간단하고 해석 가능한 kNN 기반 WSD 방법을 테스트하여 근접성 기반 의미 구분을 평가한다.
  • WSD 성능에 대한 데이터셋의 효과(SE-2, SE-3, S7-T7, S7-T17)를 조사한다.
  • CWEs가 임베딩 공간에서 언제 의미를 분리된 영역으로 배치하는지에 대한 질적 분석을 제공한다.

제안 방법

  • WSD를 수행하기 위해 CWE 벡터에 대해 간단한 최근접 이웃 분류기(kNN)를 사용한다(학습 시 의미를 로컬로 kNN 사용).
  • 대상 단어를 기본형 벡터로 표현: 대상 단어를 targeting할 때 BERT의 워드피스 CWEs 평균값, 다른 모델은 표준 CWE 벡터를 사용한다.
  • BERT의 경우 대상 토큰의 마지막 네 층 워드피스 벡터를 평균한 값을 연결한다.
  • 불균형한 의미 빈도를 다루기 위해 k를 넓은 범위에서 바꾸고 정규화를 적용한다(k' = min(k, 특정 의미의 예시 수)).
  • 세 가지 CWE 모델(Flair, ELMo, BERT)을 네 가지 표준 WSD 데이터(SE-2, SE-3, S7-T7, S7-T17)와 두 개의 학습 말뭉치(SemCor, WNGT)에서 비교한다.
  • 의미 클러스터의 t-SNE 시각화 및 오류 분석을 포함한 질적 분석을 제공한다.

실험 결과

연구 질문

  • RQ1맥락화된 임베딩이 비모수적 간단한 분류기와 함께 사용할 때 효과적인 WSD를 가능하게 하는가?
  • RQ2다른 CWE 모델(Flair, ELMo, BERT)이 임베딩 공간에서 의미를 다르게 구성하는가?
  • RQ3학습 데이터의 희소성이 표준 벤치마크의 kNN 기반 WSD 성능에 어떤 영향을 미치는가?
  • RQ4BERT가 다의미 어휘를 ELMo 및 Flair에 비해 임베딩 공간에서 구분 가능한 영역에 얼마나 배치하는가?
  • RQ5POS 라벨이 있는 의미로 제한하는 것이 모든-단어(all-words) 작업의 WSD 정확도를 향상시키는가?

주요 결과

  • BERT 기반 CWEs가 SE-2, SE-3 및 S7-T7 과제에서 세 모델 중 최상의 WSD 성능을 달성( SE-2 및 SE-3에서 이전 최첨단 대비 현저한 향상 포함).
  • kNN WSD는 BERT 임베딩에서 의미 영역이 ELMo나 Flair보다 더 구분 가능함을 보여주며, 시각화에서의 클러스터링과 근접 이웃 정확도 상승으로 입증된다.
  • 데이터 희소성과 학습 데이터(SemCor/WNGT)와 테스트 데이터 간의 도메인 불일치로 인해 all-words 작업(S7-T7, S7-T17)에서 WSD 성능이 저하된다.
  • POS로 제한된(lemma+POS) 변형이 S7-T7 및 S7-T17에서 F1을 향상시키며 불균형 데이터에서 형태학적-통사적 범주를 제약하는 것이 의미 구분에 도움이 됨을 시사한다.
  • k를 증가시키면 결과가 안정화되는 경향이 있으며, BERT 임베딩과 결합될 때 어휘 샘플 과제에서 최첨단 결과를 달성할 수 있다.
  • 정성적 오류 분석은 근접 미스가 주로 미세한 동사 의미 및 교차 POS 혼동으로 발생하는 경우가 많음을 보여주지만, POS 제한은 이러한 오류를 줄이는 데 도움이 된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.