Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring Swedish & English fastText Embeddings for NER with the Transformer

Tosin Adewumi, Foteini Liwicki|arXiv (Cornell University)|2020. 07. 23.
Topic Modeling참고 문헌 31인용 수 5
한 줄 요약

이 논문은 영어 및 스웨덴어의 fastText 임베딩을 기반으로 한 Transformer 기반 명명된 실체 인식(NER) 시스템에서, 더 작은 크기이지만 최적의 초모수로 설정된 데이터셋이 Common Crawl와 같은 더 큰 데이터셋보다 성능이 뛰어나다는 것을 평가한다. 이는 공개적으로 이용 가능한 첫 번째 스웨덴어 유사성 테스트 세트를 제안하며, 형태학적으로 복잡한 스웨덴어에서는 서브워드 n-그램이 성능 향상에 크게 기여하는 것으로 나타났다. 반면 영어에서는 더 큰 학습 데이터를 사용하는 word2vec 기반 CBoW 모델이 가장 우수한 성능을 보였다.

ABSTRACT

In this paper, our main contributions are that embeddings from relatively smaller corpora can outperform ones from larger corpora and we make the new Swedish analogy test set publicly available. To achieve a good network performance in natural language processing (NLP) downstream tasks, several factors play important roles: dataset size, the right hyper-parameters, and well-trained embeddings. We show that, with the right set of hyper-parameters, good network performance can be reached even on smaller datasets. We evaluate the embeddings at both the intrinsic and extrinsic levels. The embeddings are deployed with the Transformer in named entity recognition (NER) task and significance tests conducted. This is done for both Swedish and English. We obtain better performance in both languages on the downstream task with smaller training data, compared to recently released, Common Crawl versions; and character n-grams appear useful for Swedish, a morphologically rich language.

연구 동기 및 목표

  • 영어 및 스웨덴어의 NER 작업에서, 더 작은 코퍼스에서 학습된 fastText 임베딩과 더 큰 데이터셋인 Common Crawl에서 학습된 임베딩 간의 성능을 평가하는 것.
  • 내재 평가를 위한 공개적으로 이용 가능한 첫 번재 스웨덴어 유사성 테스트 세트를 개발하고 배포하는 것.
  • 초모수 조정이 임베딩 품질과 후속 NER 성능에 미치는 영향을 조사하는 것.
  • 형태학적으로 복잡한 언어인 스웨덴어와 비교하여 문자 n-그램의 유용성을 평가하는 것.

제안 방법

  • 영어 및 스웨덴어 코퍼스에서 스위프그램-음성 샘플링을 사용하여, 문자 n-그램(n=5)과 다양한 윈도우 크기를 적용해 fastText 임베딩을 학습하는 것.
  • 내재 평가 테스트(유사성 및 WordSim-353 포함)와 외재 평가(Transformer 기반 NER 모델 사용)를 통해 임베딩을 평가하는 것.
  • 양국어에 대해 최적의 초모수(윈도우 크기, 음성 샘플링, 서브워드 대비 워드 수준)를 도출하기 위해 그리드 서치를 적용하는 것.
  • 임베딩 간 성능 차이를 비교하기 위해 부트스트랩 기반 유의성 검정을 수행하는 것.
  • 가장 우수한 성능을 보인 임베딩을 사용하여 NER 작업에 대해 Transformer 모델을 학습하고 F1, 정밀도, 재현율 점수를 보고하는 것.
  • 전문가가 검증한 단어 유사성 관계를 포함한 새로운 스웨덴어 유사성 테스트 세트를 제작하고 검증하여 스웨덴어 임베딩의 내재 평가를 가능하게 하는 것.

실험 결과

연구 질문

  • RQ1더 작은 코퍼스에서 학습된 fastText 임베딩이 영어 및 스웨덴어의 후속 NER 작업에서 Common Crawl와 같은 더 큰 데이터셋에서 학습된 임베딩보다 성능이 뛰어나게 되는가?
  • RQ2형태학적으로 복잡한 언어인 스웨덴어에서 문자 n-그램이 영어에 비해 성능 향상에 얼마나 기여하는가?
  • RQ3유사성 및 WordSim-353을 통한 내재 평가가 후속 NER 성능을 신뢰성 있게 예측할 수 있는가?
  • RQ4초모수 선택(윈도우 크기, 음성 샘플링, 서브워드 대비 워드 수준)이 NER 성능에 어떤 영향을 미치는가?
  • RQ5스웨덴어 및 영어의 NER 작업에서 word2vec과 서브워드 기반 fastText 임베딩 간에 유의미한 성능 차이가 존재하는가?

주요 결과

  • 더 작은 코퍼스에서 학습된 서브워드 기반 fastText 임베딩이 스웨덴어 NER에서 더 큰 Common Crawl 기반 임베딩보다 뛰어난 성능을 보였으며, F1 점수는 각각 0.591과 0.492를 기록했다.
  • 영어의 경우, 윈도우 크기 8과 음성 샘플링을 적용한 word2vec CBoW 모델(w8s0h0)이 F1 점수 0.720을 기록하며, 서브워드 및 더 큰 Common Crawl 기반 임베딩보다 뛰어난 성능을 보였다.
  • 스웨덴어 서브워드 모델(w4s1h1)은 새로운 유사성 테스트 세트에서 스피어만 상관계수 74.7을 기록하여 뛰어난 내재 품질을 보였다.
  • 유의성 검정 결과, 영어에서 가장 우수한 임베딩 간 성능 차이는 우연이 아닐 가능성이 높았으며, 95% 신뢰구간은 [0.0003, 0.1674]였다. 반면 스웨덴어의 경우 유의미한 차이는 아니었으며, 95% 신뢰구간은 [-0.3257, 0.169]였다.
  • Transformer 모델은 최소 5 에포크 만에 수렴하여 이전의 LSTM 기반 모델보다 더 빠른 학습을 보였다.
  • 이 연구는 데이터셋 크기 증가만으로는 성능 향상이 보장되지 않으며, 최적의 초모수 설정이 높은 성능을 달성하는 데 핵심적이라는 점을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.