Skip to main content
QUICK REVIEW

[논문 리뷰] FLAT: Chinese NER Using Flat-Lattice Transformer

Xiaonan Li, Hang Yan|arXiv (Cornell University)|2020. 04. 24.
Topic Modeling참고 문헌 20인용 수 12
한 줄 요약

FLAT는 중국어 NER를 위한 평탄한 레이티스 Transformer 아키텍처를 제안하며, 동적 레이티스 구조를 헤드 및 테일 위치 인코딩을 가진 스파닝으로 변환하여 전체 병렬 처리를 가능하게 하고, 문자 및 단어 수준의 정보를 효율적으로 모델링한다. 이는 네 가지 벤치마크 데이터셋에서 최신 기술 성능을 달성하고 기존 어휘 기반 모델보다 빠른 추론 속도를 제공한다.

ABSTRACT

Recently, the character-word lattice structure has been proved to be effective for Chinese named entity recognition (NER) by incorporating the word information. However, since the lattice structure is complex and dynamic, most existing lattice-based models are hard to fully utilize the parallel computation of GPUs and usually have a low inference-speed. In this paper, we propose FLAT: Flat-LAttice Transformer for Chinese NER, which converts the lattice structure into a flat structure consisting of spans. Each span corresponds to a character or latent word and its position in the original lattice. With the power of Transformer and well-designed position encoding, FLAT can fully leverage the lattice information and has an excellent parallelization ability. Experiments on four datasets show FLAT outperforms other lexicon-based models in performance and efficiency.

연구 동기 및 목표

  • 기존 레이티스 기반 중국어 NER 모델에서 RNN 또는 동적 구조에 의존함으로써 발생하는 비효율성과 장거리 정보 모델링의 한계를 해결하기 위해.
  • 레이티스 구조 입력에 대해 Transformer 모델의 전체 병렬 처리를 가능하게 하기 위해 레이티스를 스팬으로 평탄화하고 위치 인코딩을 적용하기 위해.
  • 단어 분할에서 발생하는 오류 전파 없이 문자 및 단어 수준의 정보를 효과적으로 통합하기 위해.
  • 중국어 NER 벤치마크에서 정확도와 추론 속도 양면에서 기존 어휘 기반 모델을 능가하기 위해.

제안 방법

  • 문자-단어 레이티스를 각 스팬(시작(헤드) 및 끝(테일) 위치를 가진 문자 또는 잠재적 단어)으로 구성된 평탄한 구조로 변환한다.
  • Transformer 자기주의 메커니즘 내에서 레이티스 구조 정보를 유지하기 위해 헤드 및 테일 위치를 사용하는 새로운 위치 인코딩 기법을 도입한다.
  • 표준 다중 헤드 자기주의를 사용하여 문자와 모든 잠재적 단어(자기 매칭 단어 포함) 간의 직접 상호작용을 가능하게 한다.
  • 문맥 표현 및 실체 분류 향상을 위해 사전 학습된 BERT 임베딩을 입력 특징으로 활용한다.
  • 표준 Transformer 아키텍처에 따라 각 서브레이어 이후 잔차 연결과 레이어 정규화를 적용한다.
  • 전체 순차적 레이블링을 위해 교차 엔트로피 손실과 CRF 디코딩을 사용하여 엔드 투 엔드 최적화로 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1평탄한 레이티스 표현은 중국어 NER를 위한 Transformer의 효율적이고 완전히 병렬화된 훈련을 가능하게 하는가?
  • RQ2제안된 헤드-테일 위치 인코딩은 더 나은 실체 인식을 위해 레이티스 구조 정보를 효과적으로 유지하는가?
  • RQ3정확도와 추론 속도 양면에서 레이티스-LSTM 및 그래프 기반 모델을 능가할 수 있는가?
  • RQ4사전 학습된 BERT 임베딩의 통합은 FLAT 아키텍처에서 성능에 어떤 영향을 미치는가?

주요 결과

  • FLAT는 네 개의 중국어 NER 데이터셋에서 최신 기술 성능을 달성하며, F1 및 정확도 지표에서 BERT+CRF 및 기타 어휘 기반 모델을 모두 능가한다.
  • Ontonotes 데이터셋에서 FLAT는 베이스라인 BERT+CRF 모델 대비 Span F를 1.68 포인트 향상시키고 Type Acc도 1.68 포인트 향상시켰다.
  • MSRA 데이터셋에서 FLAT는 Span F 96.09와 Type Acc 95.86을 기록했으며, 베이스라인 BERT의 94.95와 95.53보다 뚜렷이 뛰어나다.
  • 레이티스-LSTM가 동적 구조와 순차 처리로 인해 고통받는 것과는 달리, FLAT는 완전한 GPU 병렬 처리 덕분에 뛰어난 추론 속도를 보였다.
  • 제거 실험 결과 헤드-테일 위치 인코딩이 필수적임을 확인하였으며, 이를 제거할 경우 특히 Span F에서 성능 저하가 발생하였다.
  • Resume 및 Weibo와 같은 소규모 데이터셋에서는 약간의 향상이 관찰되어, 레이티스 통합의 이점이 더 큰, 더 풍부한 데이터셋에서 뚜렷하게 드러남을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.