Skip to main content
QUICK REVIEW

[논문 리뷰] Joint Chinese Word Segmentation and Part-of-speech Tagging via Two-stage Span Labeling

Duc-Vu Nguyen, Linh-Bao Vo|arXiv (Cornell University)|2021. 12. 17.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 이원형 연산을 문자 경계 표현에 적용하여 n-그램과 그 POS 태그를 모델링하는, 병행 중국어 형태소 분석 및 품사 태깅을 위한 이단계 스파닝 레이블링 모델인 SpanSegTag를 제안한다. BERT 기반 모델은 CTB7 및 CTB9에서 최신 기술 수준(SOTA) 성능을 달성하며, TwASP와 같은 이전 방법들보다 뚜렷한 향상 효과를 보였고, 외부 툴킷에 의존하지 않으면서도 더 작은 모델 크기를 유지하였다.

ABSTRACT

Chinese word segmentation and part-of-speech tagging are necessary tasks in terms of computational linguistics and application of natural language processing. Many re-searchers still debate the demand for Chinese word segmentation and part-of-speech tagging in the deep learning era. Nevertheless, resolving ambiguities and detecting unknown words are challenging problems in this field. Previous studies on joint Chinese word segmentation and part-of-speech tagging mainly follow the character-based tagging model focusing on modeling n-gram features. Unlike previous works, we propose a neural model named SpanSegTag for joint Chinese word segmentation and part-of-speech tagging following the span labeling in which the probability of each n-gram being the word and the part-of-speech tag is the main problem. We use the biaffine operation over the left and right boundary representations of consecutive characters to model the n-grams. Our experiments show that our BERT-based model SpanSegTag achieved competitive performances on the CTB5, CTB6, and UD, or significant improvements on CTB7 and CTB9 benchmark datasets compared with the current state-of-the-art method using BERT or ZEN encoders.

연구 동기 및 목표

  • 중국어 형태소 분석 및 품사 태깅에서 모호성 해소 및 알 수 없는 단어 탐지 문제를 해결하기 위해.
  • 문자 기반 태깅 모델이 겹치는 모호한 문자열을 처리하는 데에 한계를 극복하기 위해.
  • 외부 상용 언어학적 툴킷에 의존하지 않고도 명시적으로 n-그램 스팬과 그 품사 태그를 모델링하는 통합 모델을 개발하기 위해.
  • CTB7 및 CTB9와 같은 대규모 벤치마크에서 성능을 향상시키면서도 모델 복잡도를 감소시키기 위해.
  • 순서 태깅 작업에서 전통적인 문자 기반 태깅의 대안으로 스팬 레이블링을 탐색하기 위해.

제안 방법

  • 모델은 이단계 스팬 레이블링 프레임워크를 사용한다: 먼저 단어 스팬을 예측하고, 그 다음에 해당 스팬에 품사 태그를 할당한다.
  • 입력 문자의 문맥적 표현을 생성하기 위해 BERT 또는 BiLSTM 인코더를 사용한다.
  • 연속된 문자의 왼쪽 및 오른쪽 경계 표현을 이원형 연산을 통해 조합하여 단어 및 품사 태그의 스팬 가능성 예측한다.
  • 겹치는 스팬을 해결하기 위해 후처리 히우리스틱 기법을 사용하여 겹치지 않는 단어 경계를 보장한다.
  • 스패닝 예측에 대한 통합 손실 함수를 사용하여 형태소 분할과 품사 태깅을 동시에 최적화한다.
  • 메모리 네트워크와 외부 언어학적 특징을 회피하고, 오직 학습된 스팬 표현에 의존한다.

실험 결과

연구 질문

  • RQ1스패닝 레이블링 접근 방식이 전통적인 문자 기반 태깅보다 병행 중국어 형태소 분석 및 품사 태깅에서 더 우수한 성능을 낼 수 있는가?
  • RQ2이원형 연산을 사용해 n-그램 스팬을 모델링하면 기존 태깅 파라다임에 비해 모호성 해소에 어떻게 기여하는가?
  • RQ3상용 언어학적 툴킷을 사용하지 않고도 BERT 기반 모델이 최신 기술 수준 성능을 달성할 수 있는가?
  • RQ4TwASP와 같은 기존 SOTA 방법들과 비교해 모델 크기와 추론 속도는 어떻게 되는가?
  • RQ5스패닝 기반 접근 방식은 어휘 내 모호성 해소와 OOV 단어 탐지에서 더 나은 성능을 보일 수 있는가?

주요 결과

  • BERT 기반 SpanSegTag는 CTB7(F1: 80.19) 및 CTB9(F1: 78.52)에서 기존 SOTA 방법인 TwASP(BERT 또는 ZEN 사용)를 뛰어넘는 뚜렷한 향상을 보였다.
  • CTB5, CTB6, UD 데이터셋에서도 경쟁력 있는 F1 스코어를 기록했으며, CTB7에서는 95.33, CTB9에서는 95.80의 F1 스코어를 기록했다.
  • 어휘 내 단어와 그 품사 태그에 대해 높은 재현율(R_POS-iV)을 기록하여 강력한 모호성 해소 능력을 보였다.
  • TwASP(433–1170 MB)에 비해 더 작은 모델 크기(433–441 MB)를 확보하여 데이터셋 규모에 따른 파라미터 의존도가 감소했다.
  • TwASP(239 문장/초)에 비해 약간 느린 추론 속도(264 문장/초)를 보였지만, 시간이 오래 걸리는 외부 툴킷 호출을 피할 수 있었다.
  • CTB6, CTB7, CTB9에서 약간 더 뛰어난 CAS(조합 모호성 문자열) 탐지 성능를 보였으며, 이는 향상된 문법적 및 의미적 이해 능력을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.