Skip to main content
QUICK REVIEW

[논문 리뷰] Chinese Word Segmentation with Heterogeneous Graph Neural Network

Xuemei Tang, Jun Wang|arXiv (Cornell University)|2022. 01. 22.
Natural Language Processing Techniques인용 수 5
한 줄 요약

이 논문은 다층적 언어적 특징—자모, 어휘, n-그램, 의존 구문 구조—을 통합하여 통합된 그래프 구조로 구성하는 이종 그래프 신경망 프레임워크인 HGNSeg를 제안한다. 이를 통해 중국어 어절 분할 성능을 햖थ하고, 특히 도메인 간 설정에서 OOV(어휘 외 단어) 오류를 크게 감소시킨다. 사전에 훈련된 언어 모델을 활용하고 외부 지식을 이종 그래프 학습으로 구조화함으로써, HGNSeg는 여섯 개의 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In recent years, deep learning has achieved significant success in the Chinese word segmentation (CWS) task. Most of these methods improve the performance of CWS by leveraging external information, e.g., words, sub-words, syntax. However, existing approaches fail to effectively integrate the multi-level linguistic information and also ignore the structural feature of the external information. Therefore, in this paper, we proposed a framework to improve CWS, named HGNSeg. It exploits multi-level external information sufficiently with the pre-trained language model and heterogeneous graph neural network. The experimental results on six benchmark datasets (e.g., Bakeoff 2005, Bakeoff 2008) validate that our approach can effectively improve the performance of Chinese word segmentation. Importantly, in cross-domain scenarios, our method also shows a strong ability to alleviate the out-of-vocabulary (OOV) problem.

연구 동기 및 목표

  • 기존 CWS 방법들이 다층적 언어 정보와 구조적 의존성을 효과적으로 통합하지 못하는 한계를 해결하기 위해.
  • 자모, 어휘, n-그램, 의존 구문을 그래프 내의 이종 노드로 모델링하여 중국어 어절 분할 성능을 향상시키기 위해.
  • 풍부한 언어 표현을 통해 도메인 간 CWS 시나리오에서의 어휘 외 단어(OOV) 문제를 줄이기 위해.
  • 외부 언어 자원의 구조적 정보를 그래프 신경망을 통해 명시적으로 인코딩하는 새로운 프레임워크를 개발하기 위해.

제안 방법

  • 자모, 분할된 어휘, n-그램, 문법적 의존성 등을 노드로 하는 이종 그래프를 구축하며, 각 언어 수준에 대해 별도의 노드 유형을 설정한다.
  • 다중 엣지 유형을 설정: 위치 일치 기반의 자모-어휘/n-그램 엣지와 파싱 도구에서 유도된 머리-의존 관계 기반의 의존 문법 엣지.
  • 이종 그래프 신경망(HGNN)을 사용해 다양한 노드 및 엣지 유형 간의 이웃 정보를 집계하고, 메시지 전달을 통해 노드 표현을 업데이트한다.
  • 컨텍스트 표현을 향상시키기 위해 사전에 훈련된 언어 모델 임베딩을 초기 노드 특징으로 통합한다.
  • CWS를 위한 시퀀스 레이블링 손실을 공동으로 최적화하여 F1 점수와 OOV 재현율을 최적화한다.
  • 여섯 개의 벤치마크 데이터셋(예: Bakeoff 2005, 2008)에서 모델을 평가하고, 구성 요소를 추상화하여 각 그래프 하위구조의 기여도를 분석한다.

실험 결과

연구 질문

  • RQ1이종 그래프 신경망은 자모, 어휘, n-그램, 문법 구조 등 다층적 언어적 특징을 중국어 어절 분할에 효과적으로 통합할 수 있는가?
  • RQ2표면 수준의 특징만을 사용하는 모델에 비해 의존 문법 구조를 포함함으로써 분할 정확도와 OOV 대응 능력은 어떻게 향상되는가?
  • RQ3제안된 프레임워크는 도메인 간 CWS 시나리오에서 OOV 오류율을 어느 정도 감소시키는가?
  • RQ4훈련 데이터 기반 어휘와 고빈도 n-그램 어휘의 차이, 그리고 LTP 4.0과 Stanford CoreNLP와 같은 문법 파서 도구의 선택이 모델 성능에 어떤 영향을 미치는가?

주요 결과

  • HGNSeg는 여섯 개의 벤치마크 CWS 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, F1 점수가 이전 방법들을 항상 초월한다.
  • 자모-어휘/n-그램 하위그래프가 성능 향상에 가장 크게 기여하며, PKU에서는 최대 3%까지 F1 점수를 향상시키고 MSR에서는 1.62% 향상되었다.
  • 의존 문법 하위그래프는 F1 점수와 OOV 재현율을 모두 향상시키지만, 자모-어휘/n-그램 하위그래프만큼의 영향은 크지 않다.
  • 도메인 간 설정에서 모델은 도메인 특화 n-그램을 활용함으로써 OOV 오류를 감소시켰으며, 데이터셋 평균에서 $R_{oov}$가 78.80%에서 80.67%로 상승하였다.
  • 이 프레임워크에서 LTP 4.0은 Stanford CoreNLP보다 더 우수한 성능을 보였으며, 모든 데이터셋에서 더 높은 CWS F1 점수를 기록하였다.
  • 훈련 데이터 기반 어휘와 고빈도 n-그램 어휘를 조합할 경우 최고의 성능을 기록하였으며, SXU에서는 $R_{oov}$가 86.10%에 도달했고, CITYU에서는 91.99%에 도달하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.