Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Accurate Word Segmentation for Chinese Patents

Si Li, Nianwen Xue|arXiv (Cornell University)|2016. 11. 30.
Natural Language Processing Techniques참고 문헌 32인용 수 3
한 줄 요약

이 논문은 142건의 특허로 구성된 수작업으로 분할된 코퍼스와 중국 트리뱅크에서 유도된 향상된 특징을 활용하여 특허 내 정확한 중국어 어절 분할을 위한 문자 기반 준지도 학습 시퀀스 레이블링 모델을 제안한다. 모델은 보류된 테스트 세트에서 F1 스코어 95.08%와 개발 세트에서 96.59%를 기록하며, 일반 도메인 데이터인 중국 트리뱅크만으로 훈련된 모델보다 유의하게 뛰어난 성능을 보였다.

ABSTRACT

A patent is a property right for an invention granted by the government to the inventor. An invention is a solution to a specific technological problem. So patents often have a high concentration of scientific and technical terms that are rare in everyday language. The Chinese word segmentation model trained on currently available everyday language data sets performs poorly because it cannot effectively recognize these scientific and technical terms. In this paper we describe a pragmatic approach to Chinese word segmentation on patents where we train a character-based semi-supervised sequence labeling model by extracting features from a manually segmented corpus of 142 patents, enhanced with information extracted from the Chinese TreeBank. Experiments show that the accuracy of our model reached 95.08% (F1 score) on a held-out test set and 96.59% on development set, compared with an F1 score of 91.48% on development set if the model is trained on the Chinese TreeBank. We also experimented with some existing domain adaptation techniques, the results show that the amount of target domain data and the selected features impact the performance of the domain adaptation techniques.

연구 동기 및 목표

  • 일반 도메인 훈련 데이터에 의존하는 기존 중국어 어절 분할 모델이 특허 텍스트에서 낮은 성능을 보이는 데 기인한 문제를 해결하기 위해.
  • 중국 특허에서 흔한 과학적 및 기술적 용어의 분할 정확도를 향상시키기 위해.
  • 제한된 수작업으로 분할된 특허 데이터와 외부 언어학적 자원을 결합한 실용적이고 데이터 효율적인 접근법을 개발하기 위해.
  • 저자원 특허 분할 환경에서 도메인 적응 기술의 효과성을 평가하기 위해.
  • 도메인 특화 어절 분할에서 모델 성능에 영향을 주는 핵심 특징과 데이터 양의 임계값을 규명하기 위해.

제안 방법

  • 142건의 중국 특허로 구성된 수작업으로 분할된 코퍼스를 사용하여 문자 기반 준지도 학습 시퀀스 레이블링 모델을 훈련한다.
  • 중국 트리뱅크에서 추출한 특징을 모델에 통합하여 희귀어 및 기술어의 인식 능력을 향상시킨다.
  • 비라벨된 특허 텍스트를 활용하여 모델 일반화 능력을 향상시키기 위해 준지도 학습 기법을 적용한다.
  • 어순 경계를 구조적 예측하기 위해 조건부 랜덤 필드(CRF)를 시퀀스 레이블링 프레임워크로 사용한다.
  • 품사 태그 및 형태소 패턴과 같은 도메인 특화 언어학적 특징을 선별하고 통합한다.
  • 표준 F1 스코어 지표를 사용하여 보류된 테스트 세트와 개발 세트를 통해 모델 성능을 평가한다.

실험 결과

연구 질문

  • RQ1제한된 라벨된 데이터를 가진 소규모 수작업으로 분할된 특허 코퍼스를 기반으로 한 문자 기반 모델이 낮은 데이터 양에도 불구하고 높은 분할 정확도를 달성할 수 있는가?
  • RQ2중국 트리뱅크에서 유도된 특징이 특허 텍스트 내 기술어 인식에 어느 정도 기여하는가?
  • RQ3대상 도메인(특허) 훈련 데이터의 양이 도메인 적응 기술의 성능에 어떤 영향을 미치는가?
  • RQ4어느 특정 특징이 특허 전용 용어 분할 성능 향상에 가장 효과적인가?
  • RQ5제안된 모델은 중국 트리뱅크와 같은 일반 도메인 코퍼스에만 훈련된 베이스라인 모델과 비교해 어떻게 성능을 냈는가?

주요 결과

  • 제안된 모델은 보류된 테스트 세트에서 F1 스코어 95.08%를 기록하여 중국 특허 어절 분할의 높은 정확도를 입증하였다.
  • 개발 세트에서는 F1 스코어 96.59%를 기록하였으며, 중국 트리뱅크만으로 훈련된 모델(91.48% F1)보다 유의미하게 뛰어난 성능을 보였다.
  • 중국 트리뱅크에서 유도된 특징의 통합은 모델이 특허 내 희귀어 및 기술어를 인식하는 능력을 크게 향상시켰다.
  • 도메인 적응 기술은 충분한 대상 도메인 데이터가 확보된 경우에만 뛰어난 성능를 보였으며, 이는 데이터 양이 핵심 요소임을 시사한다.
  • 특징 선택은 모델 성능에 명백한 영향을 미쳤으며, 일부 언어학적 특징이 다른 특징보다 정확도 향상에 더 기여하였다.
  • 준지도 학습 접근법은 특히 저자원 환경에서 비라벨된 특허 텍스트를 활용함으로써 일반화 능력을 효과적으로 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.