Skip to main content
QUICK REVIEW

[논문 리뷰] Development of a Spanish Version of the Xerox Tagger

Fernando Sánchez León, Amalio Francisco Nieto Serrano|arXiv (Cornell University)|1995. 05. 19.
Natural Language Processing Techniques참고 문헌 12인용 수 11
한 줄 요약

이 논문은 CRATER 프로젝트 내에서 ITU 코퍼스를 대상으로 스페인어를 위한 Xerox Tagger의 적응을 제안한다. 수작업로 설정된 매개변수와 확률적 추정을 융합한 혼합 모델 접근법을 도입하여, 스페인어 문법적 구조에 맞게 맞춤형 어휘집, 품사 테그셋, 학습 코퍼스 설계를 통해 태깅 정확도를 향상시켰다.

ABSTRACT

This paper describes work performed withing the CRATER ({\em C}orpus {\em R}esources {\em A}nd {\em T}erminology {\em E}xt{\em R}action, MLAP-93/20) project, funded by the Commission of the European Communities. In particular, it addresses the issue of adapting the Xerox Tagger to Spanish in order to tag the Spanish version of the ITU (International Telecommunications Union) corpus. The model implemented by this tagger is briefly presented along with some modifications performed on it in order to use some parameters not probabilistically estimated. Initial decisions, like the tagset, the lexicon and the training corpus are also discussed. Finally, results are presented and the benefits of the {\em mixed model} justified.

연구 동기 및 목표

  • 원래 영어를 대상으로 설계된 Xerox Tagger를 스페인어 텍스트의 품사 태깅에 정확하게 적용하기 위해 적응시키는 것.
  • ITU 코퍼스에 적합한 스페인어 전용 품사 테그셋, 어휘집, 학습 코퍼스를 개발하는 것.
  • 확률적 추정과 수작업으로 설정된 매개변수를 융합한 혼합 모델 접근법을 구현하여 태깅 성능을 향상시키는 것.
  • 대표적인 스페인어 코퍼스를 대상으로 적응된 태거의 효과성을 평가하는 것.
  • 다국어 환경에서 코퍼스 자원 강화 및 용어 추출을 향상시키는 데 CRATER 프로젝트의 목표에 기여하는 것.

제안 방법

  • 스페인어 문법적 범주를 반영하도록 Xerox Tagger의 품사 테그셋을 재정의하여 모델을 스페인어에 적응시켰다.
  • 단어 기반 태깅 결정을 지원하기 위해 스페인어 어휘집을 편성하고 태거에 통합하였다.
  • ITU 코퍼스의 언어적 특성과 반영되도록 학습 코퍼스를 선별하고 전처리하였다.
  • 일부 매개변수를 확률적 추정이 아닌 수작업으로 설정함으로써 혼합 모델 접근법을 적용하였다.
  • 태깅 정확도 향상을 위해 n-그램 언어 모델링과 형태소 분석의 조합을 사용하였다.
  • 성능 평가를 위해 스페인어 버전의 ITU 코퍼스를 대상으로 시스템을 학습하고 평가하였다.

실험 결과

연구 질문

  • RQ1Xerox Tagger는 스페인어의 형태구문적 복잡성을 효과적으로 다룰 수 있는가?
  • RQ2순수하게 확률적 추정에 비해 수작업으로 설정된 매개변수는 태깅 정확도에 어떤 영향을 미치는가?
  • RQ3품사 테그셋과 어휘집의 선택은 스페인어에서 품사 태거 성능에 어떤 영향을 미치는가?
  • RQ4저자원 또는 도메인 특화 환경에서 혼합 모델 접근법이 태깅 결과를 향상시킬 수 있는가?
  • RQ5영어로 학습된 태거를 문법적으로 다를 수 있는 언어인 스페인어로 적응시키는 데 주요 과제는 무엇인가?

주요 결과

  • 비확률적 추정 매개변수를 통합함으로써 혼합 모델 접근법이 태깅 정확도를 크게 향상시켰다.
  • 적응된 태거는 스페인어 ITU 코퍼스에서 높은 성능을 달성하여 맞춤형 언어 자원의 효과성을 입증하였다.
  • 도메인 특화 학습 코퍼스의 사용이 기술적이고 공식적인 언어를 다루는 태거의 능력을 향상시켰다.
  • 맞춤형 품사 테그셋과 어휘집은 스페인어 고유의 형태적 및 문법적 패턴을 포착하는 데 핵심적이었다.
  • 최소한의 재설계로 Xerox Tagger를 스페인어에 적응시키는 것이 가능함을 입증하였다.
  • 이 연구는 규칙 기반과 통계 기반 방법을 융합한 접근법이 순수한 통계 모델보다 더 우수한 결과를 도출할 수 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.