Skip to main content
QUICK REVIEW

[논문 리뷰] Part-of-Speech Tagging for Historical English

Yi Yang, Jacob Eisenstein|arXiv (Cornell University)|2016. 03. 10.
Natural Language Processing Techniques참고 문헌 18인용 수 4
한 줄 요약

이 논문은 고대 영어에서 품사 태깅을 위한 비지도 도메인 적응을 평가하며, 전체 특징 공간을 모델링함으로써 워드 임베딩과 브라운 클러스터링을 능가하는 방법으로 특징 임베딩(Feature Embedding)을 도입한다. 철자 정규화와 조합했을 때 초기 근대 영어에서 원시 정확도를 5% 향상시키며, OOV 토큰에서의 오류를 크게 줄인다.

ABSTRACT

As more historical texts are digitized, there is interest in applying natural language processing tools to these archives. However, the performance of these tools is often unsatisfactory, due to language change and genre differences. Spelling normalization heuristics are the dominant solution for dealing with historical texts, but this approach fails to account for changes in usage and vocabulary. In this empirical paper, we assess the capability of domain adaptation techniques to cope with historical texts, focusing on the classic benchmark task of part-of-speech tagging. We evaluate several domain adaptation methods on the task of tagging Early Modern English and Modern British English texts in the Penn Corpora of Historical English. We demonstrate that the Feature Embedding method for unsupervised domain adaptation outperforms word embeddings and Brown clusters, showing the importance of embedding the entire feature space, rather than just individual words. Feature Embeddings also give better performance than spelling normalization, but the combination of the two methods is better still, yielding a 5% raw improvement in tagging accuracy on Early Modern English texts.

연구 동기 및 목표

  • 문체, 형태, 문법적 변화로 인해 고대 영어 텍스트에서 품사 태깅 정확도가 떨어지는 문제를 해결하기 위해.
  • 목표 도메인에서 레이블이 없는 데이터를 요구하지 않고도 비지도 도메인 적응이 고대 어휘 자료에서 태깅 성능을 향상시킬 수 있는지 평가하기 위해.
  • 고대 영어 NLP에서 주로 사용되지만 불완전한 해법인 철자 정규화와 도메인 적응의 효과를 비교하기 위해.
  • 도메인 적응과 정규화를 조합했을 때 태깅 정확도 향상에 상호보완적인 효과가 있는지 조사하기 위해.
  • 고대 영어 품사 태깅에서 주로 발생하는 오류 원인, 특히 태그셋 불일치와 OOV 토큰을 분석하기 위해.

제안 방법

  • 특징 벡터를 정렬하여 소스(현대어) 도메인과 타겟(고대어) 도메인 간의 공유 표현 공간을 학습하는 Fema (특징 임베딩을 위한 다중 속성 도메인 적응) 알고리즘을 적용한다.
  • 로컬 컨텍스트(좌우 단어)와 어형을 포함한 특징 템플릿을 사용해 도메인 적응을 위한 입력 표현을 구성한다.
  • 특징 임베딩을 통한 비지도 도메인 적응을 실시하며, 도메인 간 불일치를 최소화하고 예측 능력을 유지하는 도메인 불변 표현을 장려한다.
  • 펜 트리뱅크(PTB)에서 트레이닝한 시퀀스 태거(Stanford CoreNLP)를 펜 헬싱키 파생 코퍼스 오브 초기 근대 영어(PPCEME) 및 펜 파생 코퍼스 오브 현대 영국 영어(PPCMBE)로 적응시킨다.
  • 도메인 적응과 VARD 시스템을 통한 철자 정규화를 조합하여 상호보완적 성과를 평가한다.
  • 표준 품사 태깅 메트릭을 사용해 성능을 평가한다: 포함어(IV) 및 외부어(OOV) 토큰의 정확도와 총합 정확도.

실험 결과

연구 질문

  • RQ1표준 현대 어휘 자료에서 트레이닝된 모델과 비교했을 때, 비지도 도메인 적응이 초기 근대 영어 텍스트에서 품사 태깅 정확도를 유의미하게 향상시킬 수 있는가?
  • RQ2특징 임베딩의 성능이 고대 영어 품사 태깅에서 워드 임베딩, 브라운 클러스터링 및 기타 도메인 적응 기법과 비교해 어떻게 되는가?
  • RQ3철자 정규화와 도메인 적응이 태깅 정확도 향상에 얼마나 상호보완적인가?
  • RQ4고대 영어 품사 태깅에서 주요 오류 원인은 무엇이며, 도메인 적응과 정규화는 이 오류에 어떻게 영향을 미치는가?
  • RQ5저자나 장르와 같은 메타데이터를 사용한 다중 속성 도메인 적응이 단일 도메인 적응보다 추가로 성능 향상을 이끌 수 있는가?

주요 결과

  • 특징 임베딩 방법은 펜 트리뱅크에서부터 펜 헬싱키 파생 코퍼스 오브 초기 근대 영어(PPCEME)로 적응할 때 총 태깅 정확도 77.92%를 기록하며, 워드2vec(75.85%), 브라운 클러스터링(76.04%), SCL(75.89%)를 모두 능가한다.
  • 시간 순서 도메인 적응 설정(현대 영국 영어에서 초기 근대 영어로의 적응)에서 도메인 적응은 오류율을 30% 감소시키며, 베이스라인 대비 4%의 절대 정확도 향상을 이룬다.
  • VARD를 통한 철자 정규화는 60,928개의 오류 토큰을 수정하지만, 이 중 38%만 Fema -attribute에 의해도 수정되므로 상호보완성이 뚜렷하다.
  • Fema -attribute와 VARD 정규화를 조합하면, 기존 베이스라인 분류기 대비 초기 근대 영어 텍스트에서 태깅 정확도를 5%의 원시 정확도 향상으로 달성한다.
  • 오류 분석 결과, 포함어 토큰에서 가장 흔한 오류의 70%는 OOV 문제 때문이 아니라 태그셋 불일치 또는 애너테이션 가이드라인 차이에서 기인한다.
  • 도메인 적응은 외부어 토큰에서 가장 큰 성과를 보이며(Fema -attribute로 63.16% 정확도), 희귀 및 알려지지 않은 형태를 다루는 데 효과적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.