Skip to main content
QUICK REVIEW

[논문 리뷰] Part-of-Speech Tagging for Code-mixed Indian Social Media Text at ICON 2015

Kamal Sarkar|arXiv (Cornell University)|2016. 01. 06.
Natural Language Processing Techniques참고 문헌 12인용 수 7
한 줄 요약

이 논문은 사전 검색과 단어 수준의 특징을 활용하여 알려진 및 알려지지 않은 토큰 모두의 관측 확률을 향상시켜, 혼합어로 된 인도 소셜 미디어 텍스트에 대한 삼중어자 은닉 마르코프 모델(HMM) 기반 형태소 품사 태거를 제안한다. 시스템은 법인-영어, 히ند-영어, 타밀-영어 언어 쌍에 대해 제약 조건이 있는 모드에서 평균 정확도 75.60%와 제약 조건이 없는 모드에서 평균 정확도 70.65%를 달성하여, 도전적인 多어성·저자원 NLP 과제에서 뛰어난 성능을 보였다.

ABSTRACT

This paper discusses the experiments carried out by us at Jadavpur University as part of the participation in ICON 2015 task: POS Tagging for Code-mixed Indian Social Media Text. The tool that we have developed for the task is based on Trigram Hidden Markov Model that utilizes information from dictionary as well as some other word level features to enhance the observation probabilities of the known tokens as well as unknown tokens. We submitted runs for Bengali-English, Hindi-English and Tamil-English Language pairs. Our system has been trained and tested on the datasets released for ICON 2015 shared task: POS Tagging For Code-mixed Indian Social Media Text. In constrained mode, our system obtains average overall accuracy (averaged over all three language pairs) of 75.60% which is very close to other participating two systems (76.79% for IIITH and 75.79% for AMRITA_CEN) ranked higher than our system. In unconstrained mode, our system obtains average overall accuracy of 70.65% which is also close to the system (72.85% for AMRITA_CEN) which obtains the highest average overall accuracy.

연구 동기 및 목표

  • 혼합어로 된 인도 소셜 미디어 텍스트에서 어휘적 다양성과 비공식적 언어로 인해 발생하는 형태소 품사 태깅 과제를 해결하기 위해.
  • 인도 소셜 미디어 플랫폼에서 흔한 저자원·혼합어 텍스트를 처리할 수 있는 견고한 형태소 품사 태깅 시스템을 개발하기 위해.
  • 향상된 관측 확률 모델링을 통해 알려진 토큰과 알려지지 않은 토큰 모두의 태깅 정확도를 향상시키기 위해.
  • 제약 조건이 있는 및 제약 조건이 없는 설정에서, 법인-영어, 히нд-영어, 타밀-영어 등 여러 언어 쌍에 대해 시스템을 평가하기 위해.
  • ICON 2015에서의 공동 과제에 참여하기 위해 특징 기반 HMM 모델링에 초점을 맞춘 경쟁적인 결과를 제출하기 위해.

제안 방법

  • 시스템은 형태소 품사 태그 시퀀스를 모델링하기 위해 삼중어자 은닉 마르코프 모델(HMM)을 사용하여, 형태소 품사 전이의 장거리 의존성을 포착한다.
  • 관측 확률은 알려진 토큰에 대해 사전 검색을 활용하고, 문자 n-그램 및 대문자 패턴과 같은 단어 수준의 특징을 사용하여 향상시킨다.
  • 알려지지 않은 토큰의 경우, 형태적 및 철자적 특징을 활용하여 타당한 형태소 품사 태그를 추정한다.
  • 시스템은 수동으로 주석이 달린 혼합어로 된 소셜 미디어 텍스트를 포함하는 ICON 2015 공동 과제 데이터셋을 기반으로 훈련 및 테스트한다.
  • 두 가지 평가 모드를 사용한다: 제약 조건이 있는(제공된 훈련 데이터 외부 자원 사용 금지) 및 제약 조건이 없는(외부 지식 허용).
  • 각 입력 문장에 대해 가장 가능성이 높은 형태소 품사 시퀀스를 추론하기 위해 비터비 알고리즘을 적용한다.

실험 결과

연구 질문

  • RQ1특징 보강된 관측 확률을 갖춘 삼중어자 HMM은 혼합어로 된 인도 소셜 미디어 텍스트의 형태소 품사 태깅에 얼마나 효과적인가?
  • RQ2사전 검색과 단어 수준의 특징은 저자원 혼합어 환경에서 알려지지 않은 토큰의 태깅 정확도를 얼마나 향상시킬 수 있는가?
  • RQ3법인-영어, 히нд-영어, 타밀-영어 등 다양한 언어 쌍에서 시스템의 성능은 어떠한가?
  • RQ4제약 조건이 있는 설정과 제약 조건이 없는 설정 간의 성능에 어떤 영향을 미치는가?
  • RQ5제안된 시스템은 ICON 2015 공동 과제에서 최첨단 시스템과 비교해 어떻게 성과를 내는가?

주요 결과

  • 제약 조건이 있는 모드에서, 시스템은 모든 세 언어 쌍에서 평균 전체 정확도 75.60%를 달성하여 상위 시스템들과 가까운 순위를 기록했다.
  • 제약 조건이 없는 모드에서, 시스템은 평균 정확도 70.65%를 기록했으며, 이는 해당 설정에서 최고 성능을 기록한 시스템(72.85%)과 경쟁 가능한 성능이었다.
  • 사전 검색과 단어 수준의 특징 통합은 기준 HMM에 비해 알려지지 않은 토큰의 처리 능력을 크게 향상시켰다.
  • 삼중어자 HMM 아키텍처는 특히 형태적 특징이 풍부하고 혼합어가 많은 맥락에서 형태소 품사 전이 패턴을 효과적으로 모델링했다.
  • 시스템은 모든 세 언어 쌍에서 일관된 성능을 보였으며, 어휘적 다양성에 대한 강건성을 입증했다.
  • 결과는 특징 보강 HMM이 인도 소셜 미디어 텍스트에서 저자원·혼합어 형태소 품사 태깅 과제에 실현 가능하다는 것을 확인시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.