Skip to main content
QUICK REVIEW

[논문 리뷰] Experiments with POS Tagging Code-mixed Indian Social Media Text

Prakash B. Pimpale, Raj Nath Patel|arXiv (Cornell University)|2016. 10. 31.
Natural Language Processing Techniques참고 문헌 5인용 수 9
한 줄 요약

이 논문은 코드 믹스드 인도 소셜 미디어 텍스트에서 품사 태깅을 위한 하이브리드 접근법을 제시한다. 스탠퍼드 로그-선형 품사 태거와 워드2벡터 기반 특징 공학, WEKA를 활용한 기계학습을 결합한 방식이다. 비제한적 평가에서 히ند리-영어 71.11%, 벤갈리-영어 75.46%, 텔루구-영어 48.03%의 F1 스코어를 기록하여 분산 단어 표현이 자원이 적은 코드 믹스드 환경에서 효과적임을 입증한다.

ABSTRACT

This paper presents Centre for Development of Advanced Computing Mumbai's (CDACM) submission to the NLP Tools Contest on Part-Of-Speech (POS) Tagging For Code-mixed Indian Social Media Text (POSCMISMT) 2015 (collocated with ICON 2015). We submitted results for Hindi (hi), Bengali (bn), and Telugu (te) languages mixed with English (en). In this paper, we have described our approaches to the POS tagging techniques, we exploited for this task. Machine learning has been used to POS tag the mixed language text. For POS tagging, distributed representations of words in vector space (word2vec) for feature extraction and Log-linear models have been tried. We report our work on all three languages hi, bn, and te mixed with en.

연구 동기 및 목표

  • 여러 인도어가 영어와 혼합된 코드 믹스드 인도 소셜 미디어 텍스트를 대상으로 견고한 품사 태깅 시스템을 개발하는 것.
  • 코드 믹스드 인도어에 대한 애너테이션된 학습 데이터가 제한되어 있는 문제를 해결하기 위해 분산 단어 표현(워드2벡터)를 활용해 특징 추출을 수행하는 것.
  • J48, 랜덤 포레스트, 나이브 베이즈, 다층 퍼셉트론 등의 다양한 기계학습 모델이 자원이 적은 다국어 소셜 미디어 텍스트에서 품사 태깅에 어떻게 작용하는지 평가하는 것.
  • 비제한적(WEKA + 워드2벡터) 학습 접근법과 제한적(스탠퍼드 품사 태거) 학습 접근법을 비교하여 미리 보지 않은 코드 믹스드 데이터에 대한 일반화 능력을 향상시키는 것.

제안 방법

  • 단어 문맥(±2), 접두사/접미사(6자), 유니코드 형태를 포함한 특징을 사용해 제한된 설정에서 스탠퍼드 로그-선형 품사 태거를 학습시켰다.
  • 특징 공학을 위해 합쳐진 학습 및 테스트 데이터에서 단어의 분산 벡터 표현을 생성하기 위해 워드2벡터를 활용했다.
  • 언어학적 특징으로 단어의 언어, 인접 단어의 언어, 이웃 단어의 품사 태그, 문장 내 단어 위치 등을 포함해 WEKA를 사용해 여러 기계학습 모델을 학습시켰다.
  • 알 수 없는 단어의 경우, 워드2벡터 모델에서 유사한 의미를 가진 단어의 가장 흔한 품사 태그를 추론하기 위해 가장 가까운 이웃을 활용했다.
  • 대체 전략을 적용: 만약 가장 가까운 이웃이 발견되지 않으면, 학습 세트에서 가장 흔한 품사 태그를 사용했다.
  • 모델을 20% 보류된 테스트 세트에서 평가하고, 가장 높은 F1 스코어를 기록한 J48 의사결정 트리를 최종 제출용으로 선택했다.

실험 결과

연구 질문

  • RQ1제공된 제한된 데이터셋으로만 학습된 스탠퍼드 로그-선형 품사 태거가 코드 믹스드 히нд리-영어, 벤갈리-영어, 텔루구-영어 텍스트에서 얼마나 효과적인가?
  • RQ2워드2벡터 기반의 분산 표현은 자원이 적은 코드 믹스드 인도 소셜 미디어 텍스트에서 품사 태깅 성능을 얼마나 향상시킬 수 있는가?
  • RQ3J48, 랜덤 포레스트, 나이브 베이즈, 다층 퍼셉트론 중 어떤 기계학습 모델이 자원이 적은 코드 믹스드 인도어 텍스트에서 품사 태깅에 가장 우수한 성능을 보이는가?
  • RQ4워드2벡터 임베딩에서 가장 가까운 이웃 검색을 활용하면 코드 믹스드 텍스트에서 OOV(Out-of-Vocabulary) 단어의 품사 태깅에 얼마나 기여하는가?
  • RQ5코드 믹스드 인도어 품사 태깅에서 제한적 학습 설정과 비제한적 학습 설정 간의 성능 격차는 어느 정도인가?

주요 결과

  • 제한적 제출 결과로 스탠퍼드 로그-선형 품사 태거는 히нд리-영어에서 71.11% F1, 벤갈리-영어에서 75.46%, 텔루구-영어에서 71.04%의 F1 스코어를 기록했다.
  • 비제한적 모델 중 J48 의사결정 트리가 실험 평가에서 히нд리-영어 44.60%, 텔루구-영어 50.30%의 최고 F1 스코어를 기록했다.
  • 워드2벡터 임베딩을 활용함으로써 훈련 데이터에서 의미적으로 유사한 단어의 품사 태그를 검색함으로써 OOV 단어를 효과적으로 처리할 수 있었다.
  • 랜덤 포레스트와 나이브 베이즈 모델은 J48에 비해 성능이 열등했으며, 히нд리-영어에서 F1 스코어가 각각 43.00%와 40.40%였다.
  • 비제한적 시스템은 텔루구-영어에서 48.03%의 F1 스코어를 기록하여, 워드2벡터가 일반화 능력을 향상시키지만 여전히 제한적 접근법에 비해 성능이 낮다는 것을 시사한다.
  • 본 연구는 분산 단어 표현이 자원이 적은 코드 믹스드 환경에서 품사 태깅을 향상시킬 수 있으며, 특히 견고한 특징 공학과 조합될 경우 더욱 효과적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.