Skip to main content
QUICK REVIEW

[논문 리뷰] Word Level Language Identification in English Telugu Code Mixed Data

Sunil Gundapu, Radhika Mamidi|arXiv (Cornell University)|2020. 10. 09.
Natural Language Processing Techniques참고 문헌 16인용 수 14
한 줄 요약

이 논문은 영어-텔루구어 혼합 텍스트에서 단어 수준의 언어 식별을 위한 조건부 랜덤 필드(CRF)-기반 모델을 제안하며, 단어 형태, 문맥, 품사 태그, 문자 n-gram 등의 언어학적 특징을 활용한다. CRF 모델은 F1 스코어 0.91을 기록하여 나이브 베이즈, 랜덤 포레스트, HMM 기반 모델보다 뛰어나며, 인도어 저자원 혼합 언어 NLP 분야에서 중요한 기여를 한다.

ABSTRACT

In a multilingual or sociolingual configuration Intra-sentential Code Switching (ICS) or Code Mixing (CM) is frequently observed nowadays. In the world, most of the people know more than one language. CM usage is especially apparent in social media platforms. Moreover, ICS is particularly significant in the context of technology, health, and law where conveying the upcoming developments are difficult in one's native language. In applications like dialog systems, machine translation, semantic parsing, shallow parsing, etc. CM and Code Switching pose serious challenges. To do any further advancement in code-mixed data, the necessary step is Language Identification. In this paper, we present a study of various models - Nave Bayes Classifier, Random Forest Classifier, Conditional Random Field (CRF), and Hidden Markov Model (HMM) for Language Identification in English - Telugu Code Mixed Data. Considering the paucity of resources in code mixed languages, we proposed the CRF model and HMM model for word level language identification. Our best performing system is CRF-based with an f1-score of 0.91.

연구 동기 및 목표

  • 저자원의 영어-텔루구어 혼합 텍스트에서 단어 수준의 언어 식별 문제를 해결하기 위해, 특히 소셜 미디어 및 다국어 커뮤니케이션 환경에서의 응용을 고려한다.
  • 형태소적 혼합, 이轨성 변형, 그리고 비공식적 문체 등 혼합 텍스트에서 흔히 나타나는 특징을 잘 처리할 수 있는 강력한 언어 식별 시스템을 개발한다.
  • Naïve Bayes, Random Forest, HMM, CRF와 같은 다수의 시퀀스 레이블링 모델의 효과성을 평가하고 비교하여 개별 단어의 원천 언어 식별 능력을 분석한다.
  • 형태소적, 철자적, 문맥적 신호를 통합한 특징 공학 전략을 탐색하여 언어 태그 예측 성능을 향상시킨다.
  • 혼합 언어 인도어 언어의 후속 NLP 작업을 위한 고성능이고 오픈소스 기반의 솔루션을 제공한다.

제안 방법

  • 모델는 현재 단어, 그 품사 태그, 이웃 단어와 그 품사 태그, 접두사/접미사, 단어 길이, 숫자/대문자/특수문자 존재 여부, 그리고 정방향/역방향 문자 n-gram(unigram, bigram, trigram)을 포함한 특징 세트를 사용하여 훈련된다.
  • 로컬 문맥을 포착하기 위해 일阶 마르코프 가정을 사용하며, 이전 단어의 언어 태그와 현재 단어의 언어 레이블 등의 특징을 통해 시퀀스 레이블링 성능을 향상시킨다.
  • 형태소적 혼합을 다룰 수 있도록 특징 템플릿을 설계하였으며, 예를 들어 'classlo'(영어 + 텔루구어 복수 형태소)나 'supere'(영어 어간 + 텔루구어 종속어)와 같은 클리틱을 포함한다.
  • URL, 이메일 주소, 이모티콘과 같은 비어 있는 토큰에는 기본적으로 'UNIV'(유니버설) 태그를 적용하여 시스템의 강건성을 확보한다.
  • 실험은 23,635개의 훈련 단어와 5,868개의 테스트 단어로 구성된 코퍼스를 대상으로 3겹 교차검증을 사용하며, scikit-learn, NLTK, python-crfsuite를 활용해 모델을 구현한다.
  • 기준 모델로는 나이브 베이즈, 랜덤 포레스트, HMM을 사용하였으며, 성능은 F1 스코어, 정밀도, 재현율을 통해 비교 분석되었다.

실험 결과

연구 질문

  • RQ1영어-텔루구어 혼합 텍스트에서 단어 수준 언어 식별에 최적화된 시퀀스 레이블링 모델은 무엇인가?
  • RQ2문자 n-gram, 품사 태그, 단어 형태와 같은 언어학적 특징이 언어 식별 정확도에 어떤 기여를 하는가?
  • RQ3형태소적 혼합과 비공식 철자 변형이 혼합 텍스트에서 언어 식별에 얼마나 큰 장애를 초래하는가?
  • RQ4저자원 혼합 텍스트 환경에서 CRF 기반 모델이 나이브 베이즈 및 랜덤 포레스트와 같은 전통적 분류기보다 뛰어난 성능을 보일 수 있는가?
  • RQ5이전 단어의 언어 태그와 같은 문맥적 특징의 포함이 예측 성능 향상에 얼마나 기여하는가?

주요 결과

  • CRF 기반 모델은 F1 스코어 0.91을 기록하며, 정확도 91.2897%를 달성하여 모든 기준 모델보다 뚜렷이 뛰어난 성능을 보였다.
  • 텔루구어 언어 태그는 정밀도 0.84, 재현율 0.81, F1 스코어 0.87을 기록하여 모국어에 대해 강력한 성능을 보였다.
  • 영어 단어 식별은 F1 스코어 0.88을 기록하였으며, 정밀도 0.88과 재현율 0.87을 보여 영어 어휘 항목을 신뢰성 있게 탐지할 수 있었다.
  • 이름 있는 실체(NE) 태그는 F1 스코어 0.95를 기록하여 고유명사 및 이름 있는 실체에 대해 뛰어난 성능을 보였다.
  • 비어 있는 토큰(예: URL, 이모티콘)에 사용된 유니버설(UNIV) 태그는 F1 스코어 0.54에 머물러 있어 이러한 토큰의 처리 개선이 필요함을 시사한다.
  • HMM 모델은 정확도 85.15%를 기록하였으며, CRF보다 낮았지만 나이브 베이즈(77.37%)와 랜덤 포레스트(77.34%)보다 높아, 시퀀스 모델링의 중요성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.