Skip to main content
QUICK REVIEW

[논문 리뷰] SMPOST: Parts of Speech Tagger for Code-Mixed Indic Social Media Text

Deepak Gupta, Shubham Tripathi|arXiv (Cornell University)|2017. 02. 01.
Natural Language Processing Techniques참고 문헌 4인용 수 10
한 줄 요약

이 논문은 조건부 랜덤 필드(CRF)와 풍부한 언어학적 특징을 사용하여 코드 믹스된 인도 사회 미디어 텍스트를 위한 감독형 품사 태거인 SMPOST를 제시한다. 이는 영어-힌두어, 영어-벵골어, 영어-텔루구어 트위터, 페이스북, 웨이백스 데이터에서 강력한 성능을 보이며, 대부분의 도메인에서 Run-1이 Run-2보다 뛰어나게 성능을 내며, 특히 웨이백스와 트위터에서 뛰어난 내재성과 일반화 능력을 입증한다.

ABSTRACT

Use of social media has grown dramatically during the last few years. Users follow informal languages in communicating through social media. The language of communication is often mixed in nature, where people transcribe their regional language with English and this technique is found to be extremely popular. Natural language processing (NLP) aims to infer the information from these text where Part-of-Speech (PoS) tagging plays an important role in getting the prosody of the written text. For the task of PoS tagging on Code-Mixed Indian Social Media Text, we develop a supervised system based on Conditional Random Field classifier. In order to tackle the problem effectively, we have focused on extracting rich linguistic features. We participate in three different language pairs, ie. English-Hindi, English-Bengali and English-Telugu on three different social media platforms, Twitter, Facebook & WhatsApp. The proposed system is able to successfully assign coarse as well as fine-grained PoS tag labels for a given a code-mixed sentence. Experiments show that our system is quite generic that shows encouraging performance levels on all the three language pairs in all the domains.

연구 동기 및 목표

  • 영어가 힌두어, 벵골어, 텔루구어 등의 지역 언어와 혼합된 인도 사회 미디어 텍스트를 위한 강력한 품사 태깅 시스템을 개발하는 것.
  • 하이퍼링크, 문장 부호, 숫자, 이모티콘, 유니코드 기호 등과 같은 노이즈가 많고 비공식적이며 매우 다양성이 높은 사회 미디어 텍스트 문제를 하이브리드 규칙 기반 및 분류기 기반 접근법으로 해결하는 것.
  • 모든 언어 쌍과 사회 미디어 플랫폼(트위터, 페이스북, 웨이백스)에서 굵은 품사 태그셋과 세밀한 품사 태그셋을 모두 사용하여 성능을 평가하는 것.
  • 저자원, 코드 믹스된 NLP 작업에서 수작업으로 만든 언어학적 특징을 갖춘 CRF 기반 분류기의 효과성을 탐색하는 것.

제안 방법

  • 두 단계의 파이프라인을 사용한다: 첫 번째 단계에서는 정규 표현식과 사전 검색을 사용하여 비알파벳 문자 토큰(예: 문장 부호, URL, 숫자, 이모티콘, 유니코드 기호)를 정제하고 태깅하는 규칙 기반 시스템을 적용한다.
  • 정제된 데이터는 수작업으로 만든 언어학적 특징(단어 형태, 접두사, 접미사, 문맥 특징 등)을 기반으로 한 CRF 기반 분류기에서 처리된다.
  • CRF 모델은 CRF++를 사용하여 훈련되며, 영어-힌두어 데이터에서 최적화된 특징 템플릿을 튜닝하여 모든 언어 쌍에 동일하게 적용된다.
  • 두 가지 제약 조건이 있는 시스템 런을 평가한다: Run-1은 페이스북, 트위터, 웨이백스의 모든 플랫폼 데이터를 결합하여 훈련한다. Run-2는 각 플랫폼 별로 별도로 훈련하고 예측한다.
  • 훈련 및 평가에는 BIS 품사 태그셋을 사용하며, 성능은 굵은 품사 태그 수준과 세밀한 품사 태그 수준 모두에서 보고된다.
  • 제약 없는 시스템은 이전 연도의 ICON-2015 공동 과제 데이터를 추가로 포함하지만, 성능 향상은 관찰되지 않았다.

실험 결과

연구 질문

  • RQ1코드 믹스된 인도 사회 미디어 텍스트에서 하이브리드 규칙 기반 및 CRF 기반 접근법의 품사 태깅 효과성은 어떠한가?
  • RQ2페이스북, 트위터, 웨이백스를 아우르는 통합된 사회 미디어 데이터로 훈련하면 플랫폼 별로 훈련하는 것보다 더 좋은 일반화 성능을 낼 수 있는가?
  • RQ3다양한 사회 미디어 플랫폼에서 영어-힌두어, 영어-벵골어, 영어-텔루구어 언어 쌍에 대해 시스템의 성능은 어떻게 되는가?
  • RQ4풍부한 언어학적 특징을 갖춘 CRF 기반 모델은 저자원 코드 믹스된 품사 태깅 작업에서 강력한 성능을 낼 수 있는가?
  • RQ5이전 연도의 데이터를 통합하면 제약 조건 설정에서 성능 향상이 유의미하게 이루어지는가?

주요 결과

  • 모든 플랫폼의 데이터를 결합하여 훈련한 Run-1은 대부분의 도메인에서 Run-2를 능가하며, 굵은 품사 태그 수준에서 영어-텔루구어 웨이백스 데이터에서 F1 스코어 0.846을 기록했다.
  • 영어-힌두어 데이터의 경우, Run-1은 트위터 데이터에서 굵은 품사 태그 수준에서 F1 스코어 0.904를 기록하여 플랫폼 간 강력한 일반화 능력을 보였다.
  • 모든 언어 쌍에서 페이스북 데이터에서는 Run-2가 더 뛰어난 성능을 보였으며, 이는 플랫폼 별 언어 패턴이 플랫폼 별 훈련에 유리하다는 것을 시사한다.
  • Run-1에서 영어-텔루구어 트위터 데이터의 굵은 품사 태그 수준에서 F1 스코어 0.879를 기록하여 저자원 언어 쌍에서도 뛰어난 성능을 보였다.
  • ICON-2015 공동 과제의 이전 연도 데이터를 통합했음에도 불구하고, 제약 없는 시스템은 제약 조건이 있는 Run-1보다 유의미한 성능 향상을 보이지 않았으며, 이는 현재 데이터 크기가 충분할 수 있거나, 데이터 분포의 변화가 성능 향상의 한계를 만들 수 있음을 시사한다.
  • 규칙 기반 컴포onent은 비알파벳 토큰(예: 문장 부호, URL, 숫자)의 85%를 성공적으로 처리하여 CRF 분류 이전에 노이즈를 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.