Skip to main content
QUICK REVIEW

[논문 리뷰] JU_KS@SAIL_CodeMixed-2017: Sentiment Analysis for Indian Code Mixed Social Media Texts

Kamal Sarkar|arXiv (Cornell University)|2018. 02. 15.
Sentiment Analysis and Opinion Mining참고 문헌 12인용 수 8
한 줄 요약

이 논문은 인도어 혼합 소셜 미디어 텍스트를 위한 감성 분석 시스템을 제시한다. 다항 베이지안과 n-gram, SentiWordnet 특징을 사용하였으며, SAIL-2017 공동 과제에서 힌디-영어 및 벤골-영어 혼합 텍스트 감성 분석 부문에서 3위를 기록하여, 언어 특화 감성 자원을 최소한으로 사용하면서도 뛰어난 성능을 보였다.

ABSTRACT

This paper reports about our work in the NLP Tool Contest @ICON-2017, shared task on Sentiment Analysis for Indian Languages (SAIL) (code mixed). To implement our system, we have used a machine learning algo-rithm called Multinomial Naïve Bayes trained using n-gram and SentiWordnet features. We have also used a small SentiWordnet for English and a small SentiWordnet for Bengali. But we have not used any SentiWordnet for Hindi language. We have tested our system on Hindi-English and Bengali-English code mixed social media data sets released for the contest. The performance of our system is very close to the best system participated in the contest. For both Bengali-English and Hindi-English runs, our system was ranked at the 3rd position out of all submitted runs and awarded the 3rd prize in the contest.

연구 동기 및 목표

  • 힌디-영어 및 벤골-영어 혼합 텍스트를 대상으로 한 인도어 혼합 소셜 미디어 텍스트의 감성 분석 시스템을 개발한다.
  • 저자원, 다국어 혼합 소셜 미디어 콘텐츠에서의 감성 분류 과제를 해결한다.
  • 다국어 환경에서 n-gram 특징과 교차 언어 감성 어휘집을 결합하는 것이 효과적인지 평가한다.
  • 언어 특화 감성 자원을 최소한으로 사용하여 경쟁 가능한 성능을 달성한다.
  • 인도어 언어에서 혼합 텍스트 감성 분석에 경량이면서 효과적인 솔루션을 기여한다.

제안 방법

  • 핵심 분류 알고리즘으로 다항 베이지안을 사용하였다.
  • 혼합 텍스트의 국소적 어휘적 및 문법적 패턴을 포착하기 위해 n-gram 특징을 사용하였다.
  • 감성 점수를 위해 소규모 영어 SentiWordnet과 소규모 벤골 SentiWordnet을 통합하였다.
  • 힌디어에 대한 SentiWordnet을 사용하지 않았으며, 대신 영어 및 벤골 자원으로부터 교차 언어 전이를 활용하였다.
  • 두 가지 벤치마크 데이터셋인 힌디-영어 및 벤골-영어 혼합 소셜 미디어 텍스트에서 시스템을 훈련하고 평가하였다.
  • n-gram 특징 점수와 감성 어휘집 점수를 결합하여 분류 정확도를 향상시켰다.

실험 결과

연구 질문

  • RQ1n-gram 및 SentiWordnet 특징을 갖춘 다항 베이지안 분류기가 혼합 텍스트 감성 분석에 얼마나 효과적인가?
  • RQ2관련 인도어 언어에서 유래한 교차 언어 감성 어휘집이 저자원 혼합 텍스트에서 성능을 향상시킬 수 있는가?
  • RQ3힌디어 SentiWordnet가 없는 것이 힌디-영어 혼합 텍스트 데이터에서 시스템 성능에 어떤 영향을 미치는가?
  • RQ4다국어 혼합 텍스트 환경에서 언어 특화 감성 자원을 최소한으로 사용할 경우 어떤 정도의 성능을 달성할 수 있는가?
  • RQ5SAIL-2017 공동 과제에서 최신 기술 수준의 접근 방식과 비교해 시스템은 어떻게 성능을 내는가?

주요 결과

  • 시스템은 SAIL-2017 공동 과제에서 인도어 혼합 소셜 미디어 텍스트 감성 분석 부문에서 3위를 기록하였다.
  • 힌디-영어 및 벤골-영어 혼합 데이터셋 양쪽 모두에서 경쟁적인 성능을 보였으며, 양 부문에서 모두 3위를 기록하였다.
  • n-gram 특징과 영어 및 벤골 SentiWordnet의 조합이 분류 정확도를 크게 향상시켰다.
  • 언어 특화 감성 어휘집에 최소한의 의존성을 보이더라도 다국어 혼합 환경에서 강력한 성능을 낼 수 있음을 시스템이 입증하였다.
  • 힌디어 SentiWordnet가 없는 것이 성능에 심각한 영향을 주지 않았으며, 영어 및 벤골 자원으로부터 효과적인 교차 언어 전이가 이루어졌음을 시사한다.
  • 기존의 n-gram 특징과 경량 감성 어휘집을 조합하는 것이 저자원, 혼합 텍스트 NLP 과제에서 효과적임을 결과가 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.