Skip to main content
QUICK REVIEW

[논문 리뷰] Uzbek Sentiment Analysis based on local Restaurant Reviews

Sanatbek Matlatipov, Hulkar Rahimboeva|arXiv (Cornell University)|2022. 05. 31.
Sentiment Analysis and Opinion Mining인용 수 4
한 줄 요약

이 논문은 타슈켄트의 구글 맵에서 수집한 8,210건의 우즈베크어 음식점 리뷰로 구성된 새로운 수작업 코딩된 데이터셋을 제시한다. 별점 평가(4~5점 = 긍정, 1~3점 = 부정)를 기반으로 감성 분석을 수행하였다. 다양한 모델을 평가한 결과, 단어 및 문자 n-gram을 결합한 로지스틱 회귀 모델이 91%의 정확도를 기록하여, 저자원의 접착어형 언어인 우즈베크어에서 사전 처리, 특히 어간 추출의 효과를 입증하였다.

ABSTRACT

Extracting useful information for sentiment analysis and classification problems from a big amount of user-generated feedback, such as restaurant reviews, is a crucial task of natural language processing, which is not only for customer satisfaction where it can give personalized services, but can also influence the further development of a company. In this paper, we present a work done on collecting restaurant reviews data as a sentiment analysis dataset for the Uzbek language, a member of the Turkic family which is heavily affected by the low-resource constraint, and provide some further analysis of the novel dataset by evaluation using different techniques, from logistic regression based models, to support vector machines, and even deep learning models, such as recurrent neural networks, as well as convolutional neural networks. The paper includes detailed information on how the data was collected, how it was pre-processed for better quality optimization, as well as experimental setups for the evaluation process. The overall evaluation results indicate that by performing pre-processing steps, such as stemming for agglutinative languages, the system yields better results, eventually achieving 91% accuracy result in the best performing model

연구 동기 및 목표

  • 저자원의 접착어형 언어인 우즈베크어의 감성 분석 자원 부족 문제를 해결하고 도메인 특화 데이터셋을 구축하기 위해.
  • 최근 수집한 우즈베크어 음식점 리뷰 데이터셋을 바탕으로 다양한 기계 학습 및 딥 러닝 모델의 성능을 평가하기 위해.
  • 특히 어간 추출과 불용어 제거와 같은 사전 처리 단계가 저자원 환경에서 모델 정확도에 미치는 영향을 조사하기 위해.
  • 향후 우즈베크어 및 유사 언어의 NLP 연구를 지원하기 위해 공개된 데이터셋과 코드베이스를 제공하기 위해.

제안 방법

  • 데이터셋은 타슈켄트의 음식점 URL을 활용해 구글 맵에서 웹 크롤링을 통해 수집되었으며, 현지 우즈베크 요리에 중점을 두었다.
  • 리뷰는 5점 만점 평가 체계를 사용해 애너테이션되었으며, 4~5점은 긍정, 1~3점은 부정으로 레이블링되었으며, 1,000건 이상의 리뷰는 구글 번역 API를 통해 우즈베크어로 번역되었다.
  • 사전 처리 과정은 URL, 구두점 제거 및 대소문자 변환 후, TF-IDF 기반의 불용어 목록을 사용한 불용어 제거를 포함하였다.
  • 우즈베크어 어미 기반의 맞춤형 형태소 어간 추출기(스템머)를 적용하여 접착어형 어형을 효과적으로 처리하고, 더 나은 분할 및 분석을 가능하게 하였다.
  • 다양한 모델을 평가하였으며, 단어 및 문자 n-gram을 사용한 로지스틱 회귀, 선형 커널을 사용한 SVM, RNN, CNN을 사용하였고, fastText 단어 임베딩 유무를 고려하여 평가하였다.
  • 평가 지표로는 정밀도, 재현율, F1 점수, 정확도를 사용하였으며, 향후 편향을 줄이기 위해 교차 검증을 계획하고 있다.

실험 결과

연구 질문

  • RQ1로지스틱 회귀 및 SVM과 같은 전통적인 기계 학습 모델은 저자원의 접착어형 언어인 우즈베크어에서 감성 분석에 얼마나 효과적인가?
  • RQ2특히 어간 추출과 불용어 제거와 같은 사전 처리가 우즈베크어에서 감성 분류 정확도에 어느 정도 기여하는가?
  • RQ3RNN 및 CNN과 같은 딥 러닝 모델은 비교적 작은 우즈베크어 감성 분석 데이터셋에서 기존 모델 대비 어떤 성능을 보이는가?
  • RQ4사전 학습된 단어 임베딩(fastText 등)은 저자원 언어인 우즈베크어에서 성능 향상에 기여하는가?
  • RQ5긍정 리뷰와 부정 리뷰의 불균형이 모델 성능과 일반화 능력에 어떤 영향을 미치는가?

주요 결과

  • 단어 및 문자 n-gram을 모두 사용한 로지스틱 회귀 모델이 91%의 정확도를 기록하여 다른 모델보다 뛰어난 성능을 보였다.
  • 문자 n-gram만을 사용한 모델도 90%의 정확도를 기록하여 철자 오류에 대한 강건성이 향상됨을 보여주었다.
  • 선형 커널을 사용한 SVM은 88%의 정확도를 기록하였고, RNN과 CNN 모델은 각각 88%와 89.23%의 정확도를 기록하여, 데이터셋 크기로 인해 딥 러닝 모델의 성능 향상이 제한됨을 시사하였다.
  • 우즈베크어 어미 기반의 맞춤형 어간 추출기가 적용되어 형태소 분석이 정확해져 모델 성능 향상에 기여하였다.
  • TF-IDF 기반의 불용어 목록을 사용한 불용어 제거가 모델 정확도 향상에 기여하여, 저자원 환경에서 언어 특화 불용어 목록의 중요성을 확인하였다.
  • 수작업 정제 후 데이터셋은 긍정 리뷰 4,500건, 부정 리뷰 3,710건을 포함하며, 총 8,210건의 애너테이션된 리뷰가 존재한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.