[논문 리뷰] Sentiment Analysis of Code-Mixed Social Media Text (Hinglish)
이 논문은 Hinglish(Hindi-영어 혼합) 트위터 텍스트의 감성 분석에 대해 다수의 자연어 처리 기법을 사용하여 종합적인 연구를 제시한다. 반복적인 데이터 정제, 다양한 특징 추출 방법(TF-IDF, 워드 임베딩), 그리고 다양한 기계 학습 모델을 적용하여 SemEval-2020 Task 9 데이터셋에서 최고의 F1 스코어 69.07을 기록했다.
This paper discusses the results obtained for different techniques applied for performing the sentiment analysis of social media (Twitter) code-mixed text written in Hinglish. The various stages involved in performing the sentiment analysis were data consolidation, data cleaning, data transformation and modelling. Various data cleaning techniques were applied, data was cleaned in five iterations and the results of experiments conducted were noted after each iteration. Data was transformed using count vectorizer, one hot vectorizer, tf-idf vectorizer, doc2vec, word2vec and fasttext embeddings. The models were created using various machine learning algorithms such as SVM, KNN, Decision Trees, Random Forests, Naive Bayes, Logistic Regression, and ensemble voting classifiers. The data was obtained from a task on Codalab competition website which was listed as Task:9 on the Semeval-2020 competition website. The models created were evaluated using the F1-score (macro). The best F1-score of 69.07 was achieved using ensemble voting classifier.
연구 동기 및 목표
- 저자원, 코드 믹스된 소셜 미디어 텍스트에서의 감성 분석 과제를 해결하기 위해.
- 코드 믹스된 텍스트에서 다양한 데이터 전처리, 특징 공학, 기계 학습 기법의 효과성을 평가하기 위해.
- Hinglish에서 감성 분류를 위한 최적의 전처리, 특징 추출, 모델링 접근 방식의 조합을 규명하기 위해.
- 다국어적이고 비공식적인 소셜 미디어 텍스트에 대한 재현 가능한 파이프라인을 기여하기 위해.
제안 방법
- 데이터는 Codalab에서 진행된 SemEval-2020 Task 9 경연 대회를 기반으로 수집되었으며, Hinglish 트위터 게시물에 집중하였다.
- 텍스트 품질과 일관성을 향상시키기 위해 다섯 단계의 반복적 데이터 정제를 적용하였다.
- 카운트 벡터라이저, 원핫 인코딩, TF-IDF, 워드 임베딩(Word2Vec, FastText, Doc2Vec)를 사용하여 특징 표현을 수행하였다.
- SVM, KNN, 의사결정트리, 랜덤 포레스트, 나이브 베이즈, 로지스틱 회귀, 앙상블 보팅 분류기 등 다수의 기계 학습 모델을 훈련시켰다.
- 감성 레이블의 클래스 불균형을 고려하기 위해 매크로 F1 스코어를 사용하여 모델 평가를 수행하였다.
- 앙상블 보팅 분류기는 여러 기반 모델의 예측을 통합하여 전체 성능을 향상시켰다.
실험 결과
연구 질문
- RQ1Hinglish 텍스트의 감성 분류 성능 향상에 가장 효과적인 데이터 정제 전략은 무엇인가?
- RQ2다양한 특징 표현 기법(예: TF-IDF 대비 워드 임베딩)은 코드 믹스 텍스트에서 모델 정확도에 어떤 영향을 미치는가?
- RQ3Hinglish 소셜 미디어 콘텐츠의 감성 분류에 가장 잘 작동하는 기계 학습 알고리즘은 무엇인가?
- RQ4이러한 저자원, 코드 믹스된 NLP 환경에서 앙상블 방법이 개별 모델을 능가할 수 있는가?
- RQ5감성 분석을 위한 최적의 파이프라인(전처리, 특징 추출, 모델링의 조합)은 무엇인가?
주요 결과
- 반복적인 데이터 정제 과정이 모델 성능을 크게 향상시켰으며, 다섯 번의 정제 반복 후 최고의 성능이 관찰되었다.
- 앙상블 보팅 분류기가 가장 높은 F1 스코어 69.07을 기록하여 모든 개별 모델을 능가했다.
- TF-IDF와 워드 임베딩 기반 특징(특히 FastText)이 강력한 성능을 보였으며, 일부 설정에서는 TF-IDF가 약간 더 뛰어났다.
- 개별 모델 중 랜덤 포레스트와 SVM이 비교적 높은 F1 스코어를 기록했지만, 앙상블 접근 방식에 밀렸다.
- 여러 모델을 보팅을 통해 조합하는 것이 코드 믹스된 저자원 텍스트에서 감성 분류 성능 향상에 효과적인 전략임을 확인했다.
- 비공식적이고 다국어적인 소셜 미디어 텍스트에서 높은 성능을 달성하기 위해 철저한 전처리와 특징 공학이 필수적임을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.