Skip to main content
QUICK REVIEW

[논문 리뷰] Cooking Is All About People: Comment Classification On Cookery Channels Using BERT and Classification Models (Malayalam-English Mix-Code)

Subramaniam Kazhuparambil, Abhishek Kaushik|arXiv (Cornell University)|2020. 06. 15.
Sentiment Analysis and Opinion Mining인용 수 8
한 줄 요약

이 연구는 말라얄라마-영어 혼합 코드로 된 다국어 유튜브 댓글을 분류하기 위해 기존 기계학습 모델과 다국어 트랜스포머 모델(BERT, DistilBERT, XLM)을 평가한다. 요리 채널 댓글을 대상으로 한 자체 구축한 데이터셋을 사용하여 XLM가 67.31%의 최고 정확도를 기록하며 랜덤 포레스트(63.59%)와 같은 기존 모델들을 압도했으며, 저자원 다국어 텍스트 분류 작업에서 트랜스포머 기반 모델의 우수성을 입증했다. 이는 높은 계산 비용에도 불구하고 성립한다.

ABSTRACT

The scope of a lucrative career promoted by Google through its video distribution platform YouTube has attracted a large number of users to become content creators. An important aspect of this line of work is the feedback received in the form of comments which show how well the content is being received by the audience. However, volume of comments coupled with spam and limited tools for comment classification makes it virtually impossible for a creator to go through each and every comment and gather constructive feedback. Automatic classification of comments is a challenge even for established classification models, since comments are often of variable lengths riddled with slang, symbols and abbreviations. This is a greater challenge where comments are multilingual as the messages are often rife with the respective vernacular. In this work, we have evaluated top-performing classification models for classifying comments which are a mix of different combinations of English and Malayalam (only English, only Malayalam and Mix of English and Malayalam). The statistical analysis of results indicates that Multinomial Naive Bayes, K-Nearest Neighbors (KNN), Support Vector Machine (SVM), Random Forest and Decision Trees offer similar level of accuracy in comment classification. Further, we have also evaluated 3 multilingual transformer based language models (BERT, DISTILBERT and XLM) and compared their performance to the traditional machine learning classification techniques. XLM was the top-performing BERT model with an accuracy of 67.31. Random Forest with Term Frequency Vectorizer was the best performing model out of all the traditional classification models with an accuracy of 63.59.

연구 동기 및 목표

  • 높은 양의 댓글과 다국어, 비공식적인 콘텐츠로 인해 유튜버가 수동으로 댓글 분석을 수행하는 데 어려움을 겪는 문제를 해결하기 위해.
  • 기존 기계학습 모델과 트랜스포머 기반 언어 모델이 다국어(말라얄라마-영어) 댓글 분류 작업에서 어떻게 성능을 내는지 평가하기 위해.
  • 요리 채널의 시청자 피드백을 분류하기 위한 가장 효과적인 모델 구성 식별하기 위해.
  • 다양한 모델과 특징 공학 기법 간의 분류 결과에 대한 통계적 유의성과 강건성 평가하기 위해.
  • 콘텐츠 제작자가 다국어 유튜브 댓글에서 감성과 피드백을 자동으로 추출할 수 있도록 실용적이고 확장 가능한 도구 제공하기 위해.

제안 방법

  • 요리 채널의 1,000개 유튜브 댓글을 수집하고 정제하여, 긍정, 부정, 중립의 세 가지 감성 클래스로 주석 처리함.
  • 말라얄라마어 및 영어 전용 정지어 목록을 사용하여 전처리를 수행하였으며, 언어학적 복잡성으로 인해 말라얄라마어 어간 추출은 수행하지 않음.
  • 기존 모델의 특징 추출을 위해 TF-IDF, Count Vectorizer, TfidfVectorizer, Binary Vectorizer의 네 가지 벡터화 기법 적용.
  • 다섯 가지 기존 모델을 훈련 및 평가: 다항 나이브 베이즈, K-최근접 이웃(KNN), 서포트 벡터 머신(SVM), 랜덤 포레스트, 결정 트리.
  • 세 가지 다국어 트랜스포머 모델인 BERT, DistilBERT, XLM를 사용하여, 혼합 언어 데이터셋에 대해 미세조정을 수행함. 모두 소문자 기반 기본 버전 사용.
  • 모든 모델에 대해 초모수 튜닝을 수행하고, 성능 차이의 통계적 유의성을 평가하기 위해 프리드먼 검정을 실시함.

실험 결과

연구 질문

  • RQ1말라얄라마-영어 혼합 코드 댓글로 구성된 다국어 텍스트 데이터를 분류하는 데 얼마나 어려운가?
  • RQ2다양한 특징 공학 기법과 조합했을 때, 어떤 기존 기계학습 모델이 다국어 댓글 분류에서 가장 우수한 성능을 내는가?
  • RQ3이 다국어 분류 작업에서 트랜스포머 기반 모델(BERT, DistilBERT, XLM)은 기존 모델 대비 어떤 성능을 내는가?
  • RQ4다양한 분류 모델 간의 성능 차이에 대해 통계적 유의성은 무엇인가?
  • RQ5여러 모델을 조합하는 하이브리드 접근 방식이 비공식적이고 다국어 유튜브 댓글의 분류 정확도 향상에 기여하는가?

주요 결과

  • XLM가 67.31%의 최고 정확도를 기록하며, 다른 모든 모델, 기존 분류기 포함하여 슈퍼어리어를 확보함.
  • 어간 빈도 벡터라이저를 사용한 랜덤 포레스트가 기존 모델 중에서 가장 뛰어난 성능을 보였으며, 정확도는 63.59%였음.
  • 모든 트랜스포머 기반 모델이 기존 모델을 일관되게 능가했으며, XLM, DistilBERT, BERT는 모두 65%~67%의 정확도를 기록함.
  • 프리드먼 검정을 통해 다양한 모델 간 성능 차이가 통계적으로 유의미하다고 확인되었으며, 우연의 영향을 배제함.
  • 기존 모델들은 유사한 성능 수준을 보였으며, 이는 모델 선택 자체가 특징 공학 및 모델 아키텍처보다 영향력이 적다는 것을 시사함.
  • 이 연구는 상충 관계를 드러내며, 트랜스포머 모델은 더 정확하지만 기존 모델보다 훨씬 더 높은 계산 비용을 유발한다는 점을 강조함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.