[논문 리뷰] Improved Twitter Sentiment Analysis Using Naive Bayes and Custom Language Model
이 논문은 개발자 커뮤니티에서의 홍보 콘텐츠를 대상으로 하여 나이브 베이즈 분류와 자체 구축한 자연어 처리 모델을 융합한 하이브리드 접근법을 제안한다. 이 방법은 제품 관련 홍보를 식별하는 데 90%의 정확도를 달성하여 마이크로소프트 애저와 같은 기업의 사용자 기여도 평가를 향상시킨다.
In the last couple decades, social network services like Twitter have generated large volumes of data about users and their interests, providing meaningful business intelligence so organizations can better understand and engage their customers. All businesses want to know who is promoting their products, who is complaining about them, and how are these opinions bringing or diminishing value to a company. Companies want to be able to identify their high-value customers and quantify the value each user brings. Many businesses use social media metrics to calculate the user contribution score, which enables them to quantify the value that influential users bring on social media, so the businesses can offer them more differentiated services. However, the score calculation can be refined to provide a better illustration of a user's contribution. Using Microsoft Azure as a case study, we conducted Twitter sentiment analysis to develop a machine learning classification model that identifies tweet contents and sentiments most illustrative of positive-value user contribution. Using data mining and AI-powered cognitive tools, we analyzed factors of social influence and specifically, promotional language in the developer community. Our predictive model was a combination of a traditional supervised machine learning algorithm and a custom-developed natural language model for identifying promotional tweets, that identifies a product-specific promotion on Twitter with a 90% accuracy rate.
연구 동기 및 목표
- 비즈니스 인텔리전스를 위한 정서 분석을 개선하여 소셜 미디어에서 사용자 기여도 평가를 향상시키기 위해.
- 개발자 커뮤니티의 트위터 게시물에서 홍보 언어를 식별하여 사용자 가치를 정량화하기 위해.
- 기존 분류 기법과 자체 구축한 언어 모델을 융합한 기계 학습 모델을 개발하여 정확도를 향상시키기 위해.
- 실제 마이크로소프트 애저 개발자 커뮤니티의 데이터를 적용하여 실질적인 통찰을 도출하기 위해.
제안 방법
- 연구는 레이블이 부여된 트위터 데이터를 기반으로 훈련된 지도 학습 기반 나이브 베이즈 분류기를 사용하여 정서와 콘텐츠 유형을 분류한다.
- 특정 제품에 대한 언급을 중심으로 홍보 언어를 탐지하기 위해 자체 구축한 자연어 모델을 개발한다.
- 두 모델을 융합하여 특히 고가치 홍보 콘텐츠 식별 성능을 향상시킨다.
- 데이터 마이닝 및 인공지능 기반 인지 도구를 활용하여 사회적 영향력과 홍보 의도와 관련된 특징을 추출한다.
- 모델은 마이크로소프트 애저 개발자 커뮤니티의 실제 트위터 데이터를 대상으로 평가된다.
- 최종 예측 모델은 전통적인 기계 학습과 도메인 특화 언어 패턴을 통합하여 더 높은 정확도를 달성한다.
실험 결과
연구 질문
- RQ1나이브 베이즈와 자체 구축한 언어 모델의 하이브리드 모델은 트위터에서 홍보 트윗을 더 잘 탐지할 수 있는가?
- RQ2이러한 모델은 개발자 커뮤니티에서 제품 특정 홍보를 얼마나 정확하게 식별할 수 있는가?
- RQ3도메인 특화 언어 패턴을 통합할 경우 정서 분석의 정확도가 사용자 기여도 평가에 얼마나 향상되는가?
- RQ4이러한 접근 방식은 소셜 미디어 플랫폼에서 사용자 가치를 더 정교하게 측정할 수 있는 지표를 제공할 수 있는가?
주요 결과
- 제안된 모델은 트위터에서 제품 특정 홍보를 식별하는 데 90%의 정확도를 달성한다.
- 자체 구축한 언어 모델의 통합은 표준 나이브 베이즈 모델만을 사용하는 것보다 홍보 콘텐츠 탐지 능력을 크게 향상시킨다.
- 모델은 개발자 커뮤니티의 홍보 언어를 성공적으로 포착하여 사용자 기여도의 정량화를 향상시킨다.
- 이러한 접근 방식은 소셜 미디어 데이터를 활용하는 기업을 위한 더 정확하고 실질적인 사용자 기여도 평가 지표를 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.