[논문 리뷰] Presence of informal language, such as emoticons, hashtags, and slang, impact the performance of sentiment analysis models on social media text?
이 연구는 캐비넷(CNN)을 사용하여 사투, 감성, 이모티콘 데이터셋으로 훈련된 모델을 활용해 비공식어(이모티콘, 해시태그, 슬랭)가 감성 분석 모델에 미치는 영향을 조사한다. 결과적으로 비공식어로 인한 성능 저하가 미미하며, 이모티콘 데이터를 포함했을 때 정확도가 약간 향상되어 95.37%를 기록함으로써 비공식어 요소가 모델 성능에 제한적인 부정적 영향을 미친다는 것을 시사한다.
This study aimed to investigate the influence of the presence of informal language, such as emoticons and slang, on the performance of sentiment analysis models applied to social media text. A convolutional neural network (CNN) model was developed and trained on three datasets: a sarcasm dataset, a sentiment dataset, and an emoticon dataset. The model architecture was held constant for all experiments and the model was trained on 80% of the data and tested on 20%. The results revealed that the model achieved an accuracy of 96.47% on the sarcasm dataset, with the lowest accuracy for class 1. On the sentiment dataset, the model achieved an accuracy of 95.28%. The amalgamation of sarcasm and sentiment datasets improved the accuracy of the model to 95.1%, and the addition of emoticon dataset has a slight positive impact on the accuracy of the model to 95.37%. The study suggests that the presence of informal language has a restricted impact on the performance of sentiment analysis models applied to social media text. However, the inclusion of emoticon data to the model can enhance the accuracy slightly.
연구 동기 및 목표
- 비공식어 요소인 이모티콘, 해시태그, 슬랭이 감성 분석 모델 성능에 미치는 영향을 조사하기.
- 비공식어 데이터 포함 여부가 소셜미디어 텍스트 분류에서 모델 정확도에 미치는 영향(향상 또는 저하)를 평가하기.
- 다양한 비공식어 패턴에 노출된 CNN 기반 감성 분석 모델의 견고성 평가하기.
- 다양한 비공식어 데이터셋을 조합함으로써 전체 모델 성능 향상 여부를 판단하기.
제안 방법
- 3개의 별도 데이터셋(사투, 감성, 이모티콘 데이터)에 대해 캐비넷(CNN) 모델을 훈련하고 평가하였다.
- 모델은 각 데이터셋의 80%를 훈련 데이터로, 나머지 20%를 테스트 데이터로 사용하여 일관된 평가를 확보하였다.
- 모델 성능은 다양한 클래스와 데이터셋 조합에 대한 정확도를 측정함으로써 평가되었다.
- 모든 실험에서 아키텍처는 일정하게 유지되어 데이터셋 구성의 영향만을 분리해 분석할 수 있도록 하였다.
- 데이터셋을 단계적으로 통합(사투, 감성, 이모티콘 데이터)하여 성능에 미치는 누적 영향을 평가하였다.
- 개별 및 통합된 데이터셋에 대한 성능 평가를 통해 비공식어 유형의 영향을 분석하였다.
실험 결과
연구 질문
- RQ1소셜미디어 텍스트에서 이모티콘이 감성 분석 모델의 정확도에 어떤 영향을 미치는가?
- RQ2슬랭과 비공식 해시태그는 감성 분석 모델의 성능을 어느 정도 저하시키는가?
- RQ3이모티콘이 포함된 데이터를 통합함으로써 감성 분석 모델의 견고성이 향상되는가?
- RQ4사투와 감성 데이터셋을 통합할 경우 비공식어가 존재할 때 모델 정확도는 어떻게 변화하는가?
- RQ5다양한 비공식어 형태(이모티콘, 해시태그, 슬랭)가 모델 성능에 미치는 상대적 영향은 무엇인가?
주요 결과
- CNN 모델은 사투 데이터셋에서 96.47%의 정확도를 기록했으며, 클래스 1에서 가장 낮은 성능를 보였다.
- 감성 데이터셋에서는 모델이 95.28%의 정확도를 달성하여 표준 감성 분류 작업에서 뛰어난 성능를 보였다.
- 사투 및 감성 데이터셋을 통합했을 때 정확도는 약간 감소하여 95.10%로 떨어졌으며, 이는 데이터 분포 문제의 가능성을 시사한다.
- 이모티콘 데이터셋을 통합한 모델에서는 정확도가 95.37%로 향상되어, 약간이지만 양적인 영향을 미쳤다.
- 연구는 이모티콘, 해시태그, 슬랭과 같은 비공식어 요소가 감성 분석 모델 성능에 제한적인 부정적 영향을 미친다는 결론을 내렸다.
- 이모티콘 데이터 포함은 모델 정확도에 측정 가능한, 비록 미미하지만 긍정적인 기여를 하며, 훈련 데이터로서의 가치를 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.