Skip to main content
QUICK REVIEW

[논문 리뷰] SlangSD: Building and Using a Sentiment Dictionary of Slang Words for Short-Text Sentiment Classification

Liang Wu, Fred Morstatter|arXiv (Cornell University)|2016. 08. 17.
Sentiment Analysis and Opinion Mining참고 문헌 17인용 수 21
한 줄 요약

이 논문은 유저가 생성한 짧고 비공식적인 텍스트에서 흔히 사용되는 슬랭어어휘의 감성 극성(긍정/부정)을 대규모로 자동으로 추론하기 위해 유저디너리와 기존 감성 어휘사전을 활용하여 구축한 공개 가능한 첫 번째 슬랭어 감성 어휘사전인 SlangSD를 소개한다. SentiStrength 감성 분석 도구에 SlangSD를 통합함으로써 저자들은 특히 짧고 비공식적인 텍스트에서의 부정 감성 탐지 성능을 크게 향상시켰으며, 이는 SlangSD의 효과성과 실제 응용 분야에서의 쉽게 통합 가능한 특성을 입증한다.

ABSTRACT

Sentiment in social media is increasingly considered as an important resource for customer segmentation, market understanding, and tackling other socio-economic issues. However, sentiment in social media is difficult to measure since user-generated content is usually short and informal. Although many traditional sentiment analysis methods have been proposed, identifying slang sentiment words remains untackled. One of the reasons is that slang sentiment words are not available in existing dictionaries or sentiment lexicons. To this end, we propose to build the first sentiment dictionary of slang words to aid sentiment analysis of social media content. It is laborious and time-consuming to collect and label the sentiment polarity of a comprehensive list of slang words. We present an approach to leverage web resources to construct an extensive Slang Sentiment word Dictionary (SlangSD) that is easy to maintain and extend. SlangSD is publicly available for research purposes. We empirically show the advantages of using SlangSD, the newly-built slang sentiment word dictionary for sentiment classification, and provide examples demonstrating its ease of use with an existing sentiment system.

연구 동기 및 목표

  • 소셜 미디어 게시물과 같은 짧고 비공식적인 사용자 생성 콘텐츠에서 흔히 나타나는 슬랭어어휘를 포함하지 않는 감성 어휘사전의 부족을 해결하기 위해.
  • 수동 레이블링에 의존하지 않고도 슬랭어어휘에 대한 감성 극성을 자동으로 할당할 수 있는 확장성 있고 유지보수 가능한 방법을 개발하기 위해.
  • 기존 감성 분석 시스템에 쉽게 통합할 수 있도록 공개 가능하고 확장 가능한 슬랭어 감성 어휘사전을 만들기 위해.
  • 실제 짧은 텍스트 데이터셋에서의 감성 분류 성능 향상에 있어 슬랭어 감성 어휘사전의 실용성을 경험적으로 검증하기 위해.
  • 특히 유저디너리와 같은 사디리컬하거나 비공식적인 출처에서 유래한 슬랭어어휘어가 부정 감성 탐지에 더 효과적인지 입증하기 위해.

제안 방법

  • 비공식어어휘의 포괄적인 커뮤니티 유지 데이터베이스인 유저디너리를 주요 자료원으로 활용하여 슬랭어어휘어와 어구를 수집하기 위해.
  • 기존 감성 어휘사전(SentiStrength, SentiWordNet 등)과 유저디너리의 동의어 매핑을 활용하여 전이학습 유사 접근 방식을 통해 슬랭어어휘의 감성 극성을 추론하기 위해.
  • 기존 감성어와의 동시출현 패턴과 문법적 유사도를 분석하여 규칙 기반 및 맥락 인식 스코어링 메커니즘을 적용하여 감성 강도를 추정하기 위해.
  • 최종적으로 도출된 SlangSD 어휘사전을 SentiStrength 감성 분석 시스템에 추가 어휘 레이어로 통합하여 기본 단어 목록을 대체하거나 보완하기 위해.
  • 슬랭어어휘를 포함한 데이터셋에서의 성능을 비교하기 위해 one-vs-all 평가 프로토콜을 사용하여 정밀도, 재현도, F-스코어를 각각 양성과 부성 감성에 대해 측정하기 위해.
  • 정기적인 업데이트와 커뮤니티 피드백을 통해 어휘사전을 유지 및 확장하여 장기적인 관련성과 커버리지 확보하기 위해.

실험 결과

연구 질문

  • RQ1대규모로 자동으로 구축된 슬랭어 감성 어휘사전은 짧고 비공식적인 텍스트에서 감성 분류 성능을 향상시킬 수 있는가?
  • RQ2伝통적인 감성 어휘사전과 비교해 SlangSD는 슬랭어어휘의 감성 극성 탐지에 얼마나 효과적인가?
  • RQ3SlangSD의 통합은 실제 짧은 텍스트 데이터에서 기존 감성 분석 도구의 성능을 뚜렷이 향상시키는가?
  • RQ4유저디너리와 같은 사디리컬하거나 비공식적인 출처에서 유래한 슬랭어어휘는 부정 감성 탐지에 양성 감성 탐지보다 더 효과적인가?
  • RQ5SlangSD는 모델 재학습 없이도 기존 감성 분석 파이프라인에 얼마나 쉽게 통합될 수 있는가?

주요 결과

  • SlangSD는 감성 점수를 할당받은 슬랭어어휘어 96,462개를 포함하고 있으며, 이는 유사한 종류의 첫 번째 종합적인 슬랭어 감성 어휘사전이다.
  • SentiStrength에 통합된 결과, 개선된 모델(SentiStrength${}_{\text{SSD}}$)은 부정 트윗에서 F-스코어 91.19%를 기록하여 기준 모델인 SentiStrength(71.06%)에 비해 뚜렷한 향상을 이뤘다.
  • SMS 메시지에서는 SentiStrength${}_{\text{SSD}}$가 기준 모델 대비 양성 감성 작업에서 50% 이상, 부성 감성 작업에서 50% 이상의 재현도 향상을 기록했으며, 각각 75.51%와 88.14%의 성능을 달성했다.
  • 성능 향상은 특히 부정 감성 탐지에서 두드러졌으며, 이는 SlangSD가 비공식 콘텐츠에서 흔한 비꼬임이나 풍자 표현을 효과적으로 식별하는 데 특화되어 있음을 시사한다.
  • SlangSD 통합에는 재학습 없이 구성 설정 변경만으로 가능했으며, 이는 존재하는 감성 분석 시스템에서 즉각 사용 가능한 플러그 앤 플레이 유저블리티를 입증한다.
  • 결과는 웹 기반 슬랭어 저장소(예: 유저디너리)를 활용하고 자동 극성 추론 기법을 적용함으로써 대규모로 고카버리지 감성 어휘사전을 구축할 수 있으며, 강력한 경험적 성과를 얻을 수 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.