[논문 리뷰] Humor Detection in English-Hindi Code-Mixed Social Media Content : Corpus and Baseline System
이 논문은 유머 또는 비유머로 레이블이 지정된 3,543건의 영어-힌디어 혼합 트윗과 단어 수준의 언어 태그를 포함한 무료로 이용 가능한 수작업 레이블링 코퍼스를 소개한다. n-그램, 보이스 오브 워즈(BoW), 공통 어휘, 해시태그를 특징으로 사용하는 베이스라인 유머 감지 시스템을 제안하며, SVM-RBF가 코퍼스에서 69.3%의 최고 정확도를 기록하여 多언어 소셜 미디어 콘텐츠에서의 유머 감지 가능성을 입증한다.
The tremendous amount of user generated data through social networking sites led to the gaining popularity of automatic text classification in the field of computational linguistics over the past decade. Within this domain, one problem that has drawn the attention of many researchers is automatic humor detection in texts. In depth semantic understanding of the text is required to detect humor which makes the problem difficult to automate. With increase in the number of social media users, many multilingual speakers often interchange between languages while posting on social media which is called code-mixing. It introduces some challenges in the field of linguistic analysis of social media content (Barman et al., 2014), like spelling variations and non-grammatical structures in a sentence. Past researches include detecting puns in texts (Kao et al., 2016) and humor in one-lines (Mihalcea et al., 2010) in a single language, but with the tremendous amount of code-mixed data available online, there is a need to develop techniques which detects humor in code-mixed tweets. In this paper, we analyze the task of humor detection in texts and describe a freely available corpus containing English-Hindi code-mixed tweets annotated with humorous(H) or non-humorous(N) tags. We also tagged the words in the tweets with Language tags (English/Hindi/Others). Moreover, we describe the experiments carried out on the corpus and provide a baseline classification system which distinguishes between humorous and non-humorous texts.
연구 동기 및 목표
- 다국어 및 혼합 언어 소셜 미디어 콘텐츠, 특히 영어-힌디어 맥락에서의 자동 유머 감지 과제를 해결하기 위해.
- 유머(H) 및 비유머(N) 레이블이 부여된 균형 잡힌 수작업 레이블링 코퍼스를 구축하기 위해.
- 다양한 언어적 특징을 사용하여 혼합 언어 텍스트에서의 유머 분류를 위한 베이스라인 기계학습 시스템을 개발하고 평가하기 위해.
- 저자원, 혼합 언어 NLP 환경에서 문자 수준 및 단어 수준 특징의 효과성을 탐색하기 위해.
- 다국어 유머 감지 및 다국어 텍스트 분류 분야의 향후 연구를 위한 기반을 마련하기 위해.
제안 방법
- twitterscraper 파이썬 패키지를 사용하여 트위터에서 10,478건의 트윗을 수집하고, 영어-힌디어 혼합 콘텐츠로 필터링하였다.
- 3,543건의 트윗을 수작업으로 유머(1,755건) 및 비유머(1,698건)로 분류하였으며, 단어 수준의 언어 태그(영어, 힌디어, 기타)를 부여하였다.
- 복합어 분할(예: 'AadabArzHai' → 'Aadab', 'Arz', 'Hai') 및 캐멀 케이스 규칙을 사용한 해시태그 분해를 통해 트윗을 전처리하였다.
- 네 가지 특징 유형을 추출: 문자 수준의 3-그램(빈도 >10), 보이스 오브 워즈(3단어 윈도우), 공통 어휘, 해시태그 특징.
- 卡-제곱 특징 선택을 적용하고, 10겹 교차 검증을 통해 네 가지 분류기(SVM-RBF, 랜덤 포레스트, 엑스트라 트리, 나이브 베이즈)를 훈련시켰다.
- 그리드 서치를 사용해 초모델 하이퍼파라미터를 최적화하고, 모든 폴드에서의 평균 정확도를 보고하였다.
실험 결과
연구 질문
- RQ1n-그램 및 보이스 오브 워즈 특징은 영어-힌디어 혼합 소셜 미디어 텍스트에서의 유머 감지에 얼마나 효과적인가?
- RQ2저자원, 다국어 텍스트에서의 유머 감지에 가장 잘 작동하는 기계학습 분류기는 무엇인가?
- RQ3문자 수준의 특징과 같은 언어에 종속되지 않는 특징이 혼합 언어 유머 감지에서 어휘적 또는 의미적 특징을 능가할 수 있는가?
- RQ4해시태그와 공통 어휘의 포함 여부가 분류 성능에 어떤 영향을 미치는가?
- RQ5혼합 언어 인도 소셜 미디어 콘텐츠에서의 유머 감지 베이스라인 성능은 어떠한가?
주요 결과
- 반경 기저 함수(RBF) 커널을 사용한 SVM가 전체 특징 세트에서 69.3%의 최고 정확도를 기록하여 다른 분류기들을 능가하였다.
- 모든 분류기에서 n-그램이 가장 효과적인 특징 유형으로 나타났으며, 이는 공통 어휘와 해시태그 다음으로 높은 성능을 보였다.
- SVM, 랜덤 포레스트, 엑스트라 트리 분류기에서 보이스 오브 워즈 특징이 가장 낮은 성능을 보였지만, 나이브 베이즈에서는 보다 우수한 결과를 기록하였다.
- 코퍼스는 유머 1,755건과 비유머 1,698건으로 균형 잡혀 있어 유머 감지 시스템의 신뢰성 있는 평가를 가능하게 하였다.
- 최고 성능을 보인 모델(SVM-RBF)은 n-그램 특징만을 사용할 경우 68.5%의 정확도를 기록하여 최소한의 특징 공학으로도 뛰어난 성능을 보였다.
- 본 연구는 혼합 언어 인도 소셜 미디어에서의 유머 감지에 기초 기준 성능을 확립하였으며, 향후 다국어 및 다자국자모 환경으로의 확장 가능성을 지닌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.