Skip to main content
QUICK REVIEW

[논문 리뷰] TUNIZI: a Tunisian Arabizi sentiment analysis Dataset

Chayma Fourati, Abir Messaoudi|arXiv (Cornell University)|2020. 04. 29.
Sentiment Analysis and Opinion Mining인용 수 9
한 줄 요약

이 논문은 토네이지어 아라비지(튜니지아어)를 위한 공개된 감성 분석 데이터셋인 TUNIZI를 소개한다. 이는 라틴 문자와 수자로 쓰인 토네이지아어의 첫 번째 공개된 감성 분석 데이터셋으로, 유튜브 댓글에서 수집되었으며, 링크와标 punctuations를 제거하고 5명의 모국어 사용자에 의한 수작업으로 주석을 달아 정제된 데이터셋이다. 전체 9,210개 문장에 대해 균형 잡힌 감성 레이블(47% 긍정, 53% 부정)을 포함하고 있어, 저자원을 가진 북아프리카 방언에 대한 딥러닝 연구를 가능하게 한다.

ABSTRACT

On social media, Arabic people tend to express themselves in their own local dialects. More particularly, Tunisians use the informal way called "Tunisian Arabizi". Analytical studies seek to explore and recognize online opinions aiming to exploit them for planning and prediction purposes such as measuring the customer satisfaction and establishing sales and marketing strategies. However, analytical studies based on Deep Learning are data hungry. On the other hand, African languages and dialects are considered low resource languages. For instance, to the best of our knowledge, no annotated Tunisian Arabizi dataset exists. In this paper, we introduce TUNIZI a sentiment analysis Tunisian Arabizi Dataset, collected from social networks, preprocessed for analytical studies and annotated manually by Tunisian native speakers.

연구 동기 및 목표

  • 라틴 문자로 쓰인 저자원 아랍어 방언인 토네이지아어를 위한 주석이 달린 데이터셋 부족 문제를 해결하기 위해.
  • 균형 잡히고 대표적인 데이터셋을 제공하여 북아프리카 NLP 분야의 감성 분석 연구를 지원하기 위해.
  • 토네이지아어 온라인 콘텐츠를 위한 고객 감성 분석, 마케팅, 소셜 미디어 모니터링 등 딥러닝 응용을 가능하게 하기 위해.
  • 공개 가능한 데이터셋을 제공함으로써 소외된 아프리카어 연구를 촉진하기 위해.

제안 방법

  • 정치, 스포츠, 코미디, 토네이지아어 음악 등 다양한 주제의 유튜브 댓글에서 데이터 수집.
  • 맞춤 스크립트를 사용해 프랑스어 및 영어 댓글을 자동으로 걸러내는 필터링.
  • 토네이지아어 콘텐츠만 유지하기 위해 수작업으로 정제하여 비토네이지아어 방언은 제거.
  • URL, 이모티콘, 문장 부호 제거 등의 사전 처리 단계를 통해 텍스트 표준화.
  • 대학원 학위(석사/박사)를 소지한 5명의 모국어 사용자에 의한 수작업 감성 주석 달기로 언어적 정확성 확보.
  • 두 명의 여성 주석 담당자가 평가하여 이중 주석자 간 일致성과 데이터 품질을 검증.

실험 결과

연구 질문

  • RQ1현재 토네이지아어 아라비지에 대해 주석이 달린 데이터셋의 현황은 어떠한가, 그리고 기존 자원에서 누락된 부분은 무엇인가?
  • RQ2실제 소셜 미디어 콘텐츠에서 실제 생활의 토네이지아어 아라비지 콘텐츠를 바탕으로 균형 잡히고 대표적인 감성 분석 데이터셋을 어떻게 구성할 수 있는가?
  • RQ3비표준 철자법을 가진 비공식적인 토네이지아어 텍스트를 수집하고 사전 처리할 때의 과제는 무엇인가, 특히 NLP 작업에서의 도전 과제는?
  • RQ4모국어 사용자에 의한 수작업 주석이 저자원 방언의 고품질 감성 레이블 확보에 얼마나 효과적인가?
  • RQ5TUNIZI가 북아프리카 아랍어 방언의 향후 딥러닝 모델 감성 분석 연구에 어떤 잠재력을 지닐 수 있는가?

주요 결과

  • TUNIZI는 토네이지아어 아라비지에 대해 공개된 첫 번째 감성 분석 데이터셋으로, 총 9,210개 문장 포함.
  • 데이터셋은 균형 잡혀 있으며, 긍정 댓글 4,372개(전체의 47%), 부정 댓글 4,838개(전체의 53%) 포함.
  • 사전 처리 후 데이터셋은 총 79,862개의 단어와 22,850개의 고유 단어를 포함하여 언어적 다양성을 보여줌.
  • 두 명의 여성 주석자에 의한 평가를 통해 주석 과정에서 높은 신뢰도 확보, 레이블 일관성 보장.
  • 정치, 코미디, 토네이지아어 음악 등 다양한 콘텐츠 유형에서 수집되어 데이터셋의 대표성 향상.
  • 미래의 저자원 아프리카어 NLP 연구를 지원하기 위해 깃허브에 공개

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.