Skip to main content
QUICK REVIEW

[논문 리뷰] Anubhuti -- An annotated dataset for emotional analysis of Bengali short stories

Aditya Pal, Bhaskar Karn|arXiv (Cornell University)|2020. 10. 06.
Sentiment Analysis and Opinion Mining참고 문헌 12인용 수 5
한 줄 요약

이 논문은 언어학적으로 숙련된 평가자들이 철저한 수작업 주석을 통해 제작한 첫 번째 대규모 주석 데이터셋인 Anubhuti를 소개한다. 이 데이터셋은 벤갈리 단편소설의 정서 분석을 위한 것으로, 높은 상호 평가자 일致도를 달성하였다. 이 데이터셋은 기존 기계학습 및 딥러닝 모델을 활용해 높은 정확도의 정서 분류를 가능하게 하며, 자원이 부족한 언어 분야의 NLP, 언어학 및 문학적 정서 분석에 유의미한 통찰을 제공한다.

ABSTRACT

Thousands of short stories and articles are being written in many different languages all around the world today. Bengali, or Bangla, is the second highest spoken language in India after Hindi and is the national language of the country of Bangladesh. This work reports in detail the creation of Anubhuti -- the first and largest text corpus for analyzing emotions expressed by writers of Bengali short stories. We explain the data collection methods, the manual annotation process and the resulting high inter-annotator agreement of the dataset due to the linguistic expertise of the annotators and the clear methodology of labelling followed. We also address some of the challenges faced in the collection of raw data and annotation process of a low resource language like Bengali. We have verified the performance of our dataset with baseline Machine Learning as well as a Deep Learning model for emotion classification and have found that these standard models have a high accuracy and relevant feature selection on Anubhuti. In addition, we also explain how this dataset can be of interest to linguists and data analysts to study the flow of emotions as expressed by writers of Bengali literature.

연구 동기 및 목표

  • 벤갈리 단편소설의 정서 분석을 위한 첫 번째 대규모이자 고품질 주석 데이터셋을 구축하기 위해.
  • 벤갈리와 같이 자원이 부족한 언어에서 텍스트 데이터를 수집하고 주석 처리하는 데 도전 과제를 해결하기 위해.
  • 전문 평가자와 명확히 정의된 레이블링 방법론을 통해 높은 상호 평가자 일치도를 확보하기 위해.
  • 표준 기계학습 및 딥러닝 모델을 사용하여 데이터셋의 유용성을 평가하기 위해 정서 분류 작업을 수행하기 위해.
  • NLP, 계산 언어학 및 문학적 정서 흐름 분석 분야의 다학제적 연구를 지원하기 위해.

제안 방법

  • 다양한 문학적 출처에서 확보한 벤갈리 단편소설을 수집하여 언어적 및 주제적 다양성을 확보하였다.
  • 언어학적으로 훈련된 평가자들이 표준화된 레이블링 프레임워크를 사용하여 텍스트에 표현된 정서를 식별하는 수작업 주석을 수행하였다.
  • 상호 평가자 일치도가 측정되었으며, 정서 주석의 일관성과 신뢰성은 높은 수준임을 확인하였다.
  • 기본 모델로는 기존 기계학습 및 딥러닝 아키텍처를 사용하여 Anubhuti 데이터셋에서 학습 및 평가를 수행하였다.
  • 정서 분류에 관련된 적절한 언어적 단서를 식별하기 위해 특징 선택을 수행하였다.
  • 정서 분류 작업에서의 성능 평가를 통해 데이터셋을 검증하였으며, 높은 모델 정확도를 입증하였다.

실험 결과

연구 질문

  • RQ1벤갈리와 같이 자원이 부족한 언어에 대해 고품질의 대규모 정서 주석 데이터셋을 어떻게 구축할 수 있는가?
  • RQ2전문 평가자와 표준화된 레이블링 프로토콜을 사용할 경우, 벤갈리어에서 어떤 수준의 상호 평가자 일치도를 달성할 수 있는가?
  • RQ3표준 기계학습 및 딥러닝 모델은 Anubhuti 데이터셋을 사용하여 정서 분류 작업에서 얼마나 잘 성능을 내는가?
  • RQ4벤갈리 문학 텍스트에서 정서를 예측하는 데 가장 유용한 언어적 특징는 무엇인가?
  • RQ5이 데이터셋은 NLP, 언어학 및 문학 분석 분야의 다학제적 연구에 어떤 방식으로 기여할 수 있는가?

주요 결과

  • Anubhuti 데이터셋은 높은 상호 평가자 일치도를 달성하여 주석 처리 과정의 신뢰성을 확인하였다.
  • 표준 기계학습 및 딥러닝 모델은 Anubhuti 데이터셋에서 정서 분류 작업에서 높은 정확도를 기록하였다.
  • 이 데이터셋은 효과적인 특징 선택을 가능하게 하여, 벤갈리 서사문에서 정서 탐지에 중요한 언어적 단서를 식별할 수 있었다.
  • 이 코퍼스는 자원이 부족한 NLP 분야에서 벤갈리 단편소설 정서 분석을 위한 첫 번째이자 가장 큰 자료로, 중요한 격차를 메웠다.
  • 이 데이터셋은 NLP 작업뿐 아니라, 벤갈리 문학에서 정서의 흐름을 분석하는 언어학적 및 문학적 연구에도 유용하다.
  • 이 데이터셋 제작 과정은 다른 자원이 부족한 언어에서 유사 자료를 구축하는 데 적용 가능한 반복 가능한 프레임워크를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.