[논문 리뷰] DravidianMultiModality: A Dataset for Multi-modal Sentiment Analysis in Tamil and Malayalam
이 논문은 타밀어와 말라요르어를 위한 다중모态 감성 분석 데이터셋인 DravidianMultiModality를 소개한다. 이 데이터셋은 자발적 평가자들이 수작업으로 음성, 자막, 감성 레이블(긍정, 부정, 중립)을 기재한 134개의 유튜브 영상으로 구성되어 있으며, 영상, 음성, 텍스트 모달리티를 통합함으로써 다중모달 감성 분석을 가능하게 한다. 평가자 간 일致도는 Fleiss의 Kappa를 통해 검증되었으며, 자원이 부족한 드라비디아어 언어 NLP 연구를 위한 기초 자원을 제공한다.
Human communication is inherently multimodal and asynchronous. Analyzing human emotions and sentiment is an emerging field of artificial intelligence. We are witnessing an increasing amount of multimodal content in local languages on social media about products and other topics. However, there are not many multimodal resources available for under-resourced Dravidian languages. Our study aims to create a multimodal sentiment analysis dataset for the under-resourced Tamil and Malayalam languages. First, we downloaded product or movies review videos from YouTube for Tamil and Malayalam. Next, we created captions for the videos with the help of annotators. Then we labelled the videos for sentiment, and verified the inter-annotator agreement using Fleiss's Kappa. This is the first multimodal sentiment analysis dataset for Tamil and Malayalam by volunteer annotators.
연구 동기 및 목표
- 자원이 부족한 듀라비디아어 언어인 타밀어와 말라요르어를 위한 다중모달 감성 분석 자원의 부족을 해결하기 위해.
- 학술 및 산업 연구를 위해 공개 가능한 고품질의 데이터셋을 구축하여 영상, 텍스트, 감성 레이블을 통합함으로써 저자원 언어의 다중모달 NLP 연구를 지원하기 위해.
- 정확한 감성 예측을 위해 시각적, 텍스트적, 음성적 신호를 통합하는 다중모달 감성 분석 모델의 개발을 지원하기 위해.
- 드라비디아어 언어 공동체 내에서 향후 연구를 위한 기준을 마련하기 위해.
- 저자원 언어 환경에서 다수의 모달리티에서 유래한 보완적 신호를 활용하여 감성 분석 정확도를 향상시키기 위해.
제안 방법
- 제품 및 영화 리뷰에 중점을 두고, 말라요르어로 70개, 타밀어로 64개의 유튜브 리뷰 영상을 수집하였다.
- 영상의 시각적 및 청각적 모달리티와 일치시키기 위해 각 영상의 수작업 전사본과 자막을 생성하였다.
- 표준화된 평가 프rotocol를 사용하여 자발적 평가자들이 각 영상의 감성을 긍정, 부정, 중립으로 레이블링하였다.
- 레이블 신뢰도와 데이터셋 품질을 확보하기 위해 평가자 간 일치도를 Fleiss의 Kappa를 사용하여 계산하였다.
- 재현 가능성과 접근성을 확보하기 위해 영상 ID, 유튜브 URL, 언어, 감성 레이블 등의 메타데이터를 포함하여 데이터셋을 체계적으로 구성하였다.
- 학술 및 산업 연구를 위한 개방형 액세스를 보장하기 위해 GitHub와 Zenodo에 데이터셋을 공개하였다.
실험 결과
연구 질문
- RQ1자원이 부족한 듀라비디아어 언어인 타밀어와 말라요르어를 위한 다중모달 감성 분석 데이터셋을 구축하는 것이 실현 가능하고 품질이 보장되는가?
- RQ2자원이 부족한 언어의 영상 콘텐츠에 대해 자발적 평가자들이 생성한 감성 레이블의 신뢰도는 어느 정도인가?
- RQ3텍스트, 음성, 영상 등의 다중모달 신호가 타밀어와 말라요르어에서 감성 분류 성능을 어느 정도 향상시킬 수 있는가?
- RQ4저자원 언어 환경에서 다중모달 데이터를 수집하고 레이블링할 때 발생하는 과제는 무엇인가?
- RQ5공개된 커뮤니티 기반의 레이블링 데이터셋이 향후 듀라비디아어 언어에서의 다중모달 NLP 연구의 기초가 될 수 있는가?
주요 결과
- DravidianMultiModality 데이터셋은 총 134개의 영상으로 구성되어 있으며, 말라요르어로 70개, 타밀어로 64개이며, 감성 레이블과 전사된 텍스트로 레이블링되어 있다.
- 평가자 간 일치도는 Fleiss의 Kappa를 사용하여 측정되었으며, 평가자 간 일관성 있고 신뢰할 수 있는 감성 레이블링이 이루어졌음을 확인하였다.
- 모든 데이터, 영상 URL, 전사본, 감성 레이블이 모두 GitHub와 Zenodo에서 연구 목적을 위해 공개 가능하다.
- 이 데이터셋은 자원이 부족한 듀라비디아어 언어에서 시각적, 텍스트적, 청각적 모달리티를 활용한 향후 다중모달 감성 분석 연구를 가능하게 한다.
- 본 연구는 저자원 언어의 다중모달 NLP 작업에서 커뮤니티 기반 데이터 수집의 실현 가능성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.