[论文解读] DravidianMultiModality: A Dataset for Multi-modal Sentiment Analysis in Tamil and Malayalam
本论文提出了 DravidianMultiModality,这是首个针对泰米尔语和马拉雅拉姆语的多模态情感分析数据集,包含134个YouTube评论视频,配有由志愿者标注者手动转录的文本、字幕及情感标签(正面、负面、中性)。该数据集通过整合视频、音频和文本模态,实现了多模态情感分析,利用 Fleiss’s Kappa 验证了标注者间的一致性,为资源匮乏的德拉维达语系自然语言处理研究提供了基础性资源。
Human communication is inherently multimodal and asynchronous. Analyzing human emotions and sentiment is an emerging field of artificial intelligence. We are witnessing an increasing amount of multimodal content in local languages on social media about products and other topics. However, there are not many multimodal resources available for under-resourced Dravidian languages. Our study aims to create a multimodal sentiment analysis dataset for the under-resourced Tamil and Malayalam languages. First, we downloaded product or movies review videos from YouTube for Tamil and Malayalam. Next, we created captions for the videos with the help of annotators. Then we labelled the videos for sentiment, and verified the inter-annotator agreement using Fleiss's Kappa. This is the first multimodal sentiment analysis dataset for Tamil and Malayalam by volunteer annotators.
研究动机与目标
- 解决针对泰米尔语和马拉雅拉姆语等资源匮乏的德拉维达语系语言在多模态情感分析方面资源不足的问题。
- 创建一个公开可用、高质量的数据集,整合视频、文本和情感标注,以支持低资源语言多模态自然语言处理研究。
- 支持开发能够整合视觉、文本和语音线索的多模态情感分析模型,以在区域性语言中实现更准确的情感预测。
- 为未来在德拉维达语系语言社区中的多模态情感分析研究建立基准。
- 通过在低资源语言环境下利用多模态信号的互补性,提升情感分析的准确性。
提出的方法
- 收集了134个YouTube评论视频——其中70个为马拉雅拉姆语,64个为泰米尔语,聚焦于产品和电影评论。
- 为每个视频生成了手动转录的文本和字幕,以对齐文本内容与视觉及音频模态。
- 采用志愿者标注者,依据标准化标注协议,将每个视频的情感标签标注为正面、负面或中性。
- 使用 Fleiss’s Kappa 计算标注者间的一致性,以确保标签的可靠性和数据集质量。
- 通过包含视频ID、YouTube链接、语言和情感标签等元数据,对数据集进行结构化设计,以确保可复现性和可访问性。
- 将数据集公开发布于 GitHub 和 Zenodo,以确保学术界和工业界研究的开放获取。
实验结果
研究问题
- RQ1为资源匮乏的德拉维达语系语言(如泰米尔语和马拉雅拉姆语)创建多模态情感分析数据集是否可行,且质量是否可靠?
- RQ2志愿者标注者针对低资源语言视频内容生成的情感标注在多大程度上是可靠的?
- RQ3在泰米尔语和马拉雅拉姆语中,多模态信号(文本、音频、视频)在多大程度上能提升情感分类性能?
- RQ4在低资源语言环境下,收集和标注多模态数据面临哪些挑战?
- RQ5一个公开可用、由社区标注的数据集能否成为未来德拉维达语系多模态自然语言处理研究的基础?
主要发现
- DravidianMultiModality 数据集包含134个视频,其中70个为马拉雅拉姆语,64个为泰米尔语,每个视频均附有情感标签和转录文本。
- 通过 Fleiss’s Kappa 测量了标注者间的一致性,证实了标注者之间情感标注的一致性和可靠性。
- 该数据集是首个公开可用的泰米尔语和马拉雅拉姆语多模态情感分析资源,填补了低资源语言自然语言处理中的关键空白。
- 所有数据,包括视频链接、转录文本和情感标签,均可通过 GitHub 和 Zenodo 公开获取,供研究使用。
- 该数据集为未来在资源匮乏的德拉维达语系语言中利用视觉、文本和音频模态进行多模态情感分析研究提供了支持。
- 本研究证明了社区驱动的数据收集在低资源语言多模态自然语言处理任务中的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。