QUICK REVIEW
[论文解读] Multilingual Persuasion Detection: Video Games as an Invaluable Data Source for NLP
Teemu Pöyhönen, Mika Hämäläinen|arXiv (Cornell University)|Jul 10, 2022
Digital Games and Media被引用 5
一句话总结
本文提出了一种从角色扮演游戏(RPGs)中提取的多语言说服力检测数据集,利用半标注对话来训练基于 BERT 的自然语言处理模型。结果表明,电子游戏对话为说服力检测提供了丰富且多语言的资源,在极少人工标注的情况下即可实现优异性能。
ABSTRACT
Role-playing games (RPGs) have a considerable amount of text in video game dialogues. Quite often this text is semi-annotated by the game developers. In this paper, we extract a multilingual dataset of persuasive dialogue from several RPGs. We show the viability of this data in building a persuasion detection system using a natural language processing (NLP) model called BERT. We believe that video games have a lot of unused potential as a datasource for a variety of NLP tasks. The code and data described in this paper are available on Zenodo.
研究动机与目标
- 通过利用尚未被充分利用的电子游戏对话,解决自然语言处理中多语言说服力数据集稀缺的问题。
- 探索使用半结构化、游戏开发者标注的对话用于说服力检测的可行性。
- 评估基于 BERT 的模型在新构建的多语言说服力数据集上的性能。
- 证明电子游戏可作为可扩展且语言多样化的 NLP 任务数据源。
- 发布数据集和代码,以支持多语言说服力检测的可复现性与进一步研究。
提出的方法
- 从多个具有现有半标注说服内容的角色扮演游戏(RPGs)中提取对话文本。
- 基于开发者提供的标注和语言线索,识别并标注具有说服力的语句。
- 利用国际版 RPG 游戏中的对话,构建涵盖多种语言的多语言数据集。
- 在提取的数据集上微调多语言 BERT 模型(mBERT),用于说服力的序列分类。
- 使用标准 NLP 指标(如 F1 分数和准确率)在多种语言上评估模型性能。
- 将数据集和代码发布在 Zenodo 上,以确保可复现性并支持社区复用。
实验结果
研究问题
- RQ1电子游戏对话能否作为多语言说服力检测数据集的可行来源?
- RQ2微调后的多语言 BERT 模型在多种语言的电子游戏对话中检测说服力的效率如何?
- RQ3半标注的游戏对话在多大程度上能为说服力检测提供可靠的监督信号?
- RQ4该模型在数据集中不同语言上的性能表现有何差异?
- RQ5电子游戏在说服力检测之外,作为可扩展的多语言 NLP 任务数据源,其潜力如何?
主要发现
- 提取的数据集包含大量多语言对话及标注的说服实例,支持跨语言 NLP 训练。
- 微调后的多语言 BERT 模型在多种语言上均取得了具有竞争力的 F1 分数,证明了零样本和少样本迁移学习的可行性。
- RPG 中的说服性对话通常具有清晰的语言标记,使得在极少额外标注的情况下即可实现自动检测。
- 该数据集在不同语言间表现出显著的语言多样性,支持多语言 NLP 系统的开发。
- 电子游戏对话为 NLP 任务提供了可扩展且尚未被充分利用的高质量、上下文丰富的文本资源。
- 在 Zenodo 上发布的数据集和代码,使研究社区能够复现并拓展本项工作。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。