Skip to main content
QUICK REVIEW

[論文レビュー] Multilingual Persuasion Detection: Video Games as an Invaluable Data Source for NLP

Teemu Pöyhönen, Mika Hämäläinen|arXiv (Cornell University)|Jul 10, 2022
Digital Games and Media被引用数 5
ひとこと要約

この論文では、ロールプレイングゲーム(RPG)から抽出された部分的にアノテーションが付与された対話文を活用して、多言語対応の説得検出データセットを提案する。BERTベースの自然言語処理(NLP)モデルの学習に活用した結果、ビデオゲームの対話文は、最小限の人的アノテーションで多言語対応の説得検出に優れたリソースを提供することが示された。

ABSTRACT

Role-playing games (RPGs) have a considerable amount of text in video game dialogues. Quite often this text is semi-annotated by the game developers. In this paper, we extract a multilingual dataset of persuasive dialogue from several RPGs. We show the viability of this data in building a persuasion detection system using a natural language processing (NLP) model called BERT. We believe that video games have a lot of unused potential as a datasource for a variety of NLP tasks. The code and data described in this paper are available on Zenodo.

研究の動機と目的

  • NLP分野における多言語対応の説得検出データセットの不足を、未活用のビデオゲーム対話文を活用することで解決すること。
  • ゲーム開発者によって部分的にアノテーションが与えられた構造化された対話文を、説得検出に活用できるかの可能性を検討すること。
  • 新たに構築した多言語対応の説得検出データセット上で、BERTベースのモデルの性能を評価すること。
  • ビデオゲームが、スケーラブルで言語的に多様なNLPタスクのデータソースとして機能できるかを示すこと。
  • 研究の再現性とさらなる研究促進を目的として、データセットとコードを公開すること。

提案手法

  • 既存の部分的アノテーションが付与された説得的コンテンツを有する複数のロールプレイングゲーム(RPG)から対話文テキストを抽出した。
  • ゲーム開発者によるアノテーションと文脈的特徴に基づいて、説得的発話の特定とラベリングを実施した。
  • 国際版RPGの対話文を活用して、複数の言語をカバーする多言語データセットを構築した。
  • 説得の序列分類を目的として、抽出したデータセット上で多言語BERTモデル(mBERT)を微調整した。
  • F1スコアや正答率といった標準的なNLP指標を用いて、複数の言語におけるモデル性能を評価した。
  • 再現性とコミュニティによる再利用を確保するため、Zenodoにデータセットとコードを公開した。

実験結果

リサーチクエスチョン

  • RQ1ビデオゲームの対話文は、多言語対応の説得検出データセットとして実用的であると言えるか?
  • RQ2微調整された多言語BERTモデルは、複数の言語におけるゲーム対話文の説得検出にどの程度効果的か?
  • RQ3部分的にアノテーションが与えられたゲーム対話文は、説得検出のための信頼できる教師信号をどの程度提供するか?
  • RQ4本データセットにおけるモデルの性能は、言語ごとにどのように変動するか?
  • RQ5説得検出を越えて、ビデオゲームがスケーラブルで多言語対応のNLPタスクのデータソースとして持つ潜在的価値は何か?

主な発見

  • 抽出されたデータセットには、ラベル付きの説得的発話が多数含まれており、多言語対応のNLP学習に適している。
  • 微調整された多言語BERTモデルは、複数の言語で競争力のあるF1スコアを達成し、ゼロショットおよびフェイワショットの転移学習の可能性を示した。
  • RPGにおける説得的対話文は、明確な言語的兆候を示しており、追加的な人的アノテーションを最小限に抑えても自動検出に適している。
  • データセットは言語ごとに顕著な言語的多様性を示しており、多言語対応のNLPシステム開発を支援する。
  • ビデオゲーム対話文は、スケーラブルで未活用の高品質で文脈を豊かに含むテキストリソースとして、NLPタスクに適している。
  • Zenodoに公開されたデータセットとコードにより、研究コミュニティによる研究の再現と拡張が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。