Skip to main content
QUICK REVIEW

[論文レビュー] Large Language Models are Pretty Good Zero-Shot Video Game Bug Detectors

Mohammad Reza Taesiri, Finlay Macklon|arXiv (Cornell University)|Oct 5, 2022
Artificial Intelligence in Games被引用数 4
ひとこと要約

本論文では、バグ検出を質問・回答タスクとして定式化することで、微調整なしに大規模言語モデル(LLMs)をゼロショットのビデオゲームバグ検出器として使用することを提案している。8つのゲームにまたがる334組の質問・回答ペアを含む新規の GameBugDescriptions ベンチマークを用いて、最大78.94%の精度を達成した。これは、LLMsが微調整なしにゲームの文脈と一般的な推論能力を活用してバグを効果的に検出できることを示している。

ABSTRACT

Video game testing requires game-specific knowledge as well as common sense reasoning about the events in the game. While AI-driven agents can satisfy the first requirement, it is not yet possible to meet the second requirement automatically. Therefore, video game testing often still relies on manual testing, and human testers are required to play the game thoroughly to detect bugs. As a result, it is challenging to fully automate game testing. In this study, we explore the possibility of leveraging the zero-shot capabilities of large language models for video game bug detection. By formulating the bug detection problem as a question-answering task, we show that large language models can identify which event is buggy in a sequence of textual descriptions of events from a game. To this end, we introduce the GameBugDescriptions benchmark dataset, which consists of 167 buggy gameplay videos and a total of 334 question-answer pairs across 8 games. We extensively evaluate the performance of six models across the OPT and InstructGPT large language model families on our benchmark dataset. Our results show promising results for employing language models to detect video game bugs. With the proper prompting technique, we could achieve an accuracy of 70.66%, and on some video games, up to 78.94%. Our code, evaluation data and the benchmark can be found on https://asgaardlab.github.io/LLMxBugs

研究の動機と目的

  • 大規模言語モデル(LLMs)が、タスク固有の微調整なしにゼロショット設定でビデオゲームバグを検出できるかどうかを調査すること。
  • ゲーム固有の知識と一般的な推論能力を要する自動ゲームテストの課題に対処すること。
  • ビデオゲームデバッグにおけるLLMsの分布外評価のためのベンチマークデータセットを構築すること。
  • 同じゲームイベントのテキスト記述を変化させた場合のLLMsの頑健性を評価すること。
  • ゲームバグ検出におけるLLMsのパフォーマンスを最大化するプロンプト戦略を同定すること。

提案手法

  • 自然言語プロンプトを用いて、ビデオゲームバグ検出を質問・回答タスクとして定式化する。
  • 8つのゲームにまたがる167本のバグありプレイ動画と334組の質問・回答ペアを含む GameBugDescriptions ベンチマークを構築する。
  • OPTおよびInstructGPTファミリーに属するLLMsを用いてゼロショットプロンプティングを行い、イベントのシーケンスの中でどのイベントがバグを含むかを分類する。
  • 推論と精度を向上させるために「Let’s think step by step」というプロンプト技術を適用する。
  • モデルのパフォーマンスを、バグ検出およびバグタイプ分類の両タスクで評価する。
  • 同じイベントシーケンスの異なるテキスト記述を用いて、モデルの頑健性を分析する。

実験結果

リサーチクエスチョン

  • RQ1大規模言語モデル(LLMs)は、タスク固有の微調整なしにゼロショット設定でビデオゲームバグを検出できるか?
  • RQ2LLMsのパフォーマンスは、異なるビデオゲームやバグタイプによってどのように変化するか?
  • RQ3'Let’s think step by step' などのプロンプト戦略は、ゲームバグ検出におけるLLMsの推論力と精度をどのように向上させるか?
  • RQ4同じゲームイベントシーケンスのテキスト記述の変化に対して、LLMsの頑健性はどの程度か?
  • RQ5現在のLLMsのこのタスクにおける限界は何か、特にOPT-175Bのような大規模モデルにおいては?

主な発見

  • 最もパフォーマンスの優れたモデルは、GameBugDescriptions ベンチマークでゼロショット精度70.66%を達成した。
  • 『グランド・セティン・オートリィ』のような特定のゲームでは、最大78.94%の精度に達し、特定の文脈では優れた性能を示した。
  • 'Let’s think step by step' プロンプト技術は、複数のモデルで推論力と精度を顕著に向上させた。
  • OPT-175Bモデルはその大規模さにもかかわらず、性能が低く、中間の推論が正しくても回答抽出に問題があったことを示した。
  • 視覚ベースの動画キャプション生成モデル(CLIP-Cap や OFA)は、ゲームイベントの正確な記述を生成できず、ゲームエンジン統合型または専用の記述パイプラインの必要性を浮き彫りにした。
  • 本研究では、LLMsが分布外のゲームシナリオに一般化できることを明らかにした。これにより、GameBugDescriptions データセットは今後のLLM評価のための貴重なOODベンチマークであると判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。