Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating ChatGPT as a Question Answering System: A Comprehensive Analysis and Comparison with Existing Models

Hossein Bahak, Farzaneh Taheri|arXiv (Cornell University)|Dec 11, 2023
Topic Modeling被引用数 7
ひとこと要約

本稿では、英語およびペルシャ語のデータセット(SQuAD、NewsQA、PersianQuAD)を用いて、ChatGPTを質問応答システム(QAS)として評価する。ChatGPTは単純な事実に関する質問では良好な性能を示すが、特に「どうして」や「どうやって」に関する複雑な質問では、タスク固有のモデルに比べて性能が劣り、文脈に答えがない場合に顕著な幻覚を示す。ただし、プロンプト工学と文脈の提供により性能は向上する。

ABSTRACT

In the current era, a multitude of language models has emerged to cater to user inquiries. Notably, the GPT-3.5 Turbo language model has gained substantial attention as the underlying technology for ChatGPT. Leveraging extensive parameters, this model adeptly responds to a wide range of questions. However, due to its reliance on internal knowledge, the accuracy of responses may not be absolute. This article scrutinizes ChatGPT as a Question Answering System (QAS), comparing its performance to other existing QASs. The primary focus is on evaluating ChatGPT's proficiency in extracting responses from provided paragraphs, a core QAS capability. Additionally, performance comparisons are made in scenarios without a surrounding passage. Multiple experiments, exploring response hallucination and considering question complexity, were conducted on ChatGPT. Evaluation employed well-known Question Answering (QA) datasets, including SQuAD, NewsQA, and PersianQuAD, across English and Persian languages. Metrics such as F-score, exact match, and accuracy were employed in the assessment. The study reveals that, while ChatGPT demonstrates competence as a generative model, it is less effective in question answering compared to task-specific models. Providing context improves its performance, and prompt engineering enhances precision, particularly for questions lacking explicit answers in provided paragraphs. ChatGPT excels at simpler factual questions compared to "how" and "why" question types. The evaluation highlights occurrences of hallucinations, where ChatGPT provides responses to questions without available answers in the provided context.

研究の動機と目的

  • 提供された文脈パラグラフから答えを抽出するという観点から、ChatGPTの質問応答システム(QAS)としての有効性を評価すること。
  • 事実に基づく質問と非事実に基づく質問の両方のタイプにおいて、タスク固有の質問応答モデルと比較してChatGPTの性能を評価すること。
  • 文脈、プロンプト工学、質問の複雑さが回答の正確性と幻覚発生率に与える影響を調査すること。
  • 提供された文脈に答えが存在しない場合のChatGPTにおける幻覚の頻度を評価すること。
  • 標準的なQAメトリクスを用いて、英語(SQuAD、NewsQA)およびペルシャ語(PersianQuAD)の多言語データセットにおける性能を分析すること。

提案手法

  • 標準的な質問応答(QA)データセット(SQuAD 1.1、SQuAD 2.0、NewsQA、PersianQuAD)を用いてChatGPTを評価した。
  • 回答の正確性とスパンの精度を測定するために、標準的な評価メトリクス(F1スコア、エクサクトマッチ(EM)、再現率)を適用した。
  • 文脈パラグラフの有無に応じた2つの設定で実験を行い、文脈依存性を評価した。
  • 質問と答えの間のジャカード類似度を用いて質問の難易度を定量化し、類似度レベルごとのパフォーマンスを分析した。
  • 特に文脈に明示的な答えが存在しない質問の精度を向上させるために、2段階のプロンプト工学を実装した。
  • 事実型(事実に基づく)および非事実型(推論に基づく)質問の種別に応じた回答パターンを分析した。
Figure 1: The architecture of the evaluation framework
Figure 1: The architecture of the evaluation framework

実験結果

リサーチクエスチョン

  • RQ1文脈が提供された場合、ChatGPTの質問応答性能はタスク固有のモデルと比べてどの程度か?
  • RQ2文脈パラグラフを提供することで、ChatGPTの回答の正確性はどの程度向上し、幻覚はどの程度減少するか?
  • RQ3質問と答えの間のジャカード類似度で測定される質問の複雑さが、異なるデータセットにおけるChatGPTのF1スコアにどのように影響するか?
  • RQ4提供された文脈に答えが存在しない場合のChatGPTにおける幻覚発生率はどの程度か?
  • RQ5単純な事実に関する質問と、複雑な「どうして」や「どうやって」に関する質問の間で、性能にどのような差が生じるか?

主な発見

  • SQuAD 1.1において、ジャカード類似度が0.5の質問では、ChatGPTのピークF1スコアは0.83に達し、中程度の複雑さでの最適なパフォーマンスを示した。
  • SQuAD 2.0では、ジャカード類似度が0.3の際に最大F1スコア0.78を記録し、類似度が低い、より複雑な質問に対して強い性能を示した。
  • PersianQuADデータセットでは、ジャカード類似度が0.09の質問でピークF1スコア0.78を達成し、類似度が低い、複雑なクエリに対しても対応可能であることが示された。
  • NewsQAでは、難易度が上昇するにつれてF1スコアに周期的な変動が見られ、難易度とパフォーマンスの間には単調な関係がないことが示された。
  • 単純な事実に関する質問では、「どうして」や「どうやって」に関する質問よりも高い正確性を示したが、後者はより深い推論と推論が必要である。
  • 文脈に答えがない場合に幻覚が頻繁に観察され、モデルは説得力はあるが誤った回答を生成した。
Figure 2: Histogram of computed evaluation metrics across various question types within the SQuAD 1.1 dataset
Figure 2: Histogram of computed evaluation metrics across various question types within the SQuAD 1.1 dataset

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。