[論文レビュー] Evaluating LLMs on Document-Based QA: Exact Answer Selection and Numerical Extraction using Cogtale dataset
本稿は、CognTaleデータセットを用いて、GPT-4とGPT-3.5のドキュメントベースの質疑応答タスクにおける性能を評価しており、正確な回答選択(単一選択、yes-no、複数選択)およびゼロショット設定下での数値抽出を焦点としている。GPT-4は単一選択およびyes-no質問では優れた性能を示すが、複数選択および数値抽出タスクでは顕著な性能低下を示しており、医療メタアナリシスのような重要な応用分野における正確な情報抽出の限界を浮き彫りにしている。
Document-based Question-Answering (QA) tasks are crucial for precise information retrieval. While some existing work focus on evaluating large language models performance on retrieving and answering questions from documents, assessing the LLMs performance on QA types that require exact answer selection from predefined options and numerical extraction is yet to be fully assessed. In this paper, we specifically focus on this underexplored context and conduct empirical analysis of LLMs (GPT-4 and GPT-3.5) on question types, including single-choice, yes-no, multiple-choice, and number extraction questions from documents in zero-shot setting. We use the CogTale dataset for evaluation, which provide human expert-tagged responses, offering a robust benchmark for precision and factual grounding. We found that LLMs, particularly GPT-4, can precisely answer many single-choice and yes-no questions given relevant context, demonstrating their efficacy in information retrieval tasks. However, their performance diminishes when confronted with multiple-choice and number extraction formats, lowering the overall performance of the model on this task, indicating that these models may not yet be sufficiently reliable for the task. This limits the applications of LLMs on applications demanding precise information extraction from documents, such as meta-analysis tasks. These findings hinge on the assumption that the retrievers furnish pertinent context necessary for accurate responses, emphasizing the need for further research. Our work offers a framework for ongoing dataset evaluation, ensuring that LLM applications for information retrieval and document analysis continue to meet evolving standards.
研究の動機と目的
- 大規模言語モデル(LLM)が、正確な回答選択および数値抽出を要するドキュメントベースの質疑応答タスクでどのように機能するかを評価すること。
- 正確な情報抽出が不可欠な分野、たとえば医療メタアナリシスのような実世界の応用分野におけるLLMの信頼性を評価すること。
- 特に複数選択および数値抽出といった質問形式がLLMの性能に与える影響を調査すること。
- CognTaleデータセットを用いてベンチマークを確立すること。このデータセットは、エキスパートがアノテートした事実に基づいた回答を提供しており、評価に適している。
- 高リスク・高精度が求められるドキュメント分析タスクへの導入を妨げるLLMの能力的ギャップを特定すること。
提案手法
- 本研究では、高齢者を対象とした認知介入試験の公表済み論文から得られた構造的でエキスパートがアノテートした情報を含むCognTaleデータセットを用いる。
- 質問は4つのタイプに分類される:単一選択、yes-no、複数選択、数値抽出。各タイプとも、事前に定義された選択肢の中から正確な回答を選択する必要がある。
- LLM(GPT-4およびGPT-3.5)は、ファインチューニングを行わず、ドキュメントの文脈と質問を直接プロンプトとして与えるゼロショット設定で評価される。
- 性能は、質問タイプごとの正確一致精度を用いて測定され、モデル間および形式別の比較が行われる。
- 検索エンジンが関連する文脈を提供すると仮定し、LLMの性能を回答生成能力に限定し、情報検索の影響を分離する。
- 評価は、CognTaleプラットフォームから選ばれた13件の研究を対象とし、ドキュメントの品質および分野の特異性に一貫性を保つ。

実験結果
リサーチクエスチョン
- RQ1LLMは、事前に定義された選択肢から正確な回答を選択する必要があるドキュメントベースのQAタスクで、どの程度の性能を示すか?
- RQ2GPT-4とGPT-3.5は、単一選択、yes-no、複数選択、数値抽出の各質問形式で、どの程度の性能差を示すか?
- RQ3複数選択および数値抽出といった質問形式は、ゼロショット設定下でLLMにどの程度の挑戦をもたらすか?
- RQ4臨床および研究文書の文脈において、さまざまな種類の事実抽出タスクにおけるLLMの性能は、どのように変動するか?
- RQ5高度なプロンプト戦略は、複数選択や数値抽出といった困難な質問形式におけるLLMの性能を向上させることができるか?
主な発見
- GPT-4は単一選択およびyes-no質問で高い正確性を達成しており、回答選択における文脈理解力と正確性の高さを示している。
- 複数選択質問では性能が著しく低下しており、一見妥当な複数の選択肢の中から正しいものを選ぶことに困難を示している。
- 数値抽出タスクでは最も低い性能を示しており、LLMは文書から数値を特定または正しく抽出するのに頻繁に失敗している。
- GPT-3.5は、GPT-4に比べ全体的な正確性が低く、特に複数選択や数値抽出といった複雑な形式で顕著な劣化を示している。
- GPT-4の性能向上にもかかわらず、そのコスト(26.54ドル)はGPT-3.5-turbo(1.77ドル)の15倍に上り、実用的導入におけるコストパフォーマンスの懸念を提起している。
- 本研究では、正確な事実の根拠が不可欠な分野、たとえばシステマティックレビューおよびメタアナリシスのような高精度が求められる応用分野におけるLLMの信頼性の欠如という重要なギャップを特定した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。