Skip to main content
QUICK REVIEW

[論文レビュー] Distractor generation for multiple-choice questions with predictive prompting and large language models

Semere Kiros Bitew, Johannes Deleu|arXiv (Cornell University)|Jul 30, 2023
Topic Modeling被引用数 4
ひとこと要約

本稿では、大規模言語モデル(LLMs)を用いたリtrieval増強プロンプト戦略を用いて、複数選択式問題(MCQ)の誤り選択肢(distractor)生成を向上させるDynamic-Demo-ChatGPTという手法を提案する。質問バンクから動的に関連する質問項目をインライン例として取得することで、生成された誤り選択肢の質と信頼性が著しく向上し、53%の高品質な誤り選択肢を達成し、無意味な出力を16%まで低減した—ゼロショットおよびフェイショットのLLMベースラインを上回った。

ABSTRACT

Large Language Models (LLMs) such as ChatGPT have demonstrated remarkable performance across various tasks and have garnered significant attention from both researchers and practitioners. However, in an educational context, we still observe a performance gap in generating distractors -- i.e., plausible yet incorrect answers -- with LLMs for multiple-choice questions (MCQs). In this study, we propose a strategy for guiding LLMs such as ChatGPT, in generating relevant distractors by prompting them with question items automatically retrieved from a question bank as well-chosen in-context examples. We evaluate our LLM-based solutions using a quantitative assessment on an existing test set, as well as through quality annotations by human experts, i.e., teachers. We found that on average 53% of the generated distractors presented to the teachers were rated as high-quality, i.e., suitable for immediate use as is, outperforming the state-of-the-art model. We also show the gains of our approach 1 in generating high-quality distractors by comparing it with a zero-shot ChatGPT and a few-shot ChatGPT prompted with static examples.

研究の動機と目的

  • 教育的文脈における複数選択式問題(MCQ)の高品質で説得力のある誤り選択肢を生成する課題に対処すること。誤り選択肢は評価の妥当性において極めて重要である。
  • チャットGPTのような大規模言語モデル(LLMs)が、従来の順位付けベースのモデルに比べて、無意味または不適切な誤り選択肢を低減する点で優れているかどうかを調査すること。
  • 動的に取得されたインライン例と静的例を比較することで、LLMの誤り選択肢生成の質と信頼性に与える影響を評価すること。
  • 現実の教育的応用を想定し、誤り選択肢の質と信頼性を向上させるために、ローカル順位付けモデルとLLMsを組み合わせたハイブリッド手法を開発すること。

提案手法

  • 本手法は二段階パイプラインを採用する。まず、ターゲット質問と類似する質問項目を質問バンクから検索するローカルリトリーブモデルが、意味的類似度に基づいて順位付けを行う。
  • 次に、上位k件の検索結果をインライン例として使用し、予測プロンプト戦略を介して大規模言語モデル(ChatGPT)に供給することで、誤り選択肢を生成する。
  • プロンプト戦略は、関連性に基づいて動的に文脈例を選択し、ターゲット質問に対して意味的に適切な例をLLMに提供する。
  • 本手法は、例なしのゼロショットプロンプト、静的例を用いたフェイショットプロンプト、および先行する最先端の順位付けモデル(DQ-SIM)と比較される。
  • 人間の専門家(教師)が生成された誤り選択肢を、質(高品質対低品質)および関連性(無意味対説得力のある)の観点から評価し、GDR@10(良質誤り選択肢率)およびNDR@10(無意味誤り選択肢率)といった指標を用いる。
  • 統計的有意性は、1000回のブートストラップリサンプリングを用いて、異なる設定間でのモデル性能を比較することで評価される。

実験結果

リサーチクエスチョン

  • RQ1RQ1: 順位付けベースのモデルと比較して、チャットGPTは教育的MCQの高品質な誤り選択肢を生成できるか?
  • RQ2RQ2: チャットGPTが生成する誤り選択肢にどれほど信頼できるか。その信頼性はどのように測定できるか?
  • RQ3RQ3: 順位付けベースのモデルとLLMsを組み合わせることで、誤り選択肢生成の能力を向上させることは可能か?

主な発見

  • Dynamic-Demo-ChatGPTモデルは、GDR@10が46.7%を達成し、DQ-SIMモデル(44.6%)およびゼロショットChatGPTベースラインを顕著に上回った。
  • Dynamic-Demo-ChatGPTモデルは、NDR@10を15.5%まで低下させ、DQ-SIMモデルが報告した50.1%のNDR@10と比較して顕著な改善を示した。
  • 平均して、Dynamic-Demo-ChatGPTが生成した誤り選択肢の53%が専門家教師によって高品質と評価され、即時の評価用途に適していることが示された。
  • 動的に取得されたインライン例の使用は、静的例ベースラインと比較して、高品質誤り選択肢生成において統計的に有意な改善(p < 0.01)をもたらした。
  • 本モデルは16%の無意味な誤り選択肢率を示し、これは先行する最先端モデルと比較して顕著な改善であり、教師のシステム信頼性を高めた。
  • ローカル順位付けモデルとLLMsを組み合わせたハイブリッド手法(Dynamic-Demo-ChatGPT)は、ゼロショットおよびフェイショットプロンプト戦略を顕著に上回り、このハイブリッド手法の有効性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。