[論文レビュー] Creating Large Language Model Resistant Exams: Guidelines and Strategies
本論文は、現実世界の状況、意図的な不正確さ、非テキストコンテンツ、およびソフトスキルの評価を活用することで、大規模言語モデル(LLM)に抵抗性を持つ試験を設計する実用的なガイドラインを提案する。戦略的な設計により、試験はLLMによる不正を防ぎつつ、学術的整合性と現代の職業的文脈への関連性を維持できることを示している。
The proliferation of Large Language Models (LLMs), such as ChatGPT, has raised concerns about their potential impact on academic integrity, prompting the need for LLM-resistant exam designs. This article investigates the performance of LLMs on exams and their implications for assessment, focusing on ChatGPT's abilities and limitations. We propose guidelines for creating LLM-resistant exams, including content moderation, deliberate inaccuracies, real-world scenarios beyond the model's knowledge base, effective distractor options, evaluating soft skills, and incorporating non-textual information. The article also highlights the significance of adapting assessments to modern tools and promoting essential skills development in students. By adopting these strategies, educators can maintain academic integrity while ensuring that assessments accurately reflect contemporary professional settings and address the challenges and opportunities posed by artificial intelligence in education.
研究の動機と目的
- 大規模言語モデル(LLM)であるChatGPTの使用が学生の評価に与える影響により深刻化する学術的整合性の懸念に対処すること。
- 特にChatGPTに焦点を当て、LLMが試験問題にどのように応答できるか、およびその限界を調査すること。
- 教育者にとって実行可能で、証拠に基づいたガイドラインを策定し、LLM生成の回答に対して耐性を持つ試験を設計すること。
- 試験が現実世界の職業的能力を反映し、学生の必須スキルの習得を促進すること。
- 教育評価の実践を、教育分野におけるAIツールの進化に合わせて適応させること。
提案手法
- LLMのトレーニングデータを超える現実世界の状況を統合することで、LLMが信ぴょうな誤答を生成する能力を低下させる。
- 試験問題に意図的な不正確さを導入し、学生が誤情報の検出と是正ができるかをテストする。これは、LLMがしばしば誤った情報を認識できないことと関連している。
- 図表や図解、画像などの非テキスト情報を利用することで、LLMが視覚的データを正確に解釈できないことから、自動不正の難易度を高める。
- 批判的思考、倫理的判断、文脈的判断といった、LLMが性能を発揮しにくい評価的スキルの評価を促す問題を設計する。
- 複数選択問題において、効果的な誤り選択肢(ダミー選択肢)を導入することで、LLMの推論を困難にし、偶然に正解を選ぶ可能性を減らす。
- 記憶よりも応用を重視するように試験を構成し、個人の自己認識や状況適応を要するタスクを優遇する。
実験結果
リサーチクエスチョン
- RQ1ChatGPTのような大規模言語モデルは、従来の試験形式でどの程度の成績を示し、どこに脆弱性を示すのか?
- RQ2試験にどのような具体的な設計的特徴を組み込むことで、LLM生成による不正の成功確率を低下させられるか?
- RQ3どのような方法で試験を再構築すれば、LLMが模倣できない人間のスキルを重視できるか?
- RQ4教育者が現実世界の文脈に特化した状況をどのように統合することで、LLMの効果を制限できるか?
- RQ5非テキスト的要素と意図的な不正確さは、LLMに対する試験の耐性をどのように高めるか?
主な発見
- ChatGPTのようなLLMは、内容が曖昧であったり、現実世界の文脈が欠落していると、信ぴょうな誤答を生成する傾向がある。
- 問題に意図的な不正確さを組み込むことで、LLMが誤った情報を検出・是正できないことの顕著な例が得られ、正答率が著しく低下する。
- 図表や図解などの非テキストコンテンツを含む試験は、LLMが視覚的データを信頼性を持って解釈できないことから、LLMベースの不正リスクを顕著に低減する。
- 倫理的判断や批判的思考といったソフトスキルを重視する試験は、LLM生成の回答に対して低い感受性を示す。これは、人間レベルの推論を要するためである。
- 状況適応を要する現実世界のシナリオベースの問題は、LLMがトレーニングデータに依存しているため、正しく回答される可能性が低くなる。
- 提示されたガイドラインは、記憶に焦点を当てるのではなく、応用、判断、文脈的理解に焦点を当てるように試験の焦点をシフトさせることで、試験の整合性を総合的に高める。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。