[論文レビュー] What does ChatGPT know about natural science and engineering?
本研究では、デルフト理工大学の教員が収集した594件の質問からなるデータセットを用いて、ChatGPTの自然科学および工学分野の質問に対するパフォーマンスを実証的に評価した。結果として、ChatGPTの回答は平均して「ほとんど正しい」と評価されたが、教育水準が上昇するにつれて性能が著しく低下し、事実知識を超えた批判的思考などのスキルを評価する際も同様に低下した。
ChatGPT is a powerful language model from OpenAI that is arguably able to comprehend and generate text. ChatGPT is expected to have a large impact on society, research, and education. An essential step to understand ChatGPT's expected impact is to study its domain-specific answering capabilities. Here, we perform a systematic empirical assessment of its abilities to answer questions across the natural science and engineering domains. We collected 594 questions from 198 faculty members across 5 faculties at Delft University of Technology. After collecting the answers from ChatGPT, the participants assessed the quality of the answers using a systematic scheme. Our results show that the answers from ChatGPT are on average perceived as ``mostly correct''. Two major trends are that the rating of the ChatGPT answers significantly decreases (i) as the complexity level of the question increases and (ii) as we evaluate skills beyond scientific knowledge, e.g., critical attitude.
研究の動機と目的
- 自然科学および工学分野におけるChatGPTの事実的正確性と推論品質を評価すること。
- 質問の教育水準がChatGPTの回答の正しさの認識に与える影響を調査すること。
- ChatGPTが、記憶に依存する知識を超えて、批判的思考や科学的判断といったスキルを効果的に示せるかどうかを評価すること。
- STEM教育および研究文脈におけるLLMの能力を、体系的かつ教員が検証済みのベンチマークとして提供すること。
提案手法
- デルフト理工大学の5つのファカルティに所属する198名の教員から、分野特化型の質問を594件収集した。
- ChatGPT(GPT-3.5-turbo)に質問を提示し、その回答を収集して分析した。
- 教員が各回答の質を標準化されたスケールで評価する構造化された評価方式を採用した。
- 事実の正確性、一貫性、批判的思考の示し方といった次元で評価を分析した。
- 質問の難易度および必要な認知的スキルに基づくパフォーマンスの傾向を評価するため、統計的手法を用いた。
- 分野の専門家によるピアレビューと反復フィードバックを通じて、結果の妥当性を検証した。
実験結果
リサーチクエスチョン
- RQ1ChatGPTの回答の正確性は、学術的複雑さの異なる自然科学および工学分野の質問に対して、どのように変化するか?
- RQ2質問の教育水準が上昇するにつれて、ChatGPTの回答の質の認識が低下するか?
- RQ3ChatGPTは、事実の暗記を超えて、批判的思考や科学的推論といったスキルをどの程度示せるか?
- RQ4教員専門家は、STEM文脈においてChatGPTの回答の全体的な信頼性と有用性をどの程度評価するか?
- RQ5自然科学および工学分野の中で、ChatGPTが著しく優れているか、あるいは劣っている特定の分野は存在するか?
主な発見
- 教員評価者によると、ChatGPTの回答は平均して「ほとんど正しい」と評価された。
- 質問の教育水準が上昇するにつれて、回答の質が著しく低下したが、特に高度な学術的水準で顕著だった。
- 批判的思考、科学的判断、概念的推論といったスキルを評価する際、パフォーマンスが著しく低下した。
- ChatGPTは入門レベルの質問では事実の記憶が強く示されたが、洗練された高次思考タスクでは苦戦した。
- たとえ答えが事実的に正しい場合でも、工学分野や高度な物理学の質問では信頼性が一貫しないことが明らかになった。
- 教員評価者からは、誤った回答に対して過剰な自信を示し、知識の境界を認識していない点が懸念された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。