Skip to main content
QUICK REVIEW

[论文解读] Training Optimus Prime, M.D.: Generating Medical Certification Items by Fine-Tuning OpenAI's gpt2 Transformer Model

Matthias von Davier|arXiv (Cornell University)|Aug 22, 2019
Topic Modeling被引用 10
一句话总结

本文提出在PubMed的开放获取医学文本上微调OpenAI的GPT-2变换器模型,以生成高质量的医学认证考试题目。该方法能够生成连贯、可直接作为草稿的病例描述案例,并生成有效的多选题干扰项,表明基于变换器的语言模型可在极少人工干预的情况下显著支持医学教育中的自动化题目生成。

ABSTRACT

This article describes new results of an application using transformer-based language models to automated item generation (AIG), an area of ongoing interest in the domain of certification testing as well as in educational measurement and psychological testing. OpenAI's gpt2 pre-trained 345M parameter language model was retrained using the public domain text mining set of PubMed articles and subsequently used to generate item stems (case vignettes) as well as distractor proposals for multiple-choice items. This case study shows promise and produces draft text that can be used by human item writers as input for authoring. Future experiments with more recent transformer models (such as Grover, TransformerXL) using existing item pools are expected to improve results further and to facilitate the development of assessment materials.

研究动机与目标

  • 探究基于变换器的语言模型是否能够生成适合认证考试的医学相关且连贯的试题。
  • 评估微调后的GPT-2模型生成文本的质量,与先前基于RNN的方法进行比较。
  • 探讨使用提示生成法创建多选题干扰项的可行性。
  • 评估预训练语言模型作为辅助工具在支持人类试题编写者进行医学评估开发方面的潜力。
  • 证明在特定医学语料上进行微调可提升生成的医学教育内容的相关性和结构质量。

提出的方法

  • 使用PubMed的开放获取医学文本语料作为训练数据,对OpenAI的GPT-2语言模型进行微调。
  • 利用TensorFlow-GPU工具包在多GPU工作站上重新训练模型,以实现医学语言生成。
  • 采用基于提示的生成方法,生成结构化的病例描述案例和多选题的干扰选项。
  • 通过定性评估和与人工编写的试题对比,评估生成文本的质量。
  • 利用变换器架构的注意力机制,建模临床叙述中的长距离依赖关系。
  • 通过迁移学习原理,将通用语言模型适配到医学认证测试的专门领域。

实验结果

研究问题

  • RQ1微调后的GPT-2模型能否生成适合认证考试的医学上连贯且结构合理的病例描述案例?
  • RQ2与先前基于RNN的方法相比,变换器模型在医学试题生成中的文本质量如何?
  • RQ3基于提示的生成方法在多大程度上能生成有效的多选题干扰项?
  • RQ4在医学文本上进行领域特定的微调能否提升生成评估题目的相关性和语法正确性?
  • RQ5此类模型在支持人类试题编写者开发高风险医学认证考试方面具有何种潜力?

主要发现

  • 与早期在开放获取试题上训练的基于字符的RNN模型相比,微调后的GPT-2模型生成了质量更高、更连贯的医学文本。
  • 基于提示的文本生成成功生成了适用于认证考试多选题的合理干扰项。
  • 生成的病例描述通常语法正确且临床合理,类似于医学评估中常用的现实患者情景。
  • 该模型表现出可作为人类试题编写者草稿的文本生成能力,从而减少手动编写的工作量。
  • 在PubMed等医学语料上进行微调显著提升了生成内容的领域相关性和结构质量。
  • 结果表明,当经过适当微调后,基于变换器的语言模型可成为医学教育中自动化试题生成的实用工具。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。