Skip to main content
QUICK REVIEW

[论文解读] Flesch or Fumble? Evaluating Readability Standard Alignment of Instruction-Tuned Language Models

Joseph Marvin Imperial, Harish Tayyar Madabushi|arXiv (Cornell University)|Sep 11, 2023
Text Readability and Simplification被引用 5
一句话总结

本文评估了指令微调语言模型在生成或简化叙事时,与可读性标准(如Flesch-Kincaid Grade Level,FKGL)和欧洲共同语言参考框架(CEFR)的对齐程度。通过使用指定目标可读性水平的标准化提示,研究发现,尽管经过高级指令微调,开源模型如BLOOMZ和FlanT5在准确生成符合指定可读性标准的文本方面,优于闭源模型如ChatGPT,揭示了在对齐方面存在显著差异。

ABSTRACT

Readability metrics and standards such as Flesch Kincaid Grade Level (FKGL) and the Common European Framework of Reference for Languages (CEFR) exist to guide teachers and educators to properly assess the complexity of educational materials before administering them for classroom use. In this study, we select a diverse set of open and closed-source instruction-tuned language models and investigate their performances in writing story completions and simplifying narratives--tasks that teachers perform--using standard-guided prompts controlling text readability. Our extensive findings provide empirical proof of how globally recognized models like ChatGPT may be considered less effective and may require more refined prompts for these generative tasks compared to other open-sourced models such as BLOOMZ and FlanT5--which have shown promising results.

研究动机与目标

  • 评估指令微调语言模型是否能够根据Flesch-Kincaid Grade Level(FKGL)和CEFR等既定可读性标准,准确生成或简化文本。
  • 通过标准化提示,评估开源与闭源模型在遵循可读性规范方面的表现。
  • 识别主流模型(如ChatGPT)在输出中反映专家定义的可读性框架方面的差距。
  • 为教育内容生成任务(如故事补全和叙事简化)提供模型能力的实证性、量化证据。

提出的方法

  • 本研究使用了一系列多样化的开源与闭源指令微调大模型,包括Llama 2、ChatGPT、FlanT5、BLOOMZ、Dolly和LongForm。
  • 设计了标准化提示,使用FKGL和CEFR框架指定目标可读性水平,例如“为A2 CEFR学习者简化”或“以四年级水平书写”。
  • 在两个任务上评估模型:故事补全和叙事简化,使用共享的原始叙事语料库作为基准。
  • 通过自动化指标和定性分析,评估生成输出与指定可读性水平的对齐程度。
  • 评估包括可读性分数的定量比较,以及句法复杂度和词汇控制等语言特征的定性评估。
  • 本研究利用公开可用的代码和数据,确保模型评估的可重现性和透明度。
(a) No specifications.
(a) No specifications.

实验结果

研究问题

  • RQ1指令微调大模型在多大程度上能够生成符合FKGL和CEFR定义的指定可读性水平的文本?
  • RQ2开源模型如BLOOMZ和FlanT5在可读性标准对齐方面,与闭源模型如ChatGPT相比表现如何?
  • RQ3即使具备强大的指令遵循能力,模型是否仍会未能内化或反映特定领域的可读性标准?
  • RQ4当提示明确定义目标水平时,模型架构和训练数据在可读性对齐中起到何种作用?

主要发现

  • 尽管ChatGPT具备强大的指令遵循能力,其输出与指定可读性水平的对齐程度仍低于开源模型如BLOOMZ和FlanT5。
  • BLOOMZ和FlanT5在将叙事简化至A2 CEFR水平方面表现出色,生成了更简单的句式结构和受控的词汇。
  • Llama 2和LongForm生成的输出在词汇和句法复杂度上更高,即使明确提示简化,也常超过目标可读性水平。
  • Dolly及其他模型表现出不一致的对齐,有时生成内容过于简单,或偏离原始叙事结构。
  • 研究发现,即使像ChatGPT这样的先进模型,也需要更精细的提示才能实现可接受的可读性对齐,表明其在内化可读性标准方面仍存在差距。
  • 结果表明,仅靠指令微调并不能保证与专家定义的可读性框架对齐,凸显了在教育应用中需要针对性微调或检索增强生成的必要性。
(b) Mentions specific grade level.
(b) Mentions specific grade level.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。