[论文解读] ChatGPT vs Human-authored Text: Insights into Controllable Text Summarization and Sentence Style Transfer
本研究评估了ChatGPT在可控文本生成中的表现,重点关注面向专家与普通读者的摘要生成,以及正式与非正式语体之间的句子风格转换。研究发现,尽管ChatGPT在自动指标上优于先前模型,但其输出在风格、语义和事实一致性方面与人类撰写文本存在显著差异,尤其在风格转换过程中存在明显的幻觉现象和语义漂移。
Large-scale language models, like ChatGPT, have garnered significant media attention and stunned the public with their remarkable capacity for generating coherent text from short natural language prompts. In this paper, we aim to conduct a systematic inspection of ChatGPT's performance in two controllable generation tasks, with respect to ChatGPT's ability to adapt its output to different target audiences (expert vs. layman) and writing styles (formal vs. informal). Additionally, we evaluate the faithfulness of the generated text, and compare the model's performance with human-authored texts. Our findings indicate that the stylistic variations produced by humans are considerably larger than those demonstrated by ChatGPT, and the generated texts diverge from human samples in several characteristics, such as the distribution of word types. Moreover, we observe that ChatGPT sometimes incorporates factual errors or hallucinations when adapting the text to suit a specific style.
研究动机与目标
- 系统评估ChatGPT为不同受众(专家与普通读者)及不同写作风格(正式与非正式)生成文本的能力。
- 评估ChatGPT生成文本与人类撰写文本在忠实度和语义准确性方面的差异。
- 识别并量化模型生成文本与人类撰写文本在风格、结构和事实特征方面的差异。
- 调查在可控文本生成任务中,特别是风格转换过程中,幻觉和语义不一致的风险。
- 通过将模型输出与人类基线进行比较,为未来关于大语言模型在可控文本生成中的研究提供基准。
提出的方法
- 使用两个公开数据集:QMSum用于文档级摘要,GYAFC用于句子级风格转换。
- 通过提示工程将ChatGPT的输出条件化为特定受众(专家/普通读者)和风格(正式/非正式),以完成两项任务。
- 采用ROUGE、BERTScore及阅读难度(Flesch-Kincaid)等自动指标评估摘要质量。
- 应用依赖弧蕴含分析(DAE)检测不受支持的依赖弧,以识别潜在的事实不一致。
- 对风格转换输出进行定性案例研究,结合语言学和语义分析与人类参考文本进行对比。
- 使用人工标注的参考文本作为黄金标准,评估语义保留程度和风格准确性。

实验结果
研究问题
- RQ1在可读性和内容忠实度方面,ChatGPT生成的学术文本摘要在面向专家与普通读者时表现如何?
- RQ2ChatGPT在不改变核心语义的前提下,多大程度上成功实现了从正式到非正式及从非正式到正式的句子风格转换?
- RQ3ChatGPT生成文本在风格、句法和词汇特征方面与人类撰写文本有何不同?
- RQ4在风格转换和摘要任务中,ChatGPT输出的事实性幻觉和语义不一致性发生率如何?
- RQ5提供目标写作风格的示例是否能缩小ChatGPT与人类生成文本之间的性能差距?
主要发现
- ChatGPT生成的摘要在风格多样性方面显著低于人类撰写摘要,尤其在词汇多样性和句法复杂性方面。
- 在句子风格转换中,约18%的ChatGPT输出表现出明显的语义不一致,包括错误或被更改的核心内容词。
- 依赖树分析显示,ChatGPT生成的文本中不受支持的依赖弧数量高于人类撰写文本,表明存在事实漂移。
- ChatGPT在风格适配过程中频繁引入事实错误或幻觉,尤其在将非正式语言转换为正式语言时更为明显。
- 尽管模型在自动指标(如ROUGE、BERTScore)上表现良好,但这些指标未能检测到输出中存在的语义不一致和事实错误。
- 提供目标写作风格的示例可缩小ChatGPT与人类输出之间的性能差距,表明风格条件化有助于提升对齐效果。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。