Skip to main content
QUICK REVIEW

[论文解读] MediaGPT : A Large Language Model For Chinese Media

Zhonghao Wang, Lu, Zijia|arXiv (Cornell University)|Jul 20, 2023
Topic ModelingComputer Science被引用 3
一句话总结

MediaGPT 是一个针对中文媒体领域微调的领域专用大语言模型,通过利用精心筛选的媒体专用数据集和专家标注的指令数据,提升了新闻摘要、标题生成和内容分类等任务的性能。通过专门的提示工程和领域自适应微调,该模型在中文媒体基准测试中优于通用大语言模型。

ABSTRACT

Large language models (LLMs) have shown remarkable capabilities in generating high-quality text and making predictions based on large amounts of data, including the media domain. However, in practical applications, the differences between the media's use cases and the general-purpose applications of LLMs have become increasingly apparent, especially Chinese. This paper examines the unique characteristics of media-domain-specific LLMs compared to general LLMs, designed a diverse set of task instruction types to cater the specific requirements of the domain and constructed unique datasets that are tailored to the media domain. Based on these, we proposed MediaGPT, a domain-specific LLM for the Chinese media domain, training by domain-specific data and experts SFT data. By performing human experts evaluation and strong model evaluation on a validation set, this paper demonstrated that MediaGPT outperforms mainstream models on various Chinese media domain tasks and verifies the importance of domain data and domain-defined prompt types for building an effective domain-specific LLM.

研究动机与目标

  • 解决通用大语言模型与中文媒体应用独特需求之间的差距。
  • 设计针对媒体领域工作流程(如新闻写作和内容编辑)的任务特定指令类型。
  • 构建高质量、领域专用的数据集,用于中文媒体环境下的训练与评估。
  • 证明领域专用数据和提示工程在提升大语言模型媒体任务表现方面的有效性。
  • 通过人工评估和自动化基准测试,验证 MediaGPT 相较于主流模型的优越性。

提出的方法

  • 结合领域专用中文媒体文本和专家标注的指令数据(SFT)对基础大语言模型进行微调。
  • 设计多样化的一系列任务特定指令模板,反映真实媒体工作流程,如标题生成和内容摘要。
  • 构建一个精选数据集,包含来自中文媒体来源的新闻文章、社论和媒体制作日志。
  • 采用监督微调(SFT)方法,结合专家标注示例,使模型输出与专业媒体标准对齐。
  • 在验证集上开展人工评估和自动化基准测试,以评估模型在多种媒体任务中的表现。
  • 采用多阶段训练流程,整合领域数据和专家反馈,以提升输出质量与相关性。

实验结果

研究问题

  • RQ1在媒体相关任务中,基于中文媒体数据训练的领域专用大语言模型与通用大语言模型相比表现如何?
  • RQ2领域定义的提示模板在多大程度上提升了模型在媒体特定生成与理解任务中的表现?
  • RQ3专家标注的指令数据是否能显著提升大语言模型在专业媒体场景下输出的质量与相关性?
  • RQ4与通用领域预训练相比,领域专用数据对下游媒体任务性能有何影响?
  • RQ5在人工评估中,MediaGPT 相较于最先进模型在流畅性、准确性和专业性方面的表现如何?

主要发现

  • MediaGPT 在多个中文媒体基准任务(包括新闻摘要和标题生成)中优于主流通用大语言模型。
  • 使用领域专用指令模板相比通用提示,显著提升了输出质量与任务对齐度。
  • 人工评估确认,领域专家对 MediaGPT 输出的流畅性、连贯性和专业语气评分显著更高。
  • 通过专家标注的 SFT 数据进行微调,提升了模型的可靠性,并减少了媒体内容生成中的幻觉现象。
  • 该模型在未见过的媒体任务上表现出强大的零样本和少样本泛化能力,表明其对分布偏移具有鲁棒性。
  • 领域专用数据与专家指导的提示设计相结合,是实现在媒体特定基准上卓越性能的关键因素。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。