Skip to main content
QUICK REVIEW

[论文解读] A Baseline Analysis for Podcast Abstractive Summarization

Chujie Zheng, Harry Jiannan Wang|arXiv (Cornell University)|Aug 24, 2020
Natural Language Processing Techniques参考文献 11被引用 11
一句话总结

本文使用 TREC 2020 Spotify Podcast Dataset 对播客生成式摘要任务进行了基线分析,评估了启发式基线以及 BART、T5 和 ProphetNet 等最先进模型的性能。研究发现,在 CNN/DM 数据上微调会损害模型在播客数据上的表现,而表现最佳的模型(在播客数据上微调的 DistilBART)仅取得 26.76 的 ROUGE-L F1 分数,表明由于播客特有的挑战(如对话式语言和噪声),仍有巨大改进空间。

ABSTRACT

Podcast summary, an important factor affecting end-users' listening decisions, has often been considered a critical feature in podcast recommendation systems, as well as many downstream applications. Existing abstractive summarization approaches are mainly built on fine-tuned models on professionally edited texts such as CNN and DailyMail news. Different from news, podcasts are often longer, more colloquial and conversational, and noisier with contents on commercials and sponsorship, which makes automatic podcast summarization extremely challenging. This paper presents a baseline analysis of podcast summarization using the Spotify Podcast Dataset provided by TREC 2020. It aims to help researchers understand current state-of-the-art pre-trained models and hence build a foundation for creating better models.

研究动机与目标

  • 使用 TREC 2020 Spotify Podcast Dataset 建立播客生成式摘要的基线。
  • 评估启发式基线和最先进预训练模型在播客转录文本上的性能。
  • 识别播客摘要任务中特有的挑战,如对话式语调、内容长度和赞助内容。
  • 突出新闻摘要与播客摘要任务之间的性能差距,尤其是在 ROUGE 分数方面。
  • 通过识别关键研究方向,为未来研究提供指导,包括长叙事结构建模、对话摘要、多模态分析以及长文档 Transformer 模型。

提出的方法

  • 本研究使用 TREC 2020 Spotify Podcast Dataset,该数据集包含 105,360 个播客节目,附带转录文本、摘要和元数据。
  • 通过多轮过滤步骤,构建了一个包含 24,250 个节目的清洗后数据集:去除包含大量表情符号、时长过长(>60 分钟)、包含粗俗语言、非英文以及广告主导描述的节目。
  • 提出两种启发式基线:从转录文本中选取前 k 个词元(基线 1)或后 k 个词元(基线 2)作为摘要,k 的取值范围为 100 至 500。
  • 对最先进模型——DistilBART、T5 和 ProphetNet 进行微调,并使用 ROUGE 分数(F1、精确率、召回率)进行评估。
  • 还将模型在 CNN/DM 数据上进行微调,并在播客数据集上进行评估,以比较零样本与领域内微调的性能差异。
  • 所有模型的输入均使用转录文本的前 1024 个词元(ProphetNet 为 512 个词元),基于基线分析显示节目开头部分包含更多相关信息。

实验结果

研究问题

  • RQ1与最先进模型相比,简单的启发式基线(选择转录文本开头或结尾)在播客摘要任务中的表现如何?
  • RQ2最先进生成式摘要模型在新闻数据(CNN/DM)与播客数据上的性能差距有多大?
  • RQ3在 CNN/DM 数据上微调预训练模型后,其在播客摘要任务中的性能是否会下降?
  • RQ4播客的独特特征(如对话式语调、内容长度和赞助内容)如何影响摘要性能?
  • RQ5在当前限制下,提升播客摘要性能的最有前景的未来研究方向是什么?

主要发现

  • 表现最佳的基线为选取前 100 个词元(基线 1),其 ROUGE-L F1 得分为 18.44,优于基于结尾的基线(15.43),表明开头内容包含更多关键信息。
  • 在播客数据上微调的 DistilBART 取得最高的 ROUGE-L F1 得分为 22.71,显著低于其在 CNN/DM 上的表现(41.30),凸显播客摘要任务的挑战性。
  • 在 CNN/DM 数据上微调 ProphetNet 后再应用于播客,性能出现下降(ROUGE-L F1:19.12 vs. 44.20 在 CNN/DM 上),表明存在领域偏移问题。
  • 新闻摘要与播客摘要之间的性能差距显著:ROUGE-L F1 从 CNN/DM 的 41.30 下降至播客的 22.71,表明由于对话式和噪声内容,播客摘要更具挑战性。
  • 在播客数据上微调的模型(DistilBART)取得最高的 ROUGE-1 F1 得分为 26.76,是所有测试模型中的最高分,但仍远低于新闻数据集上的最先进水平。
  • 本研究识别出四个关键未来研究方向:建模长篇叙事结构、改进对话摘要、利用多模态音频特征,以及扩展长上下文注意力机制以处理完整转录文本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。