Skip to main content
QUICK REVIEW

[论文解读] GOAL: Towards Benchmarking Few-Shot Sports Game Summarization

Jiaan Wang, Tingyi Zhang|arXiv (Cornell University)|Jul 18, 2022
Video Analysis and Summarization被引用 4
一句话总结

本文提出了GOAL,这是首个用于少样本体育赛事摘要的英文数据集,包含103对解说-新闻配对以及2,160条未标注的解说文本。尽管像LED这样的先进生成式基线模型在测试集上取得了24.3的ROUGE-L分数,但结果仍显示出由于数据量有限以及解说与新闻在风格上的显著差异,导致持续存在的挑战,凸显了对体育特定语言建模和知识融合的迫切需求。

ABSTRACT

Sports game summarization aims to generate sports news based on real-time commentaries. The task has attracted wide research attention but is still under-explored probably due to the lack of corresponding English datasets. Therefore, in this paper, we release GOAL, the first English sports game summarization dataset. Specifically, there are 103 commentary-news pairs in GOAL, where the average lengths of commentaries and news are 2724.9 and 476.3 words, respectively. Moreover, to support the research in the semi-supervised setting, GOAL additionally provides 2,160 unlabeled commentary documents. Based on our GOAL, we build and evaluate several baselines, including extractive and abstractive baselines. The experimental results show the challenges of this task still remain. We hope our work could promote the research of sports game summarization. The dataset has been released at https://github.com/krystalan/goal.

研究动机与目标

  • 为解决体育赛事摘要领域缺乏英文数据集的问题,该问题限制了该领域的全球研究进展。
  • 通过真实实时的英文解说和对应新闻文章,构建一个用于少样本体育赛事摘要的基准数据集。
  • 通过提供额外的2,160条未标注解说文档,支持半监督学习。
  • 通过抽取式和生成式基线模型评估任务难度,揭示在风格迁移和事实一致性方面持续存在的挑战。
  • 推动未来在多语言、知识增强以及基于图的建模方面在体育摘要领域的研究。

提出的方法

  • 作者从2016至2020年期间从Goal.com收集了2,263条足球赛事解说,其中103条与官方体育新闻配对。
  • 数据集按63/20/20的比例划分为训练集、验证集和测试集,并额外提供了2,160条未标注的解说文本用于半监督学习。
  • 采用ROUGE-1/2/L作为自动指标,评估了抽取式基线模型(Longest、TextRank、PacSum)和生成式模型(PGN、LED)的性能。
  • LED模型使用3e-5的初始学习率、批量大小为4,并训练10个周期,输入序列截断为4096 token,输出序列截断为1024 token。
  • 为分析模型行为,检查了生成新闻中关键动词的使用情况,以评估其对体育特定事件的理解能力。
  • 推理阶段采用Hugging Face的LED-base-16384模型,结合稀疏注意力机制与束搜索解码策略。

实验结果

研究问题

  • RQ1在低资源、少样本的英文体育赛事摘要基准上,抽取式与生成式模型的性能表现如何比较?
  • RQ2当前模型在生成体育新闻时,能在多大程度上捕捉关键事件并保持事实一致性?
  • RQ3在仅有限英文数据上进行训练的模型,能否有效学习从口语化解说到正式新闻的风格与语义转变?
  • RQ4利用2,160条未标注解说文本进行半监督学习,在多大程度上能提升摘要性能?
  • RQ5外部知识在缓解幻觉现象并提升对复杂体育事件理解方面发挥着何种作用?

主要发现

  • LED生成式模型在测试集上取得了24.3的最高ROUGE-L分数,优于抽取式方法和PGN模型,表明在该任务中生成式方法具有优势。
  • 如Longest和TextRank等抽取式基线模型的ROUGE-L分数均低于20,表明由于解说与新闻在风格上的显著差异,性能表现较差。
  • PGN模型在测试集上取得了21.4的ROUGE-L分数,表明其性能优于抽取式方法,但仍受限于长上下文处理效率低下。
  • 人工分析显示,LED模型频繁重复短语,并且难以捕捉复杂或不常见的事件(如“blocking”),表明其对罕见体育动作的泛化能力较差。
  • 模型能正确预测简单动词如“beat”,但对细微或复杂的动作理解能力有限,表明其对体育特定语言的理解能力不足。
  • 本研究证实,仅使用103个标注样本的少样本设置严重限制了模型的学习能力,凸显了引入外部知识或多任务学习的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。