[论文解读] GameWikiSum: a Novel Large Multi-Document Summarization Dataset
本文提出了 GameWikiSum,一个大规模、领域特定的多文档摘要数据集,包含来自专业电子游戏评论和相应维基百科游戏玩法部分的 14,652 个样本。该数据集可用于训练抽取式和生成式摘要模型,基于嵌入的模型(如 C_SKIP 和 SemSentSum)在该数据集上实现了最先进性能,证明了其在推动超越新闻导向语料的多文档摘要研究方面的实用性。
Today's research progress in the field of multi-document summarization is obstructed by the small number of available datasets. Since the acquisition of reference summaries is costly, existing datasets contain only hundreds of samples at most, resulting in heavy reliance on hand-crafted features or necessitating additional, manually annotated data. The lack of large corpora therefore hinders the development of sophisticated models. Additionally, most publicly available multi-document summarization corpora are in the news domain, and no analogous dataset exists in the video game domain. In this paper, we propose GameWikiSum, a new domain-specific dataset for multi-document summarization, which is one hundred times larger than commonly used datasets, and in another domain than news. Input documents consist of long professional video game reviews as well as references of their gameplay sections in Wikipedia pages. We analyze the proposed dataset and show that both abstractive and extractive models can be trained on it. We release GameWikiSum for further research: https://github.com/Diego999/GameWikiSum.
研究动机与目标
- 通过创建一个领域特定的语料库,解决大规模非新闻多文档摘要数据集稀缺的问题。
- 利用高质量的专业电子游戏评论和维基百科游戏玩法部分,支持复杂抽取式和生成式摘要模型的训练。
- 通过利用结构化、高质量的原始资料,克服现有数据集依赖噪声搜索引擎结果或人工标注的局限性。
- 为未来多文档摘要研究提供一个可扩展、可复现且公开可用的数据集。
提出的方法
- 通过爬取来自 Metacritic 的 265,000 条专业电子游戏评论和 26,000 条维基百科游戏玩法部分构建数据集。
- 使用启发式匹配方法,通过游戏名称和结构化元数据将游戏评论与对应的维基百科页面对齐。
- 从维基百科页面的游戏玩法部分提取参考摘要,这些摘要采用一致且标准化的写作风格。
- 该数据集旨在同时支持抽取式和生成式摘要,输入文档为专业评论,参考摘要为维基百科的游戏玩法部分。
- 使用标准的 ROUGE 指标(ROUGE-L、ROUGE-1、ROUGE-2)评估模型性能,以比较抽取式与生成式方法的表现。
- 基线模型包括 TextRank、LexRank、SumBasic、C_SKIP、SemSentSum、Conv2Conv 和基于 Transformer 的模型。
实验结果
研究问题
- RQ1能否利用专业电子游戏评论和维基百科游戏玩法部分构建一个大规模、领域特定的多文档摘要数据集?
- RQ2在非新闻、高质量、领域特定的数据集(如 GameWikiSum)上,抽取式与生成式摘要模型的表现如何?
- RQ3在该新数据集上,基于嵌入的模型在多大程度上优于传统基于频率或启发式的模型?
- RQ4尽管该数据集规模小于某些基于维基百科的语料库,它是否仍能支持序列到序列和基于 Transformer 的先进模型的训练?
主要发现
- GameWikiSum 包含 14,652 个样本,其规模约为常用多文档摘要数据集的 100 倍。
- 基于嵌入的模型(如 C_SKIP 和 SemSentSum)在该数据集上表现最佳,优于 TextRank、LexRank 和 SumBasic 等传统模型。
- 生成式模型 Conv2Conv 的 ROUGE-2 得分仅比 C_SKIP 低 0.05,表明其尽管模型复杂,仍表现出色。
- 普通 Transformer 模型表现逊于 Conv2Conv,其语言模型变体因数据稀缺而表现显著更差。
- 结果证实,专业评论与维基百科游戏玩法部分在语义上具有一致性,支持该数据集在多文档摘要任务中的有效性。
- 该数据集支持抽取式与生成式模型的训练,证明其在推动该领域研究超越新闻导向应用方面的实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。