[论文解读] Template-free Data-to-Text Generation of Finnish Sports News
本文提出了一种无需模板的端到端神经网络模型,用于从结构化的冰球比赛统计数据自动生成芬兰语体育新闻。通过人工对齐新闻文章与比赛事件,构建了高质量的训练语料库,系统生成的文本语法流畅,记者评估认为75–90%的输出可直接用于机器生成新闻或后期编辑,与原始数据训练相比,幻觉现象显著减少。
News articles such as sports game reports are often thought to closely follow the underlying game statistics, but in practice they contain a notable amount of background knowledge, interpretation, insight into the game, and quotes that are not present in the official statistics. This poses a challenge for automated data-to-text news generation with real-world news corpora as training data. We report on the development of a corpus of Finnish ice hockey news, edited to be suitable for training of end-to-end news generation methods, as well as demonstrate generation of text, which was judged by journalists to be relatively close to a viable product. The new dataset and system source code are available for research purposes at https://github.com/scoopmatic/finnish-hockey-news-generation-paper.
研究动机与目标
- 开发一种无需模板的端到端数据到文本生成系统,用于芬兰语体育新闻报道,基于神经序列到序列模型。
- 通过创建人工整理、事件对齐的芬兰语冰球新闻语料库,解决数据到文本生成中的事实性幻觉问题。
- 评估神经生成是否能产生足够接近专业水准的文本,可用于机器生成新闻或作为后期编辑的初稿。
- 探索在包含非统计数据信息、背景知识和解释性语言的真实新闻内容上,端到端模型训练的可行性。
提出的方法
- 通过将STT新闻文章与1994–2018年官方比赛统计数据对齐,构建了包含3,454场比赛的芬兰语冰球新闻语料库。
- 人工将新闻文章中的文本片段与具体比赛事件(如进球、判罚)对齐,以创建无事实性幻觉的训练数据集。
- 在对齐数据集上训练序列到序列神经模型,从输入统计数据生成完整的比赛报告。
- 通过两名STT记者的人工评估来评价模型输出:一名评估是否适合后期编辑,另一名评估是否可直接发布。
- 使用词错误率(WER)量化生成文本与记者编辑版本之间的编辑距离,包括有标点和无标点两种情况。
- 探讨了生成多事件句子时的局限性,并考虑通过数据增强和子词单元改进未来方法。
实验结果
研究问题
- RQ1在包含非统计数据元素的真实新闻内容上进行训练时,无需模板的端到端神经模型能否生成事实准确且语言流畅的芬兰语体育新闻?
- RQ2与使用原始新闻数据相比,将新闻文章与比赛事件进行人工对齐,在多大程度上能减少数据到文本生成中的事实性幻觉?
- RQ3生成的文本在真实新闻生产中的可用性如何,特别是在机器生成新闻流程中?
- RQ4生成的芬兰语体育报道中的主要错误类别是什么,能否通过数据或模型改进系统性地加以解决?
- RQ5端到端模型能否在单步内生成连贯的多事件摘要,还是仍需依赖逐事件生成才能保证质量?
主要发现
- 与记者编辑的稿件相比,模型生成的文本语法流畅,词错误率(WER)为9.9%(无标点时为11.2%),适用于后期编辑。
- 与最终可直接发布的版本相比,WER上升至22.0%(无标点时为24.4%),表明75–90%的输出无需重大修改即可使用。
- 事实性错误主要涉及姓名复制错误、事件类型误分类和时间引用不准确,提示这些是未来修正的关键目标。
- 将新闻文章与比赛事件进行人工对齐显著减少了幻觉现象,证明其在训练真实新闻数据的可靠端到端系统中至关重要。
- 逐事件生成导致不自然的重复和较差的句子层面流畅性,表明未来需在多事件或文档级生成方面开展工作。
- 该数据集、模型代码和原始语料库已公开,以支持低资源、非英语数据到文本生成的未来研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。