[论文解读] Saved You A Click: Automatically Answering Clickbait Titles
本文提出了一种系统,通过在 Reddit 的 'SavedYouAClick' 和 Facebook 的 'StopClickbait' 页面上微调抽取式(RoBERTa)和生成式(T5)问答模型,自动回答点击诱饵标题。微调后,抽取式模型在 ROUGE 分数上表现更优,而生成式模型在 BERTscore 上得分更高,并生成了更流畅、语法正确的回答。
Often clickbait articles have a title that is phrased as a question or vague teaser that entices the user to click on the link and read the article to find the explanation. We developed a system that will automatically find the answer or explanation of the clickbait hook from the website text so that the user does not need to read through the text themselves. We fine-tune an extractive question and answering model (RoBERTa) and an abstractive one (T5), using data scraped from the 'StopClickbait' Facebook pages and Reddit's 'SavedYouAClick' subforum. We find that both extractive and abstractive models improve significantly after finetuning. We find that the extractive model performs slightly better according to ROUGE scores, while the abstractive one has a slight edge in terms of BERTscores.
研究动机与目标
- 为解决浪费时间的点击诱饵标题问题,自动生成简洁的答案以回应点击诱饵标题。
- 探讨是否可以将点击诱饵剧透建模为一个封闭域问答任务,采用抽取式和生成式问答方法。
- 评估微调后的抽取式和生成式模型在新抓取的用户生成点击诱饵答案数据集上的性能。
- 比较抽取式与生成式模型在生成准确、流畅且事实正确答案方面的优缺点。
提出的方法
- 从 'SavedYouAClick' 和 'StopClickbait' 页面抓取了 2,538 条 Reddit 和 1,287 条 Facebook 帖子,构建了一个(上下文,问题,答案)数据集。
- 使用抓取的数据微调了一个在 SQuAD2.0 和 NewsQA 上预训练的抽取式问答模型(RoBERTa),未使用人工标注的答案片段。
- 在同一数据集上微调了一个生成式问答模型(T5),使其能够生成新颖的、改写后的答案,不一定要在原文中出现。
- 使用 ROUGE 和 BERTscore 指标对两个模型进行定量评估,其中 BERTscore 衡量生成答案与参考答案之间的语义相似度。
- 应用自监督片段检测技术(如 spanBERT)来近似抽取式模型的答案片段,尽管缺少真实答案片段。
- 对测试样本进行定性分析,以评估模型输出的流畅性、事实正确性和改写准确性。
实验结果
研究问题
- RQ1仅使用社交媒体论坛中用户生成的答案,抽取式和生成式问答模型能否有效回答点击诱饵标题?
- RQ2在评估抽取式与生成式模型生成答案的质量时,ROUGE 和 BERTscore 指标如何比较?
- RQ3在用户生成的点击诱饵剧透数据上进行微调,是否能显著提升模型在未见点击诱饵标题上的性能?
- RQ4在哪些场景下,抽取式模型优于生成式模型,反之亦然,特别是在事实一致性与流畅性方面?
- RQ5当点击诱饵标题模糊、基于列表或语义模糊时,两类模型的主要失败模式是什么?
主要发现
- 微调 RoBERTa(抽取式)和 T5(生成式)模型后,两者在 Reddit 和 Facebook 抓取的数据上均表现出显著的性能提升。
- 抽取式模型在 ROUGE-F1 分数上表现更优(例如,微调后的 RoBERTa-SQuAD 在 Reddit 上得分为 47.20),表明其在答案片段匹配上更准确。
- 生成式模型在 BERTscore 上优于抽取式模型(例如,RoBERTa-SQuAD 在 Reddit 上分别为 90.26 vs. 88.54),表明其与参考答案的语义对齐更好。
- 生成式模型生成了更流畅、语法正确且经过改写的回答,而抽取式模型在避免因改写引入事实错误方面更具一致性。
- 两类模型在基于列表的点击诱饵标题(如 '10 个原因...')以及过于模糊的标题上表现不佳,这些标题的答案通常跨越多个不连续的文本片段。
- 用户生成答案中存在噪声或冗余信息,导致数据质量波动,影响了模型的泛化能力和评估的可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。