[论文解读] Neural Joking Machine : Humorous image captioning
本文提出神经笑话生成模型(Neural Joking Machine, NJM),一种幽默图像字幕生成系统,利用在 BoketeDB——一个来自 Bokete 网站服务的大规模图像-字幕对数据集上微调的 CNN+LSTM 模型进行训练。通过引入 Funny Score 损失函数,该函数根据用户星级评分(1–3 颗星)对字幕进行加权,模型在训练中优化幽默感,其生成的字幕在人类评估中排名高于基线方法,并在真实用户测试中优于 MS COCO 字幕的日文翻译版本。
What is an effective expression that draws laughter from human beings? In the present paper, in order to consider this question from an academic standpoint, we generate an image caption that draws a "laugh" by a computer. A system that outputs funny captions based on the image caption proposed in the computer vision field is constructed. Moreover, we also propose the Funny Score, which flexibly gives weights according to an evaluation database. The Funny Score more effectively brings out "laughter" to optimize a model. In addition, we build a self-collected BoketeDB, which contains a theme (image) and funny caption (text) posted on "Bokete", which is an image Ogiri website. In an experiment, we use BoketeDB to verify the effectiveness of the proposed method by comparing the results obtained using the proposed method and those obtained using MS COCO Pre-trained CNN+LSTM, which is the baseline and idiot created by humans. We refer to the proposed method, which uses the BoketeDB pre-trained model, as the Neural Joking Machine (NJM).
研究动机与目标
- 开发一种计算框架,用于生成旨在引发笑声的字幕,以应对人工智能中幽默量化这一挑战。
- 从 Bokete 网站服务中构建一个大规模、真实世界场景下的幽默图像-字幕对数据集,以支持训练与评估。
- 设计一种新颖的损失函数——Funny Score,根据用户提供的星级评分(1–3 颗星)对字幕质量进行加权,以更有效地优化幽默感。
- 在人类评估与在 Bokete 平台上的真实部署中,评估模型性能,对比人类生成的字幕与在 MS COCO 上预训练的基线模型。
提出的方法
- 系统采用 CNN+LSTM 架构,使用 ResNet-152 进行图像特征提取,LSTM 负责序列字幕生成,其结构源自 Show and Tell 模型。
- Funny Score 是一种自定义损失函数,对获得超过 100 颗星的字幕施加更高的惩罚(L−1.0),同时对低分字幕进行损失归一化(L),从而在训练中优先生成更有趣的输出。
- BoketeDB 通过从 Bokete Ogiri 网站抓取 999,571 组图像-字幕对构建而成,形成一个大规模、经用户评价的幽默字幕生成数据集。
- 模型在 BoketeDB 上进行微调,以 Funny Score 作为主要优化目标,取代标准的交叉熵损失。
- 人类评估采用盲评问卷,对三种来源的字幕进行排名:人工生成的字幕、NJM 生成的字幕,以及 STAIR 字幕(MS COCO 的翻译版本)。
- 系统还被部署在 Bokete 上,通过用户星级评分收集真实世界用户反馈,验证其在实际社交网络环境下的表现。
实验结果
研究问题
- RQ1能否仅使用用户提供的星级评分作为监督信号,有效训练深度学习模型生成幽默图像字幕?
- RQ2与在通用数据集上微调的标准图像字幕模型相比,幽默优化模型的性能如何?
- RQ3自建的、经用户评分的数据集(BoketeDB)是否能在生成幽默字幕方面超越现有基准(如 MS COCO)?
- RQ4Funny Score 损失函数是否相比标准交叉熵损失,能更有效地优化幽默感?
主要发现
- 在人类评估中,人工生成的字幕被评定为最有趣的比例为 67.99%,显著高于 NJM 和 STAIR 字幕基线。
- NJM 生成的字幕被评定为最有趣的比例为 22.59%,优于 STAIR 字幕基线(仅 9.41% 的时间被排在最高)。
- 在 Bokete 平台的真实部署中,NJM 生成的字幕平均获得 3.23 颗星,而 STAIR 字幕仅为 1.71 颗星,表明用户参与度更高且感知幽默感更强。
- Funny Score 损失函数在训练中有效优先处理高分字幕,从而在幽默质量上相比标准训练目标实现了可测量的提升。
- BoketeDB 拥有 999,571 组图像-字幕对,被证明是训练幽默感知字幕模型的宝贵且可扩展的资源,尽管图像数量少于 MS COCO,但在字幕幽默性方面表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。