[论文解读] Manga109Dialog: A Large-scale Dialogue Dataset for Comics Speaker Detection
本文提出了 Manga109Dialog,这是目前世界上规模最大的漫画角色说话人检测数据集,包含 132,692 对说话人-文本配对,并提出了一种基于场景图生成(SGG)的深度学习方法,通过引入画面阅读顺序作为结构先验来提升预测准确率。该方法在准确率上超过 75%,显著优于基于规则的基线方法,尤其在说话人与文本不在同一画面的复杂情况下表现更优。
The expanding market for e-comics has spurred interest in the development of automated methods to analyze comics. For further understanding of comics, an automated approach is needed to link text in comics to characters speaking the words. Comics speaker detection research has practical applications, such as automatic character assignment for audiobooks, automatic translation according to characters' personalities, and inference of character relationships and stories. To deal with the problem of insufficient speaker-to-text annotations, we created a new annotation dataset Manga109Dialog based on Manga109. Manga109Dialog is the world's largest comics speaker annotation dataset, containing 132,692 speaker-to-text pairs. We further divided our dataset into different levels by prediction difficulties to evaluate speaker detection methods more appropriately. Unlike existing methods mainly based on distances, we propose a deep learning-based method using scene graph generation models. Due to the unique features of comics, we enhance the performance of our proposed model by considering the frame reading order. We conducted experiments using Manga109Dialog and other datasets. Experimental results demonstrate that our scene-graph-based approach outperforms existing methods, achieving a prediction accuracy of over 75%.
研究动机与目标
- 解决漫画领域,特别是日本漫画中缺乏大规模、高质量的说话人-文本标注数据集的问题。
- 克服仅依赖空间距离的基于规则方法在复杂漫画版面中失效的局限性。
- 开发一种基于深度学习的说话人检测框架,利用视觉关系和漫画结构特征(如阅读顺序)进行建模。
- 通过基于难度分层的测试集和定制化指标,建立新的评估基准,以实现方法间的公平比较。
- 通过展示仅使用视觉信息的说话人检测方法的潜力,为未来整合自然语言处理(NLP)技术奠定基础。
提出的方法
- 基于 Manga109 数据集构建了新的大规模数据集 Manga109Dialog,包含 132,692 个说话人-文本标注。
- 提出一种基于场景图生成(SGG)的模型,用于检测角色(主体)、文本(对象)及其空间关系之间的关联。
- 通过引入画面阅读顺序作为结构先验,增强 SGG 模型,以提升复杂版面中的预测性能。
- 设计了一种专为漫画说话人检测定制的新评估指标,重点关注每页文本数量下的召回率。
- 根据预测难度将测试集划分为“易”和“难”两个子集——具体依据是说话人是否与文本位于同一画面。
- 采用联合交叉熵损失函数进行训练,同时优化目标检测与关系预测任务。

实验结果
研究问题
- RQ1基于深度学习的场景图生成模型是否能在漫画说话人检测任务中超越传统的基于规则的方法?
- RQ2在复杂版面中,引入画面阅读顺序在多大程度上能提升说话人检测的准确率?
- RQ3所提出方法在不同难度级别下的表现如何,特别是在说话人与文本不在同一画面的情况下?
- RQ4所提出的评估指标是否比传统指标更可靠、更具信息量,适用于漫画说话人检测任务?
- RQ5仅使用视觉信息的方法能否实现稳健的性能表现,为未来集成 NLP 技术提供可靠的基线?
主要发现
- 所提出的基于 SGG 的方法在总测试集上达到了 75.69% 的预测准确率,显著优于最佳基线规则方法(基于画面距离的规则方法准确率为 71.53%)。
- 在“难”子集(说话人与文本不在同一画面)上,所提方法的召回率达到 30.65%,远高于基于画面距离的规则方法的 22.06%。
- 引入画面阅读顺序后,总测试集上的性能提升了 0.12%,在“难”子集上提升了 1.10%,表明其在建模漫画序列结构方面具有显著价值。
- 该模型在“易”和“难”两个子集上均优于基于规则的方法,尤其在最近邻角色并非真实说话人的情况下优势明显。
- 新评估指标有效捕捉了不同方法间的性能差异,实现了对基于规则与深度学习方法更公平的比较。
- 尽管性能有所提升,但在角色交替对话和非相邻说话人场景中仍存在挑战,表明未来仍有整合 NLP 技术的空间。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。