[论文解读] What You See is What You Get: Visual Pronoun Coreference Resolution in Dialogues
本文提出了 VisPro,一个用于对话中视觉代词共指消解(PCR)的大规模数据集,并提出了 VisCoref,一种能够联合利用视觉和上下文信息来消解代词的视觉感知模型。实验表明,引入视觉定位可显著提升 PCR 性能,尤其在指代对象未在文本中提及的情况下效果更明显。
Grounding a pronoun to a visual object it refers to requires complex reasoning from various information sources, especially in conversational scenarios. For example, when people in a conversation talk about something all speakers can see, they often directly use pronouns (e.g., it) to refer to it without previous introduction. This fact brings a huge challenge for modern natural language understanding systems, particularly conventional context-based pronoun coreference models. To tackle this challenge, in this paper, we formally define the task of visual-aware pronoun coreference resolution (PCR) and introduce VisPro, a large-scale dialogue PCR dataset, to investigate whether and how the visual information can help resolve pronouns in dialogues. We then propose a novel visual-aware PCR model, VisCoref, for this task and conduct comprehensive experiments and case studies on our dataset. Results demonstrate the importance of the visual information in this PCR case and show the effectiveness of the proposed model.
研究动机与目标
- 正式定义在共享视觉上下文对理解至关重要的对话中进行视觉代词共指消解(PCR)的任务。
- 创建 VisPro,这是首个专注于图像支持对话中 PCR 的大规模数据集,包含来自 5,000 个对话的 29,722 个代词。
- 开发 VisCoref,一种新颖的视觉感知模型,能够将对话中的提及与视觉对象对齐,并融合上下文与视觉特征以提升共指消解性能。
- 证明当指代对象未在对话中明确提及时,视觉信息在消解代词中的关键作用。
提出的方法
- VisCoref 模型采用双流架构:一条流通过 BERT 处理由对话上下文进行上下文编码,另一条流通过 CNN 处理由图像提取视觉特征并生成嵌入表示。
- 利用可学习的注意力机制,实现对话中名词短语与图像中检测到的对象之间的跨模态对齐。
- 通过加权求和的晚期融合策略,将上下文表示与视觉表示结合,视觉损失权重($\lambda_{vis}$)调优至 0.4,以平衡模态贡献。
- 采用候选提及上的交叉熵损失进行端到端训练,并通过负采样提升泛化能力。
- 数据集构建过程包括从 VisDial 中选取对话,使用 Stanford Parser 提取名词短语,并通过人工标注者将代词链接到视觉对象。
- 后处理确保候选提及之间无重叠,并通过句法约束确保标注的一致性。
实验结果
研究问题
- RQ1当指代对象未在文本中提及的情况下,视觉信息是否能显著提升对话中代词共指消解的性能?
- RQ2视觉与上下文特征的融合如何影响对话设置下共指消解模型的性能?
- RQ3视觉定位对消解模糊代词(如 'it' 或 'they')的影响如何,尤其是在存在多个候选对象时?
- RQ4所提出的 VisCoref 模型在视觉 PCR 任务中相较于传统仅依赖上下文的模型,优势有多大?
- RQ5与模型预测相比,人工标注的对话中视觉参考在对齐准确率和一致性方面表现如何?
主要发现
- VisCoref 模型在 F1 分数上显著优于仅依赖上下文的基线模型,证明了视觉定位在消解模糊代词方面的有效性。
- 案例研究表明,即使指代对象未出现在对话中,VisCoref 也能正确将代词指向视觉对象,例如将 'it' 正确链接到文本中未提及的雕像。
- 在 68% 的关键依赖视觉上下文才能正确消解的案例中,VisCoref 超过了端到端基线模型,凸显了视觉对齐的价值。
- 消融实验证实,视觉特征的贡献超过仅依赖上下文特征,尤其在词汇歧义较高的情况下。
- VisPro 数据集中共包含 29,722 个代词标注,覆盖 5,000 个对话,其中 38% 的代词指代的是对话中未明确提及的对象,证明了视觉定位的必要性。
- 视觉与上下文信号的最佳平衡点为 $\lambda_{vis} = 0.4$,该设置可防止对视觉数据的过拟合,同时最大化性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。