Skip to main content
QUICK REVIEW

[论文解读] Answering Image Riddles using Vision and Reasoning through Probabilistic Soft Logic

Somak Aditya, Yezhou Yang|arXiv (Cornell University)|Nov 17, 2016
Advanced Image and Video Retrieval Techniques参考文献 21被引用 3
一句话总结

本文提出了一项新颖的任务:使用概率软逻辑(PSL)框架回答图像谜题——这类谜题需要视觉理解与常识推理相结合。该方法结合了深度学习的物体检测与基于ConceptNet的知识推理,以推断多幅图像之间的抽象共通概念,在一个新整理的3,000道谜题数据集上取得了优异性能,且所有标注均经人工验证。

ABSTRACT

In this work, we explore a genre of puzzles ("image riddles") which involves a set of images and a question. Answering these puzzles require both capabilities involving visual detection (including object, activity recognition) and, knowledge-based or commonsense reasoning. We compile a dataset of over 3k riddles where each riddle consists of 4 images and a groundtruth answer. The annotations are validated using crowd-sourced evaluation. We also define an automatic evaluation metric to track future progress. Our task bears similarity with the commonly known IQ tasks such as analogy solving, sequence filling that are often used to test intelligence. We develop a Probabilistic Reasoning-based approach that utilizes probabilistic commonsense knowledge to answer these riddles with a reasonable accuracy. We demonstrate the results of our approach using both automatic and human evaluations. Our approach achieves some promising results for these riddles and provides a strong baseline for future attempts. We make the entire dataset and related materials publicly available to the community in ImageRiddle Website (http://bit.ly/22f9Ala).

研究动机与目标

  • 提出一项新基准任务——回答图像谜题,以测试视觉感知与高层次推理能力。
  • 通过众包方式收集并验证一个大规模数据集,包含3,000道图像谜题,每道谜题配有四张图像和一个单字答案,确保语义一致性和适当难度。
  • 开发一种推理系统,利用概率常识知识,从视觉检测结果中推断出抽象的共通概念。
  • 通过结合视觉模型与结构化知识推理,为未来视觉推理研究建立强基线。
  • 提供自动评估指标与人工评估协议,以追踪该新任务的进展。

提出的方法

  • 使用最先进的图像分类模型(如Clarifai、ResNet)为每道谜题中的每张图像提取前5个类别预测结果。
  • 利用ConceptNet 5(一个编码词语与短语之间关系的知识图谱)将检测到的标签映射到更广泛的语义空间。
  • 应用概率软逻辑(PSL)对检测到的标签与ConceptNet知识进行结构化推理,推断出所有图像中最可能的共通概念。
  • 实施多阶段流水线:(1) 视觉检测,(2) 通过ConceptNet扩展概念,(3) 使用PSL进行概率推理,以对候选答案进行排序。
  • 通过GUR(全局无偏排名)模块引入偏差校正,以提升答案质量并减少预测中的过度自信。
  • 使用随机搜索在500道保留谜题的验证集上优化超参数(如相似度阈值、置信度阈值)。

实验结果

研究问题

  • RQ1结合视觉检测与常识推理的系统是否能有效解决需要抽象概念关联的图像谜题?
  • RQ2与仅依赖视觉的基线模型相比,通过ConceptNet集成结构化知识在多大程度上提升了答案准确率?
  • RQ3使用PSL的概率推理在多大程度上增强了模型从多样化图像中推断非显性共通概念的能力?
  • RQ4与仅依赖视觉的模型相比,人类评估者如何评价系统生成答案的正确性与智能程度?
  • RQ5统一框架是否能泛化到具有唯一、非冗余答案及多样化视觉线索的谜题?

主要发现

  • 所提方法的GUR+All变体在测试集上实现了最高的基于word2vec的准确率,优于仅使用视觉的基线模型。
  • 在Amazon Mechanical Turk上的人工评估显示,GUR+All系统的智能评分显著更高(2.2/4),而Clarifai为2.0/4,ResNet为1.8/4。
  • 系统在正确性与可解释性方面均有提升,人工评估中更高比例的答案落入最高正确性与智能评分区间。
  • 流水线中推理阶段(RR)后的准确率显著跃升,表明PSL推理是性能提升的主要驱动力。
  • 通过众包验证了3,000道谜题数据集的语义一致性与适当难度水平。
  • 所提方法具有良好的泛化能力,能基于少量检测到的标签,从大规模词汇库(ConceptNet的约20万个条目)中推断出抽象且非平凡的概念关联。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。