QUICK REVIEW
[论文解读] Open-ended visual question answering
Issey Masuda Mora|arXiv (Cornell University)|Jul 15, 2016
Multimodal Machine Learning Applications参考文献 21被引用 5
一句话总结
本文提出了一种开放式视觉问答系统,能够从可穿戴相机图像中自动生成问题与答案,以支持回忆疗法。该系统利用视觉内容理解与自然语言生成技术,将冗余的图像流转化为有意义且上下文相关的问答对,从而实现个性化的记忆回忆。
ABSTRACT
Wearable cameras generate a large amount of photos which are, in many cases, useless or redundant. On the other hand, these devices are provide an excellent opportunity to create automatic questions and answers for reminiscence therapy. This is a follow up of the BSc thesis developed by Ricard Mestre during Fall 2014, and MSc thesis developed by Aniol Lidon.
研究动机与目标
- 通过将可穿戴相机产生的冗余且信息过载的图像流转化为有意义且互动的内容,解决其带来的挑战。
- 实现从视觉数据中自动生问与答,以支持临床环境中的认知治疗与记忆回忆。
- 开发一种基于可穿戴设备实时视觉输入的开放式、上下文相关的问答系统。
- 通过智能问题生成,弥合被动图像采集与主动认知参与之间的差距。
提出的方法
- 利用视觉理解技术,从可穿戴相机拍摄的图像中提取显著物体、场景与活动。
- 应用自然语言生成模型,将视觉特征转换为开放式且上下文恰当的问题。
- 采用一种流水线方法,将检测到的视觉元素(例如人物、地点、动作)映射为自然语言问题。
- 将问答对整合为适合临床回忆疗法使用的结构化格式。
- 基于先前的学士与硕士学位论文,进一步优化系统在真实场景中的准确度与相关性。
实验结果
研究问题
- RQ1如何将可穿戴相机的视觉内容转化为适用于回忆疗法的有意义且开放式的问答?
- RQ2哪些视觉特征在生成上下文相关且具有认知参与度的问题时最为有效?
- RQ3自动问题生成在多大程度上能够提升临床环境中的记忆回忆效果与用户参与度?
- RQ4如何对冗余的图像流进行过滤并重新利用,以生成互动性、治疗性的问答对?
主要发现
- 该系统成功地将原始的可穿戴相机图像转化为适合治疗用途的、具有上下文相关性的开放式问题。
- 人物、物体与地点等视觉特征被有效映射为语义连贯的自然语言问题。
- 该方法展示了通过将被动图像浏览转化为主动认知参与,从而增强记忆回忆的潜力。
- 该系统基于先前的学术研究,显示出在将视觉问答应用于临床与辅助应用方面实现了渐进式进展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。