Skip to main content
QUICK REVIEW

[论文解读] Semantic and structural image segmentation for prosthetic vision

Melani Sanchez-Garcia, Rubén Martínez-Cantín|arXiv (Cornell University)|Sep 25, 2018
Neuroscience and Neural Engineering参考文献 31被引用 3
一句话总结

本文提出一种双分支卷积神经网络(CNN)框架,通过从室内场景中提取结构边缘和物体掩码,显著提升假体视觉的场景识别能力。在使用静态图像和视频模拟假体视觉的实验中,该方法通过强调低分辨率磷光体约束下的高层语义与结构线索,将用户识别准确率从约75%提升至90%。

ABSTRACT

Prosthetic vision is being applied to partially recover the retinal stimulation of visually impaired people. However, the phosphenic images produced by the implants have very limited information bandwidth due to the poor resolution and lack of color or contrast. The ability of object recognition and scene understanding in real environments is severely restricted for prosthetic users. Computer vision can play a key role to overcome the limitations and to optimize the visual information in the simulated prosthetic vision, improving the amount of information that is presented. We present a new approach to build a schematic representation of indoor environments for phosphene images. The proposed method combines a variety of convolutional neural networks for extracting and conveying relevant information about the scene such as structural informative edges of the environment and silhouettes of segmented objects. Experiments were conducted with normal sighted subjects with a Simulated Prosthetic Vision system. The results show good accuracy for object recognition and room identification tasks for indoor scenes using the proposed approach, compared to other image processing methods.

研究动机与目标

  • 解决由于磷光体空间分辨率和亮度分辨率较低导致的假体视觉信息传输受限问题。
  • 通过引入超越低层次图像滤波的高层视觉处理,提升模拟假体视觉中的场景识别能力。
  • 评估结构边缘检测与物体分割在增强用户对室内环境感知方面的有效性。
  • 评估在模拟假体视觉环境下,静态图像与视频序列在性能上的差异。
  • 研究年龄与感知信心水平对使用磷光表示进行场景识别的影响。

提出的方法

  • 采用六边形磷光体网格(32×32,共1024个磷光体)模拟视网膜植入输出,并通过高斯平滑处理提升感知真实感。
  • 使用两个并行的卷积神经网络(CNN):一个用于检测室内场景中的结构边缘,另一个用于实例级别的物体掩码分割。
  • 将边缘与物体掩码特征整合为一种示意图表示,以保留显著的场景几何结构与物体身份信息。
  • 应用实时处理,利用双CNN输出从视频序列生成磷光图像与视频。
  • 通过依次呈现帧序列模拟头部运动,以增强空间理解与场景感知。
  • 使用模拟假体视觉(SPV)管道将处理后的场景渲染为类似磷光的刺激,供人类受试者评估。

实验结果

研究问题

  • RQ1结构边缘检测与物体分割的整合是否能提升模拟假体视觉中的场景识别能力?
  • RQ2在磷光体约束下,基于视频的呈现方式与静态图像相比,是否更能提升用户对室内环境的识别能力?
  • RQ3在低分辨率假体视觉中,结构边缘在房间类型分类中的贡献程度如何?
  • RQ4所提方法的性能是否在不同年龄组或感知信心水平下存在差异?
  • RQ5高层语义处理是否能显著提升视觉假体用户可获得的信息带宽?

主要发现

  • 所提出的SIE-OM方法(结构边缘 + 物体掩码)在模拟假体视觉中将场景识别准确率从基线OM方法的约75%提升至90%。
  • 在SIE-OM方法下,视频序列将房间类型分类的识别性能提升至79%,而静态图像仅为54%。
  • 受试者在观看视频时报告了更高的信心水平(75% DY/PY响应),表明运动线索改善了感知理解。
  • 在基于视频的评估中,该方法对部分房间类型实现了100%的查全率与精确率,表明在复杂室内场景中具有强鲁棒性。
  • 年龄范围(20–30岁 vs. 50–60岁)对识别性能无显著影响,但年长受试者在静态图像下信心水平较低(25% DN)。
  • 对餐厅与客厅、卧室与客厅的混淆,主要源于空间布局与家具相似性,而非方法本身的问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。