[论文解读] Deep Learning--Based Scene Simplification for Bionic Vision
本文提出了一种基于深度学习的场景简化框架,通过将自然场景预处理为简化表示,以增强视网膜植入物的仿生视觉。利用一种生物上合理的闪光感知模型,结果表明,与显著性或深度基方法相比,目标分割在虚拟患者中的场景理解方面显著提升,且随着闪光大小和拉长程度的增加,性能逐渐下降。
Retinal degenerative diseases cause profound visual impairment in more than 10 million people worldwide, and retinal prostheses are being developed to restore vision to these individuals. Analogous to cochlear implants, these devices electrically stimulate surviving retinal cells to evoke visual percepts (phosphenes). However, the quality of current prosthetic vision is still rudimentary. Rather than aiming to restore "natural" vision, there is potential merit in borrowing state-of-the-art computer vision algorithms as image processing techniques to maximize the usefulness of prosthetic vision. Here we combine deep learning--based scene simplification strategies with a psychophysically validated computational model of the retina to generate realistic predictions of simulated prosthetic vision, and measure their ability to support scene understanding of sighted subjects (virtual patients) in a variety of outdoor scenarios. We show that object segmentation may better support scene understanding than models based on visual saliency and monocular depth estimation. In addition, we highlight the importance of basing theoretical predictions on biologically realistic models of phosphene shape. Overall, this work has the potential to drastically improve the utility of prosthetic vision for people blinded from retinal degenerative diseases.
研究动机与目标
- 通过利用计算机视觉算法作为视网膜植入物的预处理,提升视网膜退行性疾病患者使用仿生视觉的实用性。
- 评估不同的基于深度学习的场景简化策略——语义分割、显著性检测和单目深度估计——对模拟仿生视觉(SPV)中场景理解的影响。
- 采用经过心理物理学验证、具有神经生物学启发的闪光形状模型,生成更准确的SPV预测,以实现更精确的性能评估。
- 系统评估在不同闪光大小和形状下的感知性能,突破以往假设闪光为孤立圆形的局限。
- 为未来面向个体视网膜植入系统、具备实时性和边缘计算兼容性的图像处理流水线提供基础。
提出的方法
- 本研究采用最先进的深度学习模型进行语义分割、视觉显著性检测和单目深度估计,对自然户外场景进行预处理。
- 使用经过心理物理学验证的视网膜假体计算模型(pulse2percept)模拟闪光形成过程,包含真实的空间扩散和形状参数(半径 ρ 和拉长系数 λ)。
- 通过基于电极网格配置将分割或显著区域映射为闪光图案,将处理后的图像转换为模拟仿生视觉(SPV)输出。
- 开展用户研究,让视力正常受试者(虚拟患者)在SPV渲染的场景中执行二元检测任务(识别行人和车辆)。
- 使用敏感度指数 d′ 量化性能,并通过统计分析比较不同简化策略及闪光参数的影响。
- 评估不同电极网格尺寸(8×8、16×16、32×32),以分析空间分辨率对感知性能的影响。
实验结果
研究问题
- RQ1与基线方法相比,基于深度学习的场景简化是否能提升模拟仿生视觉中的场景理解?
- RQ2在支持目标检测任务方面,语义分割、显著性检测和深度估计等不同场景简化策略表现如何比较?
- RQ3真实的闪光形状(大小和拉长程度)在SPV中对感知性能的影响有多大?
- RQ4增加植入电极网格中的电极数量是否能带来可测量的场景理解性能提升?
- RQ5与理想化的圆形闪光相比,采用生物上真实的闪光建模是否能提升SPV预测的有效性?
主要发现
- 在所有条件下,目标分割显著优于显著性和深度基模型,d′ 值最高。
- 随着闪光大小(ρ)和拉长程度(λ)的增加,性能下降,最差表现出现在 ρ = 500 μm 且 λ = 2.0 时。
- 即使在大而拉长的闪光条件下,受试者仍表现优于随机猜测水平(d′ > 0),表明所有简化策略均能实现可检测的感知。
- 将电极网格从 8×8 增加到 16×16 可提升性能,但进一步增至 32×32 未带来显著改善。
- 研究证实,真实闪光形状建模至关重要,因为假设孤立圆形闪光可能导致性能预测过于乐观。
- 结果表明,语义分割是最有效的预处理策略,可显著提升户外导航任务中仿生视觉的实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。