Skip to main content
QUICK REVIEW

[論文レビュー] Semantic and structural image segmentation for prosthetic vision

Melani Sanchez-Garcia, Rubén Martínez-Cantín|arXiv (Cornell University)|Sep 25, 2018
Neuroscience and Neural Engineering参考文献 31被引用数 3
ひとこと要約

本論文は、屋内シーンからの構造的エッジとオブジェクトマスクを抽出することで、被造形視覚の性能を向上させる二重ブランチCNNフレームワークを提案している。この手法により、静的画像および動画を用いた模擬的被造形視覚の下で、ユーザーの認識精度を約75%から90%まで向上させ、低解像度のフォスフェン制約下でも高レベルの意味的・構造的手がかりを強調することで、シーン認識が著しく向上した。

ABSTRACT

Prosthetic vision is being applied to partially recover the retinal stimulation of visually impaired people. However, the phosphenic images produced by the implants have very limited information bandwidth due to the poor resolution and lack of color or contrast. The ability of object recognition and scene understanding in real environments is severely restricted for prosthetic users. Computer vision can play a key role to overcome the limitations and to optimize the visual information in the simulated prosthetic vision, improving the amount of information that is presented. We present a new approach to build a schematic representation of indoor environments for phosphene images. The proposed method combines a variety of convolutional neural networks for extracting and conveying relevant information about the scene such as structural informative edges of the environment and silhouettes of segmented objects. Experiments were conducted with normal sighted subjects with a Simulated Prosthetic Vision system. The results show good accuracy for object recognition and room identification tasks for indoor scenes using the proposed approach, compared to other image processing methods.

研究の動機と目的

  • フォスフェンの空間的および輝度分解能が低いことによる情報伝送限界を解消すること。
  • 低レベルの画像フィルタリングを超えた高レベルの視覚処理を組み込むことで、模擬的被造形視覚におけるシーン認識を向上させること。
  • 構造的エッジ検出とオブジェクトセグメンテーションが、屋内環境におけるユーザーの知覚をどのように向上させるかを評価すること。
  • 静的画像と動画シーケンスの間で、模擬的被造形視覚環境下での性能差を評価すること。
  • 年齢および知覚の自信レベルが、フォスフェニック表現を用いたシーン認識に与える影響を調査すること。

提案手法

  • ヘキサゴナルフォスフェングリッド(32×32、1024フォスフェン)を用い、ガウス平滑化を施して、網膜インプラント出力の模擬を実施し、知覚的リアリズムを確保した。
  • 二つの並列された畳み込みニューラルネットワーク(CNN)を用いる:一つは屋内シーンにおける構造的エッジ検出に、もう一つはインスタンスレベルのオブジェクトマスクセグメンテーションに使用する。
  • エッジとオブジェクトマスクの特徴を統合し、顕著なシーンの幾何構造とオブジェクトの識別性を保持する模式的表現を生成した。
  • 二重CNNの出力を用いて、動画シーケンスからフォスフェニック画像および動画をリアルタイムで生成した。
  • 空間的理解とシーン認識を向上させるために、頭部の動きを模擬する形で、連続したフレームを提示した。
  • 処理済みのシーンをフォスフェンに類似した刺激にレンダリングするための、模擬的被造形視覚(SPV)パイプラインを用いた。

実験結果

リサーチクエスチョン

  • RQ1構造的エッジ検出とオブジェクトセグメンテーションの統合は、模擬的被造形視覚におけるシーン認識を向上させることができるか?
  • RQ2フォスフェン制約下で、動画ベースの提示は静的画像に比べて、屋内環境の認識をどの程度向上させるか?
  • RQ3低解像度の被造形視覚において、構造的エッジは部屋タイプ分類にどの程度寄与するか?
  • RQ4本手法の性能は、年齢層や知覚の自信レベルの違いによって変化するか?
  • RQ5高レベルの意味的処理は、視覚補装ユーザーが利用可能な情報帯域幅を著しく拡大できるか?

主な発見

  • 提案手法SIE-OM(構造的エッジ+オブジェクトマスク)は、模擬的被造形視覚下で、ベースラインのOM手法(約75%)から90%まで認識精度を向上させた。
  • SIE-OMを用いた動画シーケンスでは、部屋タイプ分類の認識性能が79%に上昇したのに対し、静的画像では54%にとどまった。
  • 動画を視認した際、被験者は75%のDY/PY反応を示し、運動の手がかりにより知覚的理解が向上したと報告した。
  • 動画ベースの評価では、一部の部屋タイプで100%の再現率と適合率を達成し、複雑な屋内シーンにおける堅牢性を示した。
  • 年齢層(20–30歳対50–60歳)に差は顕著に認められなかったが、高齢被験者は静的画像では低い自信(25% DN)を示した。
  • ダイニングルームとリビングルーム、およびベッドルームとリビングルームの間で混同が生じたが、これは空間的・家具的類似性に起因し、手法の失敗とは見なせない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。