Skip to main content
QUICK REVIEW

[論文レビュー] Sharing deep generative representation for perceived image reconstruction from human brain activity

Changde Du, Changying Du|arXiv (Cornell University)|Apr 25, 2017
Cell Image Analysis Techniques被引用数 15
ひとこと要約

本論文は、共有非線形潜在表現を通じて刺激と神経応答を統合的にモデル化することで、fMRI脳活動から知覚された視覚的画像を再構築する深層生成マルチビューモデル(DGMM)を提案する。画像モデリングに深層ニューラルネットワークを、fMRIボクセル相関にはフルランク共分散を用い、変分ベイズ推論と事後正則化を組み合わせることで、3つのデータセットにおいて最先端の再構築性能を達成し、従来手法に比べてSSIMおよびPCCで顕著に優れた結果を示した。

ABSTRACT

Decoding human brain activities via functional magnetic resonance imaging (fMRI) has gained increasing attention in recent years. While encouraging results have been reported in brain states classification tasks, reconstructing the details of human visual experience still remains difficult. Two main challenges that hinder the development of effective models are the perplexing fMRI measurement noise and the high dimensionality of limited data instances. Existing methods generally suffer from one or both of these issues and yield dissatisfactory results. In this paper, we tackle this problem by casting the reconstruction of visual stimulus as the Bayesian inference of missing view in a multiview latent variable model. Sharing a common latent representation, our joint generative model of external stimulus and brain response is not only "deep" in extracting nonlinear features from visual images, but also powerful in capturing correlations among voxel activities of fMRI recordings. The nonlinearity and deep structure endow our model with strong representation ability, while the correlations of voxel activities are critical for suppressing noise and improving prediction. We devise an efficient variational Bayesian method to infer the latent variables and the model parameters. To further improve the reconstruction accuracy, the latent representations of testing instances are enforced to be close to that of their neighbours from the training set via posterior regularization. Experiments on three fMRI recording datasets demonstrate that our approach can more accurately reconstruct visual stimuli.

研究の動機と目的

  • ノイジーで高次元なfMRIデータから詳細な視覚的刺激を再構築する課題に対処すること。
  • 既存のfMRIから画像への再構築手法における線形モデルの限界と、劣悪なノイズ抑制の問題を克服すること。
  • 画像の非線形特徴とfMRIボクセル間の相関を捉えることができる深層生成モデルを開発すること。
  • テスト時の潜在表現に対して事後正則化を適用することで構造的一致性を強制し、再構築精度を向上させること。
  • モデル平均化を通じて小規模なfMRIデータセットにおける過学習を低減する確率的・ベイズ的枠組みを提供すること。

提案手法

  • 共有潜在空間を有するマルチビュー潜在変数モデルにおける欠損ビューのベイズ推論として画像再構築を定式化する。
  • 視覚的画像の非線形観測モデルとして深層ニューラルネットワーク(例:CNNやMLP)を用い、特徴表現を強化する。
  • fMRIボクセル活動をフルランクガウス分布でモデル化し、計算コストを抑えるために低ランク共分散に縮約する。
  • 潜在変数およびモデルパラメータの推定に、効率的な平均場変分ベイズ推論法を採用する。
  • テスト時の潜在表現が訓練データの近傍と類似するように制約を課すことで、汎化性能を向上させる事後正則化を適用する。
  • ベイズ推論によるモデル平均化を統合し、限られたfMRIデータにおける過学習を緩和する。

実験結果

リサーチクエスチョン

  • RQ1共有潜在表現を有する深層生成モデルは、線形モデルや非生成モデルに比べ、fMRIからの視覚的画像再構築において優れた性能を示せるか?
  • RQ2fMRIボクセル活動にフルランク共分散構造を適用することで、ノイズ抑制と再構築精度がどの程度向上するか?
  • RQ3事後正則化は、テスト時の潜在表現を訓練データの近傍に一致させることで、汎化性能の向上にどの程度寄与するか?
  • RQ4画像モデリングに非線形な深層特徴を組み込むことで、線形モデルや浅いモデルに比べて再構築性能が向上するか?
  • RQ5完全に生成的でベイズ的な枠組みは、判別的または二段階的手法に比べ、小規模なfMRIデータセットにおいて優れた性能を達成できるか?

主な発見

  • データセット1では、DGMMはPCC 0.611 ± 0.183を達成し、BCCA(0.438 ± 0.215)およびDCCAEの変種を顕著に上回った。
  • データセット2では、DGMMは最高のSSIM(0.645 ± 0.054)を達成し、De-CNN(0.613 ± 0.043)および他のベースラインを上回った。
  • データセット3では、DGMMは再構築画像における分類精度が0.778 ± 0.083に達し、BCCA(0.600 ± 0.098)およびDCCAE-S(0.478 ± 0.155)を著しく上回った。
  • DGMMは全3データセットにおいてSSIMで一貫した優位性を示し、データセット2では次善の手法に比べて最大0.15の向上を達成した。
  • 本モデルは、知覚的類似性(SSIM)と相関(PCC)の両面で最先端の性能を達成し、再構築の忠実度が向上したことを示した。
  • 事後正則化は、テストインスタンスにおける一貫した性能向上を通じて、汎化性能の向上に寄与したことが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。