Skip to main content
QUICK REVIEW

[論文レビュー] Seeing through the Brain: Image Reconstruction of Visual Perception from Human Brain Signals

Yu-Ting Lan, Kan Ren|arXiv (Cornell University)|Jul 27, 2023
CCD and CMOS Imaging Sensors被引用数 7
ひとこと要約

本稿では、マルチレベルの意味的デコードと潜在拡散モデルを用いて、ノイズの多い時系列EEGデータから高解像度の視覚的刺激を再構築する新しいパイプライン、NeuroImagenを提案する。ノイズの多い時系列EEGデータからピクセルレベルの顕著性マップとサンプルレベルのテキスト記述を抽出することで、EEG-画像データセットにおいて最先端のFIDおよびISスコアを達成し、優れた画像再構築品質を実現した。

ABSTRACT

Seeing is believing, however, the underlying mechanism of how human visual perceptions are intertwined with our cognitions is still a mystery. Thanks to the recent advances in both neuroscience and artificial intelligence, we have been able to record the visually evoked brain activities and mimic the visual perception ability through computational approaches. In this paper, we pay attention to visual stimuli reconstruction by reconstructing the observed images based on portably accessible brain signals, i.e., electroencephalography (EEG) data. Since EEG signals are dynamic in the time-series format and are notorious to be noisy, processing and extracting useful information requires more dedicated efforts; In this paper, we propose a comprehensive pipeline, named NeuroImagen, for reconstructing visual stimuli images from EEG signals. Specifically, we incorporate a novel multi-level perceptual information decoding to draw multi-grained outputs from the given EEG data. A latent diffusion model will then leverage the extracted information to reconstruct the high-resolution visual stimuli images. The experimental results have illustrated the effectiveness of image reconstruction and superior quantitative performance of our proposed method.

研究の動機と目的

  • fMRIベースの手法とは異なり、まだ十分に研究が進んでいないノイズの多い時系列EEG信号から高解像度の視覚的刺激を再構築する課題に取り組む。
  • EEGデータからピクセルレベルの意味的特徴(例:顕著性マップ)とサンプルレベルの意味的特徴(例:テキスト記述)をデコードすることで、画像再構築品質を向上させる。
  • 事前学習済みの潜在拡散モデルを活用し、EEGから抽出した意味的事前知識をガイドとして用いることで、高精細な画像生成を実現する。
  • 個々の被験者に特有のEEGパターンを持つ被験者間で、フレームワークの頑健性と一般化性能を検証する。
  • 定量的・定性的な指標の両面で、従来のEEGベースの画像再構築ベースラインと比較して、提案手法の優位性を示す。

提案手法

  • EEG信号からピクセルレベルの意味的特徴(例:顕著性マップ)とサンプルレベルの意味的特徴(例:テキスト記述)を抽出するマルチレベルの知覚情報デコードモジュールを提案する。
  • サンプルレベルの意味的デコードをガイドするため、BLIPによるキャプション生成とラベルベースのキャプション生成を監視信号として用いる。
  • 抽出された意味的事前知識を潜在拡散モデル(LDM)に統合し、EEG由来の表現に条件付けられた高解像度画像を生成する。
  • 2段階の訓練戦略を採用する:訓練段階ではピクセルレベルおよびサンプルレベルの監視を用い(推論段階で削除)、拡散プロセスの効果的制御を可能にする。
  • 潜在空間における事前学習済みの拡散モデルを活用することで、生成効率と画像品質を向上させつつ、元の視覚的刺激との忠実度を維持する。
  • 意味的事前知識と拡散モデルのノイズ除去ステップを整合させる制御機構を導入し、複雑なEEG入力からの構造的な画像生成を実現する。
Figure 1: Overview of our NeuroImagen . All the modules with dotted lines, i.e. pixel-level supervision and sample-level supervision, are only used during the training phase. and would be removed during the inference phase .
Figure 1: Overview of our NeuroImagen . All the modules with dotted lines, i.e. pixel-level supervision and sample-level supervision, are only used during the training phase. and would be removed during the inference phase .

実験結果

リサーチクエスチョン

  • RQ1ピクセルレベルの顕著性からサンプルレベルのテキスト記述までをカバーするマルチレベルの意味的デコードが、再構築された視覚的刺激の品質と意味的正確性を向上させるか?
  • RQ2EEG由来の意味的事前知識と事前学習済みの潜在拡散モデルを統合した手法は、エンドツーエンドの生成モデルやリtrievalベースのベースラインと比較して、EEGから画像への再構築においてどのように優れているか?
  • RQ3被験者固有のEEGパターンと低い信号対ノイズ比を持つ被騟能に、提案手法がどの程度一般化可能か?
  • RQ4再構築画像の構造的類似性と意味的類似性を向上させるために、ピクセルレベルの意味的特徴(例:顕著性マップ)とサンプルレベルの意味的特徴(例:キャプション監視)の相対的寄与度はどの程度か?
  • RQ5ラベルベースのキャプション監視は、BLIPベースのキャプション監視よりも、EEG信号からクラスレベルの意味的特徴をデコードする際に優れているか?

主な発見

  • NeuroImagenはEEG-画像データセットにおいて最先端のFréchet Inception Distance(FID)とInception Score(IS)を達成し、被験者05ではISが32.97、被験者01では32.64を記録した。
  • ピクセルレベルの意味的特徴(顕著性マップ)の使用により、構造的類似性(SSIM)が著しく向上し、アブレーションスタディではベースラインの0.157から0.251に上昇した。
  • ラベルキャプション監視によるサンプルレベルの意味的特徴統合は、BLIPキャプション監視よりも高い性能を示し、ISが3.5ポイント上昇し、SSIMも0.015上昇した。
  • モデルは強力な被験者間一般化性能を示し、6名の被験者で一貫した性能を発揮し、再構築画像クラス分類の平均正答率が85.8%に達した。
  • アブレーションスタディの結果、ピクセルレベルとサンプルレベルの意味的特徴を併用することで、最高品質の再構築が達成され、ISが最高の32.97、SSIMが0.251を記録した。
  • 定性的な結果から、NeuroImagenは意味的に整合性があり、構造的に正確な画像を生成しており、視覚的忠実度においてBrain2Image や NeuroVision といったベースラインを上回った。
Figure 2: Examples of ground-truth images, label captions, and BLIP captions, respectively.
Figure 2: Examples of ground-truth images, label captions, and BLIP captions, respectively.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。