Skip to main content
QUICK REVIEW

[論文レビュー] Convolutional Neural Generative Coding: Scaling Predictive Coding to Natural Images

Alexander G. Ororbia, Ankur Mali|arXiv (Cornell University)|Nov 22, 2022
Cell Image Analysis Techniques被引用数 9
ひとこと要約

この論文では、予測符号化フレームワーク内に畳み込み層と逆畳み込み層を組み込んだ、脳にインspiredされた非教師あり画像処理モデルであるConv-NGCを提案する。このモデルは、内部表現を反復的に精緻化する。バックプロパゲーションに依存しない局所的で生物学的に妥当な学習ルールを用いるため、バックプロパゲーションに起因する生物学的不実現性や計算上のボトル neck を回避する。画像再構成およびノイズ除去のタスクにおいて、性能が競争的であり、分布外データにおいてはバックプロパゲーションで訓練されたオートエナボーダーを上回る。

ABSTRACT

In this work, we develop convolutional neural generative coding (Conv-NGC), a generalization of predictive coding to the case of convolution/deconvolution-based computation. Specifically, we concretely implement a flexible neurobiologically-motivated algorithm that progressively refines latent state feature maps in order to dynamically form a more accurate internal representation/reconstruction model of natural images. The performance of the resulting sensory processing system is evaluated on complex datasets such as Color-MNIST, CIFAR-10, and Street House View Numbers (SVHN). We study the effectiveness of our brain-inspired model on the tasks of reconstruction and image denoising and find that it is competitive with convolutional auto-encoding systems trained by backpropagation of errors and outperforms them with respect to out-of-distribution reconstruction (including the full 90k CINIC-10 test set).

研究の動機と目的

  • バックプロパゲーションの生物学的不実現性と計算上のボトル neck を回避する、生物学的に妥当な非教師あり画像処理システムの開発。
  • 畳み込みおよび逆畳み込み演算をフレームワークに直接統合することで、予測符号化を自然画像にスケーラブルに拡張すること。
  • 局所的な誤差信号とリサイクルブロック構造を用いて、潜在特徴マップの動的かつ反復的な精緻化を可能にすること。
  • CIFAR-10 や SVHN といった複雑なデータセットを用いた評価を行い、特に分布外一般化性能を検証すること。
  • グローバルな誤差フィードバックやバックプロパゲーションを一切使用しないにもかかわらず、バックプロパゲーションで訓練されたオートエナボーダーと同等の性能を達成すること。

提案手法

  • Conv-NGC は、上位からの生成的経路と下位からの誤差信号を備えた階層的予測符号化アーキテクチャを採用し、画像表現を畳み込み層と逆畳み込み層でモデル化する。
  • 状態更新は、調整係数 β と漏れ付き統合(γ を用いて)により制御され、予測と補正ステップを繰り返し、潜在状態の特徴マップを反復的に精緻化する。
  • 誤差信号は、学習不能なマルチステップ経路(式 11 により)を経由して伝搬され、バックプロパゲーションを用いずに高速かつ局所的な誤差伝搬を実現する。
  • 複雑な変換をモデル化するためのリサイクルブロック構造を採用し、摂動ベクトル(式 8–11)を介して中間層へ誤差信号を伝搬する。
  • 新しい学習ルール(式 12)は、再帰的 LRA を用いて重みと誤差フィルタを更新する。ΔW と ΔE は、拡張された転置畳み込みと下位層からの誤差信号を用いて計算される。
  • モデルは局所的でバックプロパゲーションに依存しない信用配分メカニズムを用いて訓練されるため、神経形状ハードウェアに適しており、並列処理のスケーラビリティも高い。

実験結果

リサーチクエスチョン

  • RQ1畳み込み層と逆畳み込み層を用いることで、予測符号化を自然画像に効果的にスケーリングできるか?
  • RQ2局所的に学習された生物学的に妥当な信用配分メカニズムは、再構成およびノイズ除去タスクにおいてバックプロパゲーションを上回る性能を示すか?
  • RQ3標準的なオートエナボーダーと比較して、このモデルは分布外データへの一般化性能が優れているか?
  • RQ4マルチステップ誤差伝搬を備えたリサイクルブロックは、バックプロパゲーションを用いないフレームワークにおいて表現学習を向上させられるか?
  • RQ5グローバルな誤差フィードバックやバックプロパゲーションを一切使用せずに、画像再構成において競争可能な性能を達成できるか?

主な発見

  • Conv-NGC は、CIFAR-10 および SVHN において、類似したアーキテクチャを持つバックプロパゲーションで訓練されたオートエナボーダーと同等またはそれ以上の再構成性能を達成する。
  • 90k の CINIC-10 テストセット全体において、Conv-NGC は分布外再構成においてバックプロパゲーションベースのモデルを上回り、優れた一般化性能を示す。
  • モデルは強力なノイズ除去性能を示し、グローバルな誤差信号を一切使用せず、局所的な誤差信号のみでノイズの多い入力から綺麗な画像を効果的に回復できる。
  • 重み更新に再帰的 LRA を用いることで、バックプロパゲーションを一切使用せずに安定的かつ効率的な学習が可能となり、バックプロパゲーションで訓練された ResNet と同等の性能を達成する。
  • マルチステップ誤差伝搬経路(式 11)は、誤差の流れを前方計算から明確に分離できており、効率的で柔軟な学習を可能にする。
  • 予測符号化に逆畳み込み層を統合することで、視覚タスクにおける表現力が著しく向上し、本研究が文献上初の実装である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。