[論文レビュー] How to represent part-whole hierarchies in a neural network
この論文では、空間的位置に跨る同一埋め込みベクトルの島を用いて画像内の部分-全体階層を表現するニューラルネットワークアーキテクチャGLOMを提案する。これにより、動的重み割り当てを必要とせず、動的解析が可能になる。トランスフォーマー、カプセル、ニューラルフィールド、対照学習を統合することで、反復的なボトムアップ、トップダウン、および横方向の注意メカニズムを経て、安定的かつ視点不変の表現を形成し、視覚的表現の解釈可能性を顕著に向上させる。
This paper does not describe a working system. Instead, it presents a single idea about representation which allows advances made by several different groups to be combined into an imaginary system called GLOM. The advances include transformers, neural fields, contrastive representation learning, distillation and capsules. GLOM answers the question: How can a neural network with a fixed architecture parse an image into a part-whole hierarchy which has a different structure for each image? The idea is simply to use islands of identical vectors to represent the nodes in the parse tree. If GLOM can be made to work, it should significantly improve the interpretability of the representations produced by transformer-like systems when applied to vision or language
研究の動機と目的
- 入力ごとに構造が異なる部分-全体階層に画像を動的に解析できるニューラルネットワークアーキテクチャを設計すること。
- 構造的・構成的関係を符号化することで、視覚および言語分野におけるトランスフォーマー型システムの解釈可能性を向上させること。
- 固定されたニューラルハードウェア割り当ての制限を、パースツリーのノードを表す共有埋め込みベクトルを用いることで克服すること。
- 連続的ベクトル空間を用いて、ゲシュタルト心理学の場的知覚と記号的AIの構造的記述を統合すること。
- 各階層レベルで一貫性があり安定した類似ベクトルの島を形成するよう促す正則化を用いたエンドツーエンド学習を可能とすること。
提案手法
- 各カラムに空間的に局所的な自己符号化器のスタックを用い、すべてのカラムで重みを共有することで、画像パッチから階層的表現を学習する。
- 隣接するレベルの埋め込みを予測するためのボトムアップおよびトップダウンニューラルネットワークを適用し、予測結果を監視信号として用いる。
- 同じレベルの近接するカラム間で横方向の注意を適用し、ほぼ同一の埋め込みベクトルの島を形成する。
- 各タイムステップで、ボトムアップ予測、トップダウン予測、以前の埋め込み、および平均化された横方向の近隣の重み付き平均として、各埋め込みを更新する。
- 予測された埋め込みと実際の埋め込みの一致を最大化する正則化を導入し、安定した島の形成を促進する。
- マスクされた画像再構成と対照的正則化を用いたエンドツーエンド学習により、階層的構造を学習する。

実験結果
リサーチクエスチョン
- RQ1固定されたアーキテクチャを持つニューラルネットワークが、入力ごとに異なる部分-全体階層に画像を動的に解析できるか?
- RQ2専用のニューロンや重みを割り当てることなく、同一埋め込みベクトルの島がパースツリーのノードを表せるか?
- RQ3ボトムアップおよびトップダウンの予測をどのように用いることで、一貫性があり、視点不変の表現を形成できるか?
- RQ4対照的正則化と横方向の注意が、対応する知覚的全体に対応する、安定的かつ局所化された類似ベクトルのクラスタを促進できるか?
- RQ5GLOMのようなシステムは、深層学習の帰納的バイアスを維持しつつ、記号的システムと同等の解釈可能性を達成できるか、その程度はどの程度か?
主な発見
- GLOMアーキテクチャは、各階層レベルで明確に分離された、ほぼ同一の埋め込みベクトルの島を形成しており、高レベルではより大きな島が形成されており、部分が全体に一貫してグループ化されていることが示された。
- 横方向の注意と正則化された予測一致によって、島の類似性が生じており、動的重み割り当てや明示的なポインタ構造を必要としていない。
- 欠損領域のある画像の再構成が可能であるため、エンドツーエンド学習により意味のある階層的表現を学習できることを示している。
- 連続的ベクトル類似度を用いることで、ゲシュタルト的場的知覚と記号的構造記述を統合し、階層的関係を符号化している。
- 学習済み埋め込みの連続的空間に直接構造的記述を埋め込むことで、神経記号的インターフェースの必要性を回避している。
- 現時点では動作する実装は存在しないが、設計から、GLOMは共同でのテストで確認されたように、新規の視点への形状認識の一般化が可能であると示唆されている。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。