Skip to main content
QUICK REVIEW

[論文レビュー] A Spatial Mapping Algorithm with Applications in Deep Learning-Based Structure Classification

Thomas Corcoran, Rafael Zamora‐Resendiz|arXiv (Cornell University)|Feb 7, 2018
Cell Image Analysis Techniques参考文献 14被引用数 6
ひとこと要約

本論文では、空間充填曲線を用いて3次元構造的データを1次元および2次元グリッドに変換する空間マッピングアルゴリズムを提案する。これにより、複雑な3次元データに対して1次元および2次元畳み込みニューラルネットワーク(CNN)の効率的な学習が可能になる。この手法は、重要な3次元特徴を保持し、学習時間を短縮し、より高い解像度の入力データを扱えるほか、ボリュメトリックCNNよりも多くのデータチャネルをサポートする。Rasタンパク質スーパーファミリー分類タスクにおいて、構造的忠実度の損失を最小限に抑えながら優れた性能を示している。

ABSTRACT

Convolutional Neural Network (CNN)-based machine learning systems have made breakthroughs in feature extraction and image recognition tasks in two dimensions (2D). Although there is significant ongoing work to apply CNN technology to domains involving complex 3D data, the success of such efforts has been constrained, in part, by limitations in data representation techniques. Most current approaches rely upon low-resolution 3D models, strategic limitation of scope in the 3D space, or the application of lossy projection techniques to allow for the use of 2D CNNs. To address this issue, we present a mapping algorithm that converts 3D structures to 2D and 1D data grids by mapping a traversal of a 3D space-filling curve to the traversal of corresponding 2D and 1D curves. We explore the performance of 2D and 1D CNNs trained on data encoded with our method versus comparable volumetric CNNs operating upon raw 3D data from a popular benchmarking dataset. Our experiments demonstrate that both 2D and 1D representations of 3D data generated via our method preserve a significant proportion of the 3D data's features in forms learnable by CNNs. Furthermore, we demonstrate that our method of encoding 3D data into lower-dimensional representations allows for decreased CNN training time cost, increased original 3D model rendering resolutions, and supports increased numbers of data channels when compared to purely volumetric approaches. This demonstration is accomplished in the context of a structural biology classification task wherein we train 3D, 2D, and 1D CNNs on examples of two homologous branches within the Ras protein family. The essential contribution of this paper is the introduction of a dimensionality-reduction method that may ease the application of powerful deep learning tools to domains characterized by complex structural data.

研究の動機と目的

  • 構造生物学などの分野における、高解像度でスパースな3次元構造的データを扱う際の3次元CNNの限界を解消すること。
  • 空間充填曲線を用いた変換により、3次元データを低次元表現に変換することで、1次元および2次元CNNを3次元データに効率的に適用可能とすること。
  • 従来のボリュメトリックCNNと比較して、学習時間の短縮、入力解像度の向上、データチャネル容量の増加を実現すること。
  • 1次元/2次元空間から3次元空間への逆マッピングを可能にすることで、特徴可視化のための類似性マップの解釈可能性を高めること。
  • 3次元構造的データと既存の深層学習ツールを接続するスケーラブルで一対一対応の符号化手法を提供すること。

提案手法

  • 空間充填曲線(ヒルベルト曲線やZ-orderなど)を用いて、3次元グリッド座標を1次元および2次元のシーケンスにマッピングし、空間的局所性を保持する。
  • 3次元構造のバイジェクティブな走査を2次元または1次元の曲線に変換し、3次元データをトポロジー関係を維持するグリッドに変換する。
  • 得られた1次元および2次元表現を、標準的な1次元および2次元CNNに供給し、符号化されたデータから階層的特徴を学習する。
  • メモリおよび計算負荷の低減により、ボリュメトリック3次元CNNと比較して、より高い解像度の入力データおよび増加したデータチャネル数をサポートできる。
  • 符号化プロセスは可逆であり、2次元または1次元の類似性マップから3次元の注目マップを再構築できるため、解釈可能性が向上する。
  • 実験では、KerasとTensorFlow 1.2を用い、Rasタンパク質スーパーファミリーのデータを用いて、3次元、2次元、1次元CNNの比較的評価を実施した。

実験結果

リサーチクエスチョン

  • RQ1空間充填曲線で符号化された3次元データを学習対象とする1次元および2次元CNNは、元の3次元データを用いた3次元CNNと同等の分類性能を達成できるか?
  • RQ2提案手法によるマッピングは、低次元表現における有効な特徴学習を可能にする十分な3次元構造的特徴を保持しているか?
  • RQ3ボリュメトリックCNNと比較して、学習時間、入力解像度、データチャネル容量の観点で、本手法はどのように差をつけるか?
  • RQ41次元および2次元ネットワークから得た類似性マップを逆方向に変換することで、意味のある3次元注目マップを生成できるか?
  • RQ5このマッピング手法で符号化されたデータを学習する際、パラメータ設定を最適化すると性能が最大限に向上するか?

主な発見

  • マッピングされたデータを学習対象とする1次元および2次元CNNは、Rasタンパク質スーパーファミリーのベンチマークにおいて、3次元CNNと同等の分類性能を達成した。
  • ボリュメトリック3次元CNNと比較して、学習時間を顕著に短縮でき、モデルの反復的改善が高速化された。
  • メモリおよび計算負荷の低減に起因し、より高い入力解像度と増加したデータチャネル数をサポートできた。
  • マッピングのバイジェクティブ性のおかげで、類似性マップの逆変換が可能となり、1次元および2次元ネットワークが学習した特徴の3次元可視化が実現した。
  • 本手法は、既存の2次元および1次元の深層学習ツールを、重要な構造的情報の損失なしに、複雑な3次元構造的データに適用可能であることを示した。
  • 今後の応用として、酵素分類、タンパク質-リガンド結合予測、タンパク質モデルスコアリングへの応用が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。