Skip to main content
QUICK REVIEW

[論文レビュー] Distributed Weight Consolidation: A Brain Segmentation Case Study

Patrick McClure, Charles Zheng|PubMed|May 28, 2018
Domain Adaptation and Few-Shot Learning参考文献 30被引用数 5
ひとこと要約

本稿では、連続的学習のための分散重み統合(DWC)を提案する。DWCは、プライバシー、倫理的、法的制約により共有できない非重複するsMRIデータセットから、独立して学習された深層ニューラルネットワークを統合する手法であり、順次学習やモデルアンサンブルを必要としない。DWCは個々の施設での一般化性能を向上させるとともに、大規模な独立したマルチサイトデータセットでも優れた性能を維持し、アンサンブルベースラインを上回る施設固有のテスト性能を達成しながら、一般化性能を保持する。

ABSTRACT

Collecting the large datasets needed to train deep neural networks can be very difficult, particularly for the many applications for which sharing and pooling data is complicated by practical, ethical, or legal concerns. However, it may be the case that derivative datasets or predictive models developed within individual sites can be shared and combined with fewer restrictions. Training on distributed data and combining the resulting networks is often viewed as continual learning, but these methods require networks to be trained sequentially. In this paper, we introduce distributed weight consolidation (DWC), a continual learning method to consolidate the weights of separate neural networks, each trained on an independent dataset. We evaluated DWC with a brain segmentation case study, where we consolidated dilated convolutional neural networks trained on independent structural magnetic resonance imaging (sMRI) datasets from different sites. We found that DWC led to increased performance on test sets from the different sites, while maintaining generalization performance for a very large and completely independent multi-site dataset, compared to an ensemble baseline.

研究の動機と目的

  • プライバシー、倫理的、法的制約により、共有できない分散型の臨床神経画像データに対して深層ニューラルネットワークを学習する課題に対処すること。
  • 中央集権的なデータ共有や順次学習を必要とせずに、複数の施設で独立して学習されたモデルの知識を統合する手法を開発すること。
  • 個々の施設のテストデータセットにおけるモデルの一般化性能を向上させるとともに、完全に独立した大規模なマルチサイトデータセットでも性能を維持すること。
  • モデルアンサンブルや順次的継続的学習のスケーラブルな代替手法として、分散型医療画像応用に適した手法を提供すること。

提案手法

  • DWCは、異なるsMRIデータセットから独立して学習された3次元拡張畳み込みニューラルネットワーク(MeshNetベース)の重みを統合するために、変分推論フレームワークを用いる。
  • 重みの統合を、ネットワーク重み上の後方分布として定式化し、効率的な最適化を可能にするため、平均場近似を用いる。
  • 重みに共通の事前分布を導入することで、直接的なデータ共有なしに、施設間での知識移転を可能にする。
  • 推論時に期待出力を近似するために、モンテカルロサンプリング(10サンプル)を用いた確率的勾配降下法を適用する。
  • 従来の継続的学習とは異なり、非順次的統合が可能である:複数の施設からのモデルを任意の順序で組み合わせることができる。
  • 最終的な推論ネットワークとして、統合モデルのMAP推定値を用い、保留されたテストセットで評価する。

実験結果

リサーチクエスチョン

  • RQ1非重複するsMRIデータセット上で独立して学習された深層ニューラルネットワークの知識を、効果的に統合することで、個別施設のテストセットでの性能向上が達成できるか?
  • RQ2ベースライン手法と比較して、統合モデルは完全に独立した大規模なマルチサイトデータセットでも一般化性能を維持するか?
  • RQ3DWCは、モデルアンサンブルや順次的継続的学習と比較して、性能およびデータセットの順序に対するロバスト性において優れているか?
  • RQ4データ共有が制限されるがモデル共有が可能な医療画像タスクに、DWCを効果的に適用できるか?
  • RQ5非順次的統合が、多様な神経画像施設におけるモデル性能に与える影響は何か?

主な発見

  • DWCは、HCP、NKI、Buckner、WU120データセット全体で重み付き平均Diceスコア78.30を達成し、アンサンブルベースライン(p = 1.66e-15)を有意に上回った。
  • ABIDEデータセットにおけるDWCのDiceスコア(70.76)は、アンサンブルと有意差がなく(p = 0.733)、独立したデータに対する一般化性能の劣化がないことを示した。
  • DWCの性能はVCLと同等の範囲に収まり、順次的継続的学習よりもデータセット順序に敏感ではなかった。大規模データセットを最後に学習した場合の重み付き平均スコアは78.28であったのに対し、VCLは75.95であった。
  • 視覚的検査では、DWCによるセグメンテーションが正解に非常に近く、主に領域境界で誤差が生じており、高性能なHNBW_MAPモデルと同様の傾向を示した。
  • 本手法は、4つの異なる施設(HCP、NKI、Buckner、WU120)からのモデルを1つのモデルに統合し、すべての施設および独立したデータセットで良好な一般化性能を達成した。
  • 変分推論とモンテカルロサンプリングの組み合わせにより、統合モデルの期待出力の堅牢な推定が可能となり、信頼性の高い推論が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。