[論文レビュー] FedDropoutAvg: Generalizable federated learning for histopathology image classification
本稿では、フェデレーテッド・ラーニングにおけるヒストパスロジー画像分類のための新規フレームワークであるFedDropoutAvgを提案する。この手法は、フェデレーテッド・アベーリージング中にランダムなクライアント選択とランダムなパラメータドロップアウトを導入することで、モデルの汎化性能を向上させる。1.2M枚の画像を含む21施設にまたがるマルチセンター・データセットにおいて、中央集権的学習と同等の性能を達成し、標準的なFedAvgおよびFedProxを上回る、未学習の施設への汎化性能を示した。
Federated learning (FL) enables collaborative learning of a deep learning model without sharing the data of participating sites. FL in medical image analysis tasks is relatively new and open for enhancements. In this study, we propose FedDropoutAvg, a new federated learning approach for training a generalizable model. The proposed method takes advantage of randomness, both in client selection and also in federated averaging process. We compare FedDropoutAvg to several algorithms in an FL scenario for real-world multi-site histopathology image classification task. We show that with FedDropoutAvg, the final model can achieve performance better than other FL approaches and closer to a classical deep learning model that requires all data to be shared for centralized training. We test the trained models on a large dataset consisting of 1.2 million image tiles from 21 different centers. To evaluate the generalization ability of the proposed approach, we use held-out test sets from centers whose data was used in the FL and for unseen data from other independent centers whose data was not used in the federated training. We show that the proposed approach is more generalizable than other state-of-the-art federated training approaches. To the best of our knowledge, ours is the first study to use a randomized client and local model parameter selection procedure in a federated setting for a medical image analysis task.
研究の動機と目的
- 分散化され、異種性のあるデータが特徴であるマルチサイトのヒストパスロジー画像分類におけるフェデレーテッド・ラーニングにおけるモデルの汎化性能の向上に取り組む。
- データサイズの重み付けに依存する標準的なフェデレーテッド・アベーリージング(FedAvg)およびFedProxの限界を克服する。これらは、データの不均衡や品質のばらつきにより、過小適合を引き起こす可能性がある。
- 各施設のデータ品質や性能に関する事前知識が不要な、耐性性と汎化性能の向上を図る手法を開発する。
- 提案手法の評価を、学習に参加した施設のホールドアウトテストセットおよび未学習の施設からの独立テストセットを用いて行い、実世界への展開可能性を検証する。
提案手法
- FedDropoutAvgは、各フェデレーテッド学習ラウンドの開始時にランダムなクライアント選択を導入し、通信および計算負荷を低減する。
- 集約処理の段階で、選択されたクライアントからのモデルパラメータに対してランダムドロップアウトを適用し、平均化の前に確率的要因を導入することで、汎化性能を向上させる。
- 各クライアントで完全なモデルをローカルに訓練することで、モデル容量を保持し、ドロップアウトはグローバル集約時でのみ適用する。
- ドロップアウト後の残存パラメータの重み付き平均が集約プロセスとして用いられ、重みはローカルデータサイズに基づく。これはFedAvgと同様の仕組みだが、追加のランダム性を有する。
- 本手法は、勾配平均におけるモーメンタムなどの既存のFL最適化手法と互換性を持つように設計されている。
- 特定のラウンドで選択されなかったクライアントは通信を行わないため、大規模な展開において通信効率が向上する。
実験結果
リサーチクエスチョン
- RQ1フェデレーテッド・アベーリージング中にランダムなクライアント選択とパラメータドロップアウトを導入することで、マルチサイトのヒストパスロジー画像分類におけるモデルの汎化性能が向上するか?
- RQ2FedDropoutAvgは、学習に参加した施設のホールドアウトテストセットおよび未学習の施設のテストセットにおいて、FedAvgおよびFedProxと比較してどの程度の性能を示すか?
- RQ3クライアント参加とパラメータ集約の両方にランダム性を導入することで、データの非同一性および品質のばらつきに対する耐性が向上するか?
- RQ4Rawデータを共有せずに、FedDropoutAvgは中央集権的学習に近い性能を達成できるか?
- RQ5本手法は、実世界のフェデレーテッド環境における通信効率および計算負荷にどのような影響を与えるか?
主な発見
- FedDropoutAvgは、21施設からなる120万枚の画像タイルデータセットにおいて、中央集権的学習に近い分類性能を達成し、FedAvgおよびFedProxを上回った。
- 学習に参加しなかった施設からの独立テストセットにおいて、FedDropoutAvgで訓練されたモデルは、著しく優れた汎化性能を示し、分布外性能の向上が確認された。
- 学習に参加した施設のホールドアウトテストセットおよび未学習の施設のテストセットの両方において、FedDropoutAvgはFedAvgおよびFedProxを上回った。これは、データの非同一性に対する耐性の向上を示している。
- ランダムなクライアント選択により、通信および計算負荷が低減され、参加クライアントのサブセットがラウンドごとに選択されたため、スケーラビリティが向上した。
- 本手法は、医療画像解析におけるフェデレーテッド・ラーニングにおいて、ランダムなクライアントおよびパラメータ選択を適用した初の手法であり、汎化のための新しいパラダイムを提供する。
- 本手法は、完全なモデルをローカルで訓練し、集約時でのみドロップアウトを適用することで、モデル容量を高めている。これは、従来の手法が部分モデルの訓練に依存していたのとは対照的である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。