Skip to main content
QUICK REVIEW

[論文レビュー] Federated Semi-Supervised Learning for COVID Region Segmentation in Chest CT using Multi-National Data from China, Italy, Japan

Dong Yang, Ziyue Xu|arXiv (Cornell University)|Nov 23, 2020
COVID-19 diagnosis using AI参考文献 61被引用数 11
ひとこと要約

本論文は、中国、イタリア、日本からの多国籍データを用いて、3次元胸部CTスキャンにおけるCOVID-19影響領域のセグメンテーションを目的としたフェデレーテッド半教師あり学習フレームワークを提案する。研究機関間で生データを共有せずに、ラベル付きおよびラベルなしスキャンを統合して協働的にモデル学習を可能にすることで、一般化性能の向上とプライバシー保護を実現し、中央集権的なデータ共有を伴う従来の教師あり手法を上回る性能を達成した。

ABSTRACT

The recent outbreak of COVID-19 has led to urgent needs for reliable diagnosis and management of SARS-CoV-2 infection. As a complimentary tool, chest CT has been shown to be able to reveal visual patterns characteristic for COVID-19, which has definite value at several stages during the disease course. To facilitate CT analysis, recent efforts have focused on computer-aided characterization and diagnosis, which has shown promising results. However, domain shift of data across clinical data centers poses a serious challenge when deploying learning-based models. In this work, we attempt to find a solution for this challenge via federated and semi-supervised learning. A multi-national database consisting of 1704 scans from three countries is adopted to study the performance gap, when training a model with one dataset and applying it to another. Expert radiologists manually delineated 945 scans for COVID-19 findings. In handling the variability in both the data and annotations, a novel federated semi-supervised learning technique is proposed to fully utilize all available data (with or without annotations). Federated learning avoids the need for sensitive data-sharing, which makes it favorable for institutions and nations with strict regulatory policy on data privacy. Moreover, semi-supervision potentially reduces the annotation burden under a distributed setting. The proposed framework is shown to be effective compared to fully supervised scenarios with conventional data sharing instead of model weight sharing.

研究の動機と目的

  • 病院間のデータの非同一性に起因するドメインシフトの問題に対処する。これは、COVID-19 CT画像解析におけるディープラーニングモデルに影響を及ぼす。
  • 患者データの機微性に起因するデータ共有の制限やアノテーション不足の課題を克服する。これにより、機微な患者データを転送せずに協働学習を可能にする。
  • ラベル付きおよびラベルなしスキャンを活用する半教師あり学習により、複数の国から得たデータを用いてアノテーション負荷を軽減する。
  • 多国籍データを用いたフェデレーテッドラーニングにより、多様な人種的背景、画像撮影プロトコル、機器差異を考慮したモデルの頑健性と一般化性能を向上させる。
  • ドメインにインスパイアされた表現学習により、非COVIDデータセット(例:日本の非COVIDデータセット)が偽陽性の排除に寄与することを示す。

提案手法

  • 生CTスキャンを共有せずに、中国、イタリア、日本における3か国の国際的機関間で、フェデレーテッドラーニング(FL)を用いて深層ニューラルネットワークを学習する。
  • ラベル付きスキャン(専門放射線科医が945例アノテート)とラベルなしスキャン(合計759例)を含む同一の多国籍コhortを用いて、半教師あり学習を統合する。
  • ラベルなしデータに対してコントラスト型自己教師あり学習の目的関数を用い、特徴表現とモデル一般化性能の向上を図る。
  • 生データを送信せず、モデル重みと勾配のみをやり取りするクライアント・サーバー型FL通信プロトコルを実装し、データプライバシーを保護する。
  • 共有エンコーダとタスク固有のヘッドを備えたマルチブランチネットワークアーキテクチャを採用し、セグメンテーションと自己教師あり学習の両方の目的を同時に処理する。
  • 通信効率を最適化するため、集約頻度(5、10、20、40エポックごと)を調整し、性能と帯域制限のバランスを取る。

実験結果

リサーチクエスチョン

  • RQ1複数の国に分散したデータ(品質やアノテーションの可用性にばらつきがある)を対象としたフェデレーテッド半教師あり学習が、胸部CTにおけるCOVID-19影響領域のセグメンテーション性能を効果的に向上させることができるか?
  • RQ2非COVID機関(例:日本の非COVIDデータセット)からのラベルなしデータの統合が、モデルの一般化性能と偽陽性の低減に与える影響は何か?
  • RQ3教師ありおよび自己教師ありクライアントの両方の性能をバランスさせるために、フェデレーテッドラーニングにおける最適な集約頻度は何か?
  • RQ41か国の限られたラベル付きデータから学習したモデルが、異なる画像撮影プロトコルや患者デモグラフィックに差がある他の国へ一般化できる程度はどの程度か?
  • RQ5プライバシー保護型フェデレーテッドフレームワークは、データ共有を伴う従来の中央集権的トレーニングに比べ、ドメイン間でのモデルの頑健性と一般化性能において優れていると言えるか?

主な発見

  • 提案されたフェデレーテッド半教師あり学習フレームワークは、中央集権的なデータ共有を伴う完全教師ありモデルと比較して、一般化性能が優れていた。これは、データの55%しかラベルが付与されていなくても同様の結果を達成した。
  • アノテーションなしの非教師ありクライアント(unsupervised client)における性能は、モデル集約頻度を5エポックごと(より頻繁に)にすることで著しく向上した。これは、自己教師あり学習が頻繁な重み同期によって恩恵を受けることを示している。
  • モデルはドメインシフトに対して頑健であった。1か国のデータで学習したモデルでも、異なる画像撮影プロトコルや患者デモグラフィックを持つ他の国からのスキャンに対しても良好に一般化した。
  • 日本の非COVIDデータセットの統合により、モデルの偽陽性の排除能力が向上した。これは、ドメインにインスパイアされた表現学習が特異性を高めることを示している。
  • アブレーションスタディにより、集約頻度の上昇が自己教師ありクライアントのトレーニング安定性と性能を向上させることを確認したが、教師ありクライアントの性能にはわずかな損失を伴った。
  • 3次元可視化により、モデルが臨床的COVID-19画像所見に一致する両側性・多巣巣性のグランドグラス状混濁および実質化を正確にセグメンテーションしていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。