Skip to main content
QUICK REVIEW

[論文レビュー] An Artificial Agent for Robust Image Registration

Rui Liao, Shun Miao|arXiv (Cornell University)|Nov 30, 2016
Medical Image Segmentation Techniques参考文献 26被引用数 13
ひとこと要約

本論文では、直接的なパrameter回帰ではなく、逐次的かつポリシー駆動の行動を通じて3次元医用画像のアライメントを実行する、深層強化学習にインspiredされた人工エージェントを提案する。階層的アテンションを用いたグリーディな教師あり学習アプローチにより、最適化の非凸なコスト関数や画像アーチファクトに悩まされる状況でも、最先端の手法を上回る精度と頑健性を達成する。特に、視野の大きな違いや深刻な画像アーチファクトを伴う状況で顕著な優位性を示す。

ABSTRACT

3-D image registration, which involves aligning two or more images, is a critical step in a variety of medical applications from diagnosis to therapy. Image registration is commonly performed by optimizing an image matching metric as a cost function. However, this task is challenging due to the non-convex nature of the matching metric over the plausible registration parameter space and insufficient approaches for a robust optimization. As a result, current approaches are often customized to a specific problem and sensitive to image quality and artifacts. In this paper, we propose a completely different approach to image registration, inspired by how experts perform the task. We first cast the image registration problem as a "strategy learning" process, where the goal is to find the best sequence of motion actions (e.g. up, down, etc.) that yields image alignment. Within this approach, an artificial agent is learned, modeled using deep convolutional neural networks, with 3D raw image data as the input, and the next optimal action as the output. To cope with the dimensionality of the problem, we propose a greedy supervised approach for an end-to-end training, coupled with attention-driven hierarchical strategy. The resulting registration approach inherently encodes both a data-driven matching metric and an optimal registration strategy (policy). We demonstrate, on two 3-D/3-D medical image registration examples with drastically different nature of challenges, that the artificial agent outperforms several state-of-art registration methods by a large margin in terms of both accuracy and robustness.

研究の動機と目的

  • 非凸なコスト関数や画像アーチファクトに苦しむ従来の最適化ベースの画像アライメント手法の限界を克服すること。
  • 手動で設計されたメトリクスに依存せずに、画像品質の変動や解剖学的複雑さに対して頑健なアライメント手法の開発。
  • 教師あり学習によるデータ駆動ポリシーの学習を通じて、完全に自動的かつエンドツーエンドの3次元画像アライメントを実現すること。
  • CT-CBCT脊椎および心臓画像の重度のアーチファクトを伴う困難な状況でも、アライメントの精度と収束性を向上させること。
  • 効果的なデータオーグメンテーションおよびサンプリング戦略により、大規模なラベル付きデータへの依存度を低減すること。

提案手法

  • アライメントのタスクを、画像の整合性を向上させるために最適な動きの行動(例:上、下、回転)を選択するエージェントによる逐次的意思決定プロセスに再定式化する。
  • 深層畳み込みニューラルネットワークが3次元の生画像入力を次の最良の行動にマップし、データ駆動のマッチングメトリクスと最適なアライメント戦略を暗黙的にエンコードするポリシーを学習する。
  • エージェントは、標準的な深層強化学習よりも効率的で、メモリ使用量も著しく少ない、グリーディな教師あり学習(DSL)フレームワークを用いて訓練される。
  • 粗い解像度の画像レイヤーから始め、徐々に高解像度でのアライメントを精錬する階層的戦略が採用され、頑健性が向上する。
  • 報酬形状化機構が用いられ、エージェントは真値変換に近づくとボーナス報酬を受け取る。割引率γと報酬閾値Rは、収束を保証するために慎重に設定されている。
  • 限られたラベル付きトレーニングペアでも一般化性能を向上させるために、特に真値変換周辺でのターゲットドサンプリングとデータオーグメンテーションが適用されている。

実験結果

リサーチクエスチョン

  • RQ1深層学習エージェントは、従来の最適化ベース手法を上回るロバストでデータ駆動のアライメントポリシーを学習できるか?
  • RQ2標準的な深層強化学習と比較して、グリーディな教師あり学習アプローチは、画像アライメントの文脈で、効率性、メモリ使用量、パフォーマンスの観点でどのように異なるか?
  • RQ3階層的でマルチスケールの戦略は、視野の大きな違いや画像アーチファクトが存在する状況で、アライメントの精度と頑健性をどの程度向上できるか?
  • RQ4エージェントは、重度のアーチファクトと低コントラストの軟部組織を伴う臨床的課題(例:CT-CBCT脊椎および心臓画像)に一般化できるか?
  • RQ5限られた数のラベル付きトレーニングペアしかない状況で、ターゲットドサンプリングとオーグメンテーションの影響はモデルパフォーマンスにどのような影響を与えるか?

主な発見

  • 本手法は、2つの挑戦的な3次元/3次元医用画像アライメントタスクにおいて、複数の最先端手法を精度と頑健性の両面で上回った。
  • 人間の専門家ですら、微細な外見の違いや深刻なアーチファクトのため困難に感じることのある状況でも、優れた性能を発揮した。
  • グリーディな教師あり学習スキームにより、標準的な深層強化学習と比較して、メモリ使用量とトレーニング時間が著しく削減されたが、高いパフォーマンスを維持した。
  • 階層的フレームワークにより、サイクル運動を伴わず安定した収束が達成された。これは、非凸なパrameter空間内での効果的なナビゲーションを示唆している。
  • エージェントは画像品質の変動に対しても頑健であり、脊椎アライメントタスクではわずか8%の失敗率を示し、強力な一般化能力を示した。
  • 理論的分析により、エージェントが真値に近づくと行動価値関数が1/(1−γ)に収束することが確認され、学習されたポリシーの安定性と最適性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。