Skip to main content
QUICK REVIEW

[論文レビュー] Closed-Form Training of Conditional Random Fields for Large Scale Image Segmentation

Alexander Kolesnikov, Matthieu Guillaumin|arXiv (Cornell University)|Mar 27, 2014
Advanced Image and Video Retrieval Techniques参考文献 27被引用数 10
ひとこと要約

本論文は、反復的な確率的推論に代わり、効率的な回帰問題に置き換えることで、スケーラブルな大規模画像セグメンテーションデータセットにおける条件付きランダムフィールド(CRF)の閉形式で推論フリーな学習手法であるLS-CRFを提案する。この手法は、18万枚を超える画像を含む大規模データセットで最先端の性能を達成し、非線形モデルおよび半教師付き学習を用いた大規模CRF学習が実現可能で効果的であることを示している。

ABSTRACT

We present LS-CRF, a new method for very efficient large-scale training of Conditional Random Fields (CRFs). It is inspired by existing closed-form expressions for the maximum likelihood parameters of a generative graphical model with tree topology. LS-CRF training requires only solving a set of independent regression problems, for which closed-form expression as well as efficient iterative solvers are available. This makes it orders of magnitude faster than conventional maximum likelihood learning for CRFs that require repeated runs of probabilistic inference. At the same time, the models learned by our method still allow for joint inference at test time. We apply LS-CRF to the task of semantic image segmentation, showing that it is highly efficient, even for loopy models where probabilistic inference is problematic. It allows the training of image segmentation models from significantly larger training sets than had been used previously. We demonstrate this on two new datasets that form a second contribution of this paper. They consist of over 180,000 images with figure-ground segmentation annotations. Our large-scale experiments show that the possibilities of CRF-based image segmentation are far from exhausted, indicating, for example, that semi-supervised learning and the use of non-linear predictors are promising directions for achieving higher segmentation accuracy in the future.

研究の動機と目的

  • 従来のCRF学習における計算ボトル neck を解消すること。これは、繰り返し確率的推論に依存しており、大規模でループを含むモデルには非現実的である。
  • 最適化中に反復的推論の必要性を排除することで、10万枚以上の画像を含むデータセットにおけるCRFの学習を可能にすること。
  • 大規模学習がCRF性能に与える影響を調査すること。特に、ペairwiseポテンシャル、非線形パrameterization、および半教師付き学習の観点から検討する。
  • 将来の研究を支援するため、18万枚を超える画像と図背景アノテーションを含む2つの新しい大規模ベンチマークデータセットを構築・公開すること。

提案手法

  • LS-CRFは、木構造のグラフィカルモデルから導かれる閉形式解を活用して、CRFパラメータ学習を独立した回帰問題の集合に再定式化する。
  • スーパーピクセルグラフの各エッジに対して、ラベルの組み合わせに基づいた学習サブ問題を構築し、回帰によって条件付き確率を予測する。
  • 線形CRFパラメータは閉形式の最小二乗解または共役勾配などの反復的ソルバーを用いて計算可能であり、非線形パラメータ化もサポートされる。
  • この手法は、学習を独立したサブ問題に分解でき、並列化が可能となり、従来のCRF学習と比較して著しく訓練時間を短縮する。
  • 推論段階では、学習済みの回帰器がペairwise項のエネルギー値を予測し、その後、標準的なMAP推論でセグメンテーションに使用される。
  • クラスの不均衡への柔軟な対処が可能であり、クラスバランスの取れたサンプリング、個々のサンプルへの重み付け、およびクラスの不均衡の処理が可能である。

実験結果

リサーチクエスチョン

  • RQ1反復的推論を排除することで、10万枚以上の画像を含むデータセットにおけるCRF学習をスケーラブルにできるか?
  • RQ2ペairwise CRFポテンシャルを用いた場合、学習データサイズを増加させることでセグメンテーション精度が顕著に向上するか?
  • RQ3CRFにおける非線形パラメータ化は、有効に学習可能であり、線形モデルよりも優れたセグメンテーション性能を達成できるか?
  • RQ4ボクシングボックスや画像単位のラベルから自動生成されたアノテーションを用いた半教師付き学習は、CRFベースの画像セグメンテーションの性能向上に有効か?

主な発見

  • ペアワイズ項を含むDogSegデータセットの全量でLS-CRFを学習したところ、24コアのワークステーションで45分を要した。一方、単一項のみのモデルでは20分で完了した。これは、スケーラビリティを示している。
  • 非線形LS-CRFモデルは線形モデルよりも高いセグメンテーション精度を達成しており、表現力の向上が性能向上に寄与していることが示された。
  • 訓練データセットが大きくなるに従い、単一項モデルとペアワイズモデルの性能差が拡大した。これは、データ量が増えるほどペアワイズ項の利点が顕著になることを示している。
  • ボクシングボックスや画像単位のラベルから自動生成されたアノテーションを用いた半教師付き学習では、クラス別精度が82.0–83.9%に達し、手動アノテーションで学習した場合と同等の性能を示した。
  • 画像単位のラベルのみを含む画像を学習に含めると、わずかに性能が低下した。これは、このようなアノテーションにノイズが含まれる可能性を示唆しているが、依然として有用な信号を提供していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。