Skip to main content
QUICK REVIEW

[論文レビュー] Image denoising and restoration with CNN-LSTM Encoder Decoder with Direct Attention

Kazi Nazmul Haque, Mohammad Abu Yousuf|arXiv (Cornell University)|Jan 16, 2018
Image and Signal Denoising Methods参考文献 19被引用数 14
ひとこと要約

この論文では、画像のノイズ除去および修復のための直接アテンションを備えたCNN-LSTMエンコーダデコーダモデルを提案している。CNNは特徴抽出に、LSTMは欠損した画像領域のシーケンスベースの再構成に使用される。重度に損傷を与えたMNISTの数字で訓練されたモデルは、標準的なCNNオートエノードよりも、形状の欠落を効果的に回復し、ノイズを低減することで滑らかでより正確な再構成を達成している。アテンションとRMSE損失最適化により、性能が向上している。

ABSTRACT

Image denoising is always a challenging task in the field of computer vision and image processing. In this paper, we have proposed an encoder-decoder model with direct attention, which is capable of denoising and reconstruct highly corrupted images. Our model consists of an encoder and a decoder, where the encoder is a convolutional neural network and decoder is a multilayer Long Short-Term memory network. In the proposed model, the encoder reads an image and catches the abstraction of that image in a vector, where decoder takes that vector as well as the corrupted image to reconstruct a clean image. We have trained our model on MNIST handwritten digit database after making lower half of every image as black as well as adding noise top of that. After a massive destruction of the images where it is hard for a human to understand the content of those images, our model can retrieve that image with minimal error. Our proposed model has been compared with convolutional encoder-decoder, where our model has performed better at generating missing part of the images than convolutional autoencoder.

研究の動機と目的

  • 畳み込みオートエノードの、画像における大規模な欠損領域の再構成における限界を解消すること。
  • 顕著な欠損部を伴う画像修復において、LSTMの記憶力とシーケンスモデリング能力を活用すること。
  • CNNによる特徴抽出とLSTMによる順序的生成を統合し、画像のノイズ除去と補完を改善すること。
  • 直接アテンションが、デコーダが再構成中に符号化表現と元の損傷を受けた画像の両方にアクセスできるようにする効果を評価すること。
  • 人間の認識が元の内容を特定するのが困難なほど重度に損傷を与えたMNISTの数字において、優れた性能を示すことを実証すること。

提案手法

  • エンコーダは畳み込みニューラルネットワークであり、損傷を受けた入力画像を固定サイズのトゥークトル(thought vector)に圧縮する。
  • デコーダは、トゥークトルと損傷を受けた画像を1行ずつ処理する多層LSTMネットワークであり、符号化表現と元の入力の両方を再構成に使用する。
  • 直接アテンションは、各タイムステップで符号化ベクトルと損傷を受けた画像を連結することで実装され、LSTMがグローバルな文脈とローカルなピクセルレベルの情報を両方注目できるようにする。
  • モデルは、デコーダへの入力としてトゥークトルと損傷を受けた画像の両方を用いることで、エンコーダが完全な構造的情報を捉えられなかった場合でも、欠損コンテンツを回復できるようにする。
  • 訓練にはRMSPropを用い、学習率は0.001、ドロップアウト率は25%、平均二乗誤差(RMSE)損失関数を用いてピクセル単位の再構成誤差を最小化する。
  • モデルは、各数字の下部が黒く塗りつぶされ、ノイズが追加された変更されたMNISTデータセットで訓練されている。これは重度の画像劣化を模倣するものである。

実験結果

リサーチクエスチョン

  • RQ1CNNとLSTMを組み合わせたエンコーダデコーダアーキテクチャは、大規模な欠損領域を伴う画像の修復において、標準的な畳み込みオートエノードを上回る性能を発揮できるか?
  • RQ2デコーダが符号化表現と元の損傷を受けた画像の両方にアクセスできる直接アテンションの統合により、再構成品質が向上するか?
  • RQ3入力が重度に損傷を受け、曖昧な状態である場合に、LSTMベースのデコーダが妥当な欠損部分をどれほど正確に生成できるか?
  • RQ4RMSE損失の使用は、他の損失関数と比較して、再構成画像の滑らかさと正確さにどのように影響を与えるか?
  • RQ5重度の損傷を受けた後でも、筆算数字の構造的詳細を回復する点で、提案されたモデルは完全に畳み込み的なモデルよりも優れているか?

主な発見

  • CNN-LSTMモデルは、CNN-CNNオートエノードが正しい形状を回復できなかった、重度に損傷を受けたMNISTの数字の欠損部分の再構成において、優れた性能を発揮した。
  • モデルは、数字の下部が黒く塗りつぶされ、ノイズが追加された状態でも、最小限の誤差で画像を回復した。視覚的品質と構造的正確性において、ベースラインの畳み込みモデルを上回った。
  • CNN-LSTMモデルの損失曲線は、50万イタレーションにわたり連続して減少する傾向を示し、安定的かつ効果的な学習が行われたことを示している。一方、CNN-CNNモデルの損失は初期にプラトーに達した。
  • CNN-LSTMモデルが生成した再構成画像は、元の画像よりも滑らかで正確であった。これはRMSE損失がピクセル値を正解に近づけるように促進し、ストローク幅のばらつきにわたる一般化を向上させるためである。
  • モデルの訓練には6時間58分を要したが、CNN-CNNモデルは4時間19分であった。これは、訓練時間と再構成品質の間のトレードオフを示している。
  • 図7の可視的比較により、CNN-LSTMモデルが、CNN-CNNモデルよりもシャープで一貫性があり、エッジの保持が良好な数字を生成していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。