Skip to main content
QUICK REVIEW

[論文レビュー] Attention-based Image Upsampling

Souvik Kundu, Hesham Mostafa|arXiv (Cornell University)|Dec 17, 2020
Advanced Image Processing Techniques参考文献 47被引用数 6
ひとこと要約

本論文は、画像超解像および統合的画像アップサンプリングのための深層学習モデルにおいて、ストライド付き転置畳み込みを置き換えるアテンションベースのアップサンプリング機構を提案する。コンテンツに適応するアテンション係数を用いて動的にアップサンプリングカーネルを計算することで、パrameter数を減らしつつ優れた性能を達成し、異なるソースからの別々のクエリ、キー、バリューテンソルを用いることで、複数の画像モダリティの柔軟な統合が可能になる。

ABSTRACT

Convolutional layers are an integral part of many deep neural network solutions in computer vision. Recent work shows that replacing the standard convolution operation with mechanisms based on self-attention leads to improved performance on image classification and object detection tasks. In this work, we show how attention mechanisms can be used to replace another canonical operation: strided transposed convolution. We term our novel attention-based operation attention-based upsampling since it increases/upsamples the spatial dimensions of the feature maps. Through experiments on single image super-resolution and joint-image upsampling tasks, we show that attention-based upsampling consistently outperforms traditional upsampling methods based on strided transposed convolution or based on adaptive filters while using fewer parameters. We show that the inherent flexibility of the attention mechanism, which allows it to use separate sources for calculating the attention coefficients and the attention targets, makes attention-based upsampling a natural choice when fusing information from multiple image modalities.

研究の動機と目的

  • 画像アップサンプリングタスクにおける固定カーネルのストライド付き転置畳み込みの限界を解消すること。
  • 自己アテンション機構がアップサンプリング演算における性能とパrameter効率を向上させられるかどうかを調査すること。
  • クエリ/キーとバリューのソースを分離することで、複数の画像モダリティの統合を柔軟に可能にする。
  • アテンションベースのアップサンプリングが、固定カーネル手法よりも少ないパrameterで優れた性能を示すことを実証すること。

提案手法

  • ストライド付き転置畳み込みを、コンテンツ依存のアテンション係数に基づいてアップサンプリング重みを計算する自己アテンション機構に置き換える。
  • スケーリングドット積分アテンションを用いて、特徴マップからクエリ、キー、バリューのテンソルを計算し、動的カーネル生成を可能にする。
  • クエリ、キー、バリューのテンソルを独立して異なるソースから取得可能であり、例えば異なる画像モダリティ(例:RGBと深度画像)からの入力を用いることでマルチモーダル統合が可能になる。
  • スーパーレゾリューションおよび統合アップサンプリングネットワークにおけるデコンボリューションの即時置き換えとして、アテンションベースのアップサンプリング層を適用する。
  • 受容fieldのコンテンツに基づいて空間的に変化するカーネル重みを有するコンテンツに適応するアテンション機構を採用する。
  • パrameter数を削減しながらも、固定カーネル手法と同等またはそれ以上の性能を維持するようにアテンション機構を最適化する。

実験結果

リサーチクエスチョン

  • RQ1自己アテンション機構は、ストライド付き転置畳み込みと比較して、画像アップサンプリングの性能を向上させられるか?
  • RQ2アテンションベースのアップサンプリングは、パラメータ数を削減しながらも、超解像タスクにおける精度を維持または向上させられるか?
  • RQ3アテンションベースのアップサンプリングは、RGBと深度画像などの複数の画像モダリティからの情報を自然に統合できるか?
  • RQ4標準のデコンボリューションベースのモデルと比較して、アテンションベースのアップサンプリング機構は効率性と精度の両面で優れているか?

主な発見

  • BSDS100データセットにおいて、アテンションベースのモデルは2倍拡大時で33.28 dBのPSNRを達成し、デコンボリューションベースラインの33.25 dBをわずかに上回った。
  • 8倍超解像時において、アテンションベースの手法は24.80 dBのPSNRを達成したのに対し、デコンボリューションは24.74 dBであった。性能向上は一貫して見られた。
  • Set5データセットにおいて、アテンションベースのモデルは2倍拡大時で36.84 dBのPSNRを達成し、デコンボリューションモデルの36.86 dBとほぼ同等の性能を示した。スケールにわたる傾向も同様であった。
  • アテンションベースのモデルは、デコンボリューションベースのモデルと比較して顕著に少ないパラメータ数で、性能を維持または向上させた。
  • 統合的画像アップサンプリングにおいて、クエリ/キーを1つのモダリティから、バリューを別のモダリティから取得することで、複数のモダリティの有効な統合が可能になり、精度とパラメータ効率が向上した。
  • パラメータ数が少ないにもかかわらず、ディープラーニングライブラリにおけるアテンションベース演算の低レベルカーネルが最適化されていないため、学習が遅くなった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。