Skip to main content
QUICK REVIEW

[論文レビュー] Harmonizer: Learning to Perform White-Box Image and Video Harmonization

Zhanghan Ke, Chunyi Sun|arXiv (Cornell University)|Jul 4, 2022
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

Harmonizer は、自己符号化器のようなブラックボックス手法ではなく、画像レベルのフィルタ引数(例:明るさ、コントラスト)を回帰することで、ホワイトボックスかつ軽量なフレームワークを提案する。56 fps の 1080P 解像度で最先端の性能を達成し、従来手法よりも著しく高速な推論を実現しながら、高精度でフレーム間の一貫性を維持する。

ABSTRACT

Recent works on image harmonization solve the problem as a pixel-wise image translation task via large autoencoders. They have unsatisfactory performances and slow inference speeds when dealing with high-resolution images. In this work, we observe that adjusting the input arguments of basic image filters, e.g., brightness and contrast, is sufficient for humans to produce realistic images from the composite ones. Hence, we frame image harmonization as an image-level regression problem to learn the arguments of the filters that humans use for the task. We present a Harmonizer framework for image harmonization. Unlike prior methods that are based on black-box autoencoders, Harmonizer contains a neural network for filter argument prediction and several white-box filters (based on the predicted arguments) for image harmonization. We also introduce a cascade regressor and a dynamic loss strategy for Harmonizer to learn filter arguments more stably and precisely. Since our network only outputs image-level arguments and the filters we used are efficient, Harmonizer is much lighter and faster than existing methods. Comprehensive experiments demonstrate that Harmonizer surpasses existing methods notably, especially with high-resolution inputs. Finally, we apply Harmonizer to video harmonization, which achieves consistent results across frames and 56 fps at 1080P resolution. Code and models are available at: https://github.com/ZHKKKe/Harmonizer.

研究の動機と目的

  • 自己符号化器ベースの画像ハーモナイゼーション手法の限界(高解像度性能の低さ、推論の遅さ、ブラックボックス性)を是正すること。
  • ピクセル単位の変換ではなく、人間が使用するようなフィルタ調整という学習可能で解釈可能なアプローチによって、人間らしい画像ハーモナイゼーションを達成できるかを検証すること。
  • 視覚的整合性をフレーム間で維持できる、軽量で効率的かつ安定したフレームワークを設計すること。
  • トレーニング中のフィルタ間の依存関係と損失の不均衡に対処することで、フィルタ引数の予測精度を向上させること。

提案手法

  • Harmonizer は、画像ハーモナイゼーションを、明るさ、コントラスト、色温度などのフィルタ引数を予測する画像レベルの回帰問題として定式化する。
  • 相互に依存するフィルタ間の干渉を低減するため、逐次的にフィルタ引数を予測するキャスケード回帰器を採用する。
  • 勾配のバランスをとるために、動的損失戦略を用い、学習が簡単なフィルタに偏らないようにし、トレーニングの安定性を向上させる。
  • ニューラルバックボーンに回帰ヘッドを接続し、フィルタパラメータを予測した後、効率的で微分可能かつホワイトボックスのフィルタを用いて画像変換を実行する。
  • 動画ハーモナイゼーションでは、指数移動平均(EMA)戦略を用いてフレーム間の一貫性を確保する。
  • ピクセルレベルの出力に対してエンドツーエンドのトレーニングを避けることで、モデルの複雑さと計算コストを低減する。

実験結果

リサーチクエスチョン

  • RQ1ピクセル単位の変換タスクではなく、人間が使用するフィルタパラメータの回帰として画像ハーモナイゼーションを効果的にモデル化できるか?
  • RQ2明るさやコントラストのように相互に依存するフィルタパラメータを、キャスケード形式でより正確に予測する方法は何か?
  • RQ3動的損失戦略は、トレーニングの安定性を向上させ、特定のフィルタタイプに偏るのを防げるか?
  • RQ4本手法は、高解像度およびリアルタイムの動画ハーモナイゼーション環境でも優れた性能を示せるか?
  • RQ5ブラックボックスな自己符号化器と比較して、ホワイトボックスでフィルタベースのアプローチが、より優れた視覚的品質と整合性を達成できるか?

主な発見

  • iHarmony4 において 256×256 解像度で MSE 24.26 の新記録を樹立し、従来手法を大きく上回った。
  • 1080P 解像度では、RTX3090 GPU 上で 56 fps の推論速度を達成した。これに対し、従来の自己符号化器ベース手法は約 10 fps にとどまっていた。
  • アブレーションスタディにより、キャスケード回帰器と動的損失戦略の両方が不可欠であることが確認され、PSNR が 0.89 dB 向上し、MSE が 2.59 減少した。
  • ユーザースタディの結果、Harmonizer は動画ハーモナイゼーションで最高の B-T スコア(2.042)を達成し、従来手法を大きく上回り、合成入力でさえも上回った。
  • 8つのフィルタを用いた場合、1080P 解像度で PSNR 38.06、51.9 fps を達成し、性能と速度の優れたトレードオフを実現した。
  • 視覚的結果から、Harmonizer は自己符号化器ベース手法よりも画像のディテールをよりよく保持しており、テクスチャの歪みを回避していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。