[論文レビュー] Do better ImageNet classifiers assess perceptual similarity better?
本論文は、より良いImageNet分類器が優れた知覚的類似性メトリクスをもたらすかを調査し、現代のアーキテクチャ(ResNets、EfficientNets、Vision Transformers)において、ImageNetの精度が高くなるほど知覚的スコア(PS)が悪化することを発見した。驚くべきことに、過学習したモデル——特に浅いResNetsや5エポック未満で訓練されたモデル——が最も高いPSを達成しており、精度が閾値を超えて向上すると知覚的類似性が劣化するというパレート前線が明らかになった。
Perceptual distances between images, as measured in the space of pre-trained deep features, have outperformed prior low-level, pixel-based metrics on assessing perceptual similarity. While the capabilities of older and less accurate models such as AlexNet and VGG to capture perceptual similarity are well known, modern and more accurate models are less studied. In this paper, we present a large-scale empirical study to assess how well ImageNet classifiers perform on perceptual similarity. First, we observe a inverse correlation between ImageNet accuracy and Perceptual Scores of modern networks such as ResNets, EfficientNets, and Vision Transformers: that is better classifiers achieve worse Perceptual Scores. Then, we examine the ImageNet accuracy/Perceptual Score relationship on varying the depth, width, number of training steps, weight decay, label smoothing, and dropout. Higher accuracy improves Perceptual Score up to a certain point, but we uncover a Pareto frontier between accuracies and Perceptual Score in the mid-to-high accuracy regime. We explore this relationship further using a number of plausible hypotheses such as distortion invariance, spatial frequency sensitivity, and alternative perceptual functions. Interestingly we discover shallow ResNets and ResNets trained for less than 5 epochs only on ImageNet, whose emergent Perceptual Score matches the prior best networks trained directly on supervised human perceptual judgements. The checkpoints for the models in our study are available at https://console.cloud.google.com/storage/browser/gresearch/perceptual_similarity.
研究の動機と目的
- 画像分類精度の向上が知覚的類似性メトリクスを改善するかどうかを調査すること。
- 多様なアーキテクチャとハイパーパrameterを用いて、ImageNet精度と知覚的スコア(PS)の関係を探ること。
- 分類精度とは無関係に知覚的類似性を最適化するアーキテクチャ的・訓練的選択を同定すること。
- 歪み不変性、空間周波数感受性、表現エントロピーといった潜在要因が、精度とPSのトレードオフをどのように規定するかを検討すること。
- アーキテクチャの変更や早期停止によって、現代モデルでさえも知覚的類似性を向上させられるかどうかを特定すること。
提案手法
- 深さ、幅、重み減衰、ラベルスムージング、ドロップアウト、訓練ステップ数を変更した、幅広いImageNet分類器(ResNets、EfficientNets、Vision Transformers)を64×64のImageNet上で訓練した。
- 知覚的判断の人的評価がなされた大規模ベンチマークBAPPSを用いて、すべてのモデルのPerceptual Score(PS)を評価した。
- 活性化エントロピー、空間周波数感受性、レイヤーごとの特徴統計量といった表現特性を分析し、精度-PSトレードオフの背後にある要因を解明した。
- スキップ接続の有無を比較することで、表現エントロピーとPSに与える影響を評価した。
- ハイパスフィルタリングを用いて、高周波成分に依存する度合いを測定し、歪み耐性を評価した。
- 再現性とさらなる分析を目的に、定期的(1000ステップごと)にモデルチェックポイントを公開した。
実験結果
リサーチクエスチョン
- RQ1高いImageNet精度は、PSで測定される知覚的類似性を一貫して向上させるのか?
- RQ2ResNets や Vision Transformers といった現代のアーキテクチャにおいて、ImageNet精度と知覚的類似性の間にトレードオフが存在するのか?
- RQ3スキップ接続の削除や早期停止といったアーキテクチャ的変更が、精度が低くても知覚的類似性を向上させられるか?
- RQ4低PSのモデルは、画像の歪みに対してより感受性が高く、高周波成分に依存している程度はどの程度か?
- RQ5活性化エントロピー や空間周波数感受性といった表現レベルの特性が、知覚的類似性とどのように関連しているか?
主な発見
- ImageNet精度とPerceptual Score(PS)の間にパレート前線が存在し、中程度の精度のモデルが最高のPSを達成しており、精度のさらなる向上は知覚的類似性を劣化させる。
- 浅いResNets(例:ResNet-6)や5エポック未満で訓練されたモデルは、AlexNet や VGG と同等またはそれ以上のPSを達成しており、これらはかつて知覚的類似性の分野で最先端とされていた。
- 高い重み減衰や早期停止を適用したResNetsは、ImageNet精度が低くても高いPSを達成しており、過学習や過剰最適化が知覚的性能を損なうことが示された。
- スキップ接続を削除すると活性化エントロピーが上昇するが、PSは向上しないことから、高いエントロピーそのものが知覚的類似性を向上させることはない。
- 低PSのモデルが必ずしも高周波成分に依存しているわけではないことが、ローパassフィルタリング実験で示された:一部の高PSモデル(例:ResNet-6)は低PSモデルよりも強い高周波依存性を示した。
- 深さ、幅、訓練期間といった複数のハイパーパrameterにおいて、精度とPSの逆U字型関係が継続的に観察されたが、ラベルスムージング や ドロップアウト では一貫性がなかった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。