[論文レビュー] A Generalized and Robust Method Towards Practical Gaze Estimation on Smart Phone
本稿では、スマートフォンにおける過学習と予測のジャイタリーな変動を解消するため、耐性があり優れた(Tolerant and Talented; TAT)トレーニング方式と、順序損失を用いた撹乱(Disturbance with Ordinal loss; DwO)手法を提案する。TATは、コサイン類似度を用いたプルーニングと整合された直交初期化を組み合わせた反復的知識蒸留を用い、過学習を低減し一般化性能を向上させる。一方、DwOは順序損失を用いた敵対的訓練により、モデルのロバスト性を強化する。これらの手法は、GazeCaptureで最先端の精度を達成し、新たなロバスト性ベンチマークにおいて予測のジャイタリーな変動を顕著に低減した。
Gaze estimation for ordinary smart phone, e.g. estimating where the user is looking at on the phone screen, can be applied in various applications. However, the widely used appearance-based CNN methods still have two issues for practical adoption. First, due to the limited dataset, gaze estimation is very likely to suffer from over-fitting, leading to poor accuracy at run time. Second, the current methods are usually not robust, i.e. their prediction results having notable jitters even when the user is performing gaze fixation, which degrades user experience greatly. For the first issue, we propose a new tolerant and talented (TAT) training scheme, which is an iterative random knowledge distillation framework enhanced with cosine similarity pruning and aligned orthogonal initialization. The knowledge distillation is a tolerant teaching process providing diverse and informative supervision. The enhanced pruning and initialization is a talented learning process prompting the network to escape from the local minima and re-born from a better start. For the second issue, we define a new metric to measure the robustness of gaze estimator, and propose an adversarial training based Disturbance with Ordinal loss (DwO) method to improve it. The experimental results show that our TAT method achieves state-of-the-art performance on GazeCapture dataset, and that our DwO method improves the robustness while keeping comparable accuracy.
研究の動機と目的
- スマートフォンにおける視線推定のトレーニングとテストの性能差を、過学習の要因として是正すること。
- リアルタイム応用におけるユーザ体験を損なう視線固定時の予測ジャイタリーな変動を低減すること。
- 視線推定器のロバスト性を定量的に評価するための新しい指標とデータセットを開発すること。
- 精度を損なわず、新たなトレーニング方式を用いて一般化性能とロバスト性を向上させること。
- 消費者用スマートフォンへの視線推定の実用的導入を可能にすること。
提案手法
- 多様で有用な教師ネットワークからの監視信号を活用し、ランダムに選択された教師ネットワークを用いた反復的ランダム知識蒸留フレームワークを提案し、耐性のある指導プロセスを実現する。
- 不要で有用性の低い重みを削除することで、モデルの効率性と一般化性能を向上させるコサイン類似度プルーニングを導入する。
- 重みを互いに直交させるとともに、元の分布と整合させるように再初期化する、整合された直交初期化(Aligned Orthogonal Initialization; AOI)を提案し、最適化の再開を改善する。
- ジャイタリーさとロバスト性を評価するための新しい指標(MSD)を設計し、新しいデータセット(GazeStare)を収集する。
- 順序損失のバインに撹乱を適用することでロバスト性を向上させる、カスタマイズされた敵対的訓練手法であるDisturbance with Ordinal loss(DwO)を提案する。
- 制御された撹乱強度とデータ保持率(Org.%)を用いたPGDベースの敵対的訓練を実施し、ハイパーパramーターサーチにより最適化する。
実験結果
リサーチクエスチョン
- RQ1プルーニングと再初期化を組み合わせた反復的知識蒸留フレームワークは、限られたデータセット上での視線推定における過学習を低減できるか?
- RQ2コサイン類似度プルーニングと整合された直交初期化は、視線推定におけるモデルの一般化性能と収束性を向上させるか?
- RQ3新しい指標とデータセットは、実世界の条件下での視線予測のジャイタリーさを効果的に定量化・評価できるか?
- RQ4順序損失を用いた敵対的訓練(DwO)は、高い精度を維持しつつジャイタリーさを顕著に低減できるか?
- RQ5提案されたTATおよびDwO手法は、GazeCaptureやGazeStareといったベンチマークデータセットで最先端の性能を達成できるか?
主な発見
- TATトレーニング方式は、GazeCaptureデータセットで最先端の性能を達成し、既存手法を上回った。
- DwO手法は、ベースラインと比較して平均二乗偏差(MSD)を19.2%低減したが、精度は同等の水準を維持した(1.20 cm 対 1.15 cm の誤差)。
- DwOにおいてT=1およびOrg.%=90%を用いることで、ロバスト性と精度の最良のトレードオフが達成され、MSDは0.42 cmから0.36 cmに低下した。
- 提案された整合された直交初期化法により、より安定した重み分布が得られ、L2ノルムがプルーニング済み重みと密接に一致し、ネットワークの崩壊を防止した。
- DwOでトレーニングされたモデルは、固定時の予測ポイントのジャイタリーさが著しく低減されており、図1(b)に示すように、真の視線点の周囲に予測が集中している。
- 順序損失の中心バイン数は極めて重要であり、8バインが、撹乱の効果とモデルの安定性のバランスを最適化する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。