[論文レビュー] Facial Action Unit Recognition With Multi-models Ensembling
本論文は、ABAW 2022 コンペティションにおいて、顔面のアクションユニット(AU)認識のためのマルチモデルアンサンブル手法を提示する。IResNet100を改良し、FPN、SSH、およびコORDINATE ATTENTIONモジュールを統合することで、特徴表現の学習を強化している。Glint360Kおよび独自のAU/EXPRデータセットで事前学習したモデルを組み合わせ、ML-ROSおよびバッチサンプリングを用いてデータのバランスを調整し、ハイブリッド損失関数を適用することで、AUバリデーションセットにおいてマクロF1スコア0.731を達成した。
The Affective Behavior Analysis in-the-wild (ABAW) 2022 Competition gives Affective Computing a large promotion. In this paper, we present our method of AU challenge in this Competition. We use improved IResnet100 as backbone. Then we train AU dataset in Aff-Wild2 on three pertained models pretrained by our private au and expression dataset, and Glint360K respectively. Finally, we ensemble the results of our models. We achieved F1 score (macro) 0.731 on AU validation set.
研究の動機と目的
- 実世界のウェルド(in-the-wild)データにおける顔面アクションユニット認識における深刻なクラス不均衡を解消する。
- バックボーンネットワークのアーキテクチャ的変更を通じて、特徴表現の向上を図ることで、AU認識性能を改善する。
- 複数の事前学習済みモデルとアンサンブル戦略を統合することで、トレーニングの安定性と一般化性能を最適化する。
- Aff-Wild2データセットにおける不均衡なAU分布を考慮した、頑健な損失関数の開発。
提案手法
- バックボーンとしてIResNet100を採用し、Glint360Kおよび2つの独自データセット(AUおよび表情)で事前学習することで、特徴転送を向上させた。
- FPNおよびSSHモジュールを統合し、マルチスケール表現における空間的・テクスチャ的特徴の保持と強化を実現した。
- 浅い層および深い層にCoordinate Attentionモジュールを適用し、空間的特徴への注目と局所化を向上させた。
- バイナリクロスエントロピーとマルチラベル損失を組み合わせたハイブリッド損失関数を設計し、クラス固有の重み(例:w=[1,2,1,1,1,1,1,6,6,5,1,5])を導入してデータ不均衡に対処した。
- 各トレーニングバッチに12個のAUすべてについて正例と負例がバランスよく含まれるようにするため、バッチサンプリングを実装した。
- ログティチュードにスライディングウィンドウを適用することで、動画入力におけるシーケンスレベルのAU予測の一貫性を向上させた。
実験結果
リサーチクエスチョン
- RQ1実世界のデータにおける極端なラベル不均衡下で、ディープラーニングモデルを効果的にファインチューニングするにはどうすればよいか?
- RQ2FPN、SSH、およびCoordinate Attentionといったアーキテクチャ的改良は、AU認識性能にどの程度寄与するか?
- RQ3多様なデータセットで事前学習された複数のモデルをアンサンブルすることで、ABAW 2022のAUチャレンジにおける一般化性能と性能が向上するか?
- RQ4提案されたハイブリッド損失関数は、Aff-Wild2における長尾分布を有するAUに与える影響をどの程度軽減できるか?
- RQ5ML-ROSおよびバッチサンプリングといったデータバランス技術は、モデルの収束性とAU別F1スコアにどの程度寄与するか?
主な発見
- 提案されたマルチモデルアンサンブル戦略は、ABAW 2022のAUバリデーションセットでマクロF1スコア0.731を達成し、個々のモデルを上回った。
- Glint360Kおよび独自のAU/EXPRデータセットからの事前学習重みの使用により、学習から再開した場合に比べ14.4%の性能向上が達成された。
- Coordinate Attentionモジュールの統合により、個別で最大の向上(F1スコア4.4%の改善)が得られ、注目メカニズムに基づく特徴学習の有効性が示された。
- BCEとマルチラベル損失を組み合わせたハイブリッド損失関数は、特にレアAU(例:AU23およびAU24)に対して、長尾分布の悪影響を軽減した。
- ML-ROSおよびバッチサンプリングによるデータバランス化は、F1スコアに1.5%の向上をもたらし、トレーニングデータの整備の重要性を示した。
- アブレーションスタディの結果、FPN、SSH、コORDINATE ATTENTION、ラベルスムージング、および大きなバッチサイズを組み合わせた場合が最高の性能(F1スコア0.721)を示し、全体パイプラインの有効性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。