[論文レビュー] Class-attention Video Transformer for Engagement Intensity Prediction
本稿では、クラスアテンション機構を用いて動画フレームから関与度の強度を予測するエンドツーエンドの動画トランスフォーマーモデルであるClass-attention Video Transformer (CavT)を提案する。このモデルは最先端の性能を達成している。さらに、訓練データの多様性とフレーム利用効率を向上させるために、バイナリオーダーレイアウトサンプリング(BorS)を導入し、EmotiW-EPでは0.0495 MSE、DAiSEEでは0.0377 MSEの誤差を低下させた。
In order to deal with variant-length long videos, prior works extract multi-modal features and fuse them to predict students' engagement intensity. In this paper, we present a new end-to-end method Class Attention in Video Transformer (CavT), which involves a single vector to process class embedding and to uniformly perform end-to-end learning on variant-length long videos and fixed-length short videos. Furthermore, to address the lack of sufficient samples, we propose a binary-order representatives sampling method (BorS) to add multiple video sequences of each video to augment the training set. BorS+CavT not only achieves the state-of-the-art MSE (0.0495) on the EmotiW-EP dataset, but also obtains the state-of-the-art MSE (0.0377) on the DAiSEE dataset. The code and models have been made publicly available at https://github.com/mountainai/cavt.
研究の動機と目的
- エンドツーエンドモデルを用いて、長く変動する長さのオンライン動画における関与度の強度を予測する課題に対処すること。
- 従来の動画ベースの関与度予測手法における低フレーム利用率と一般化性能の低さを克服すること。
- 効果的なデータ拡張を用いて、関与度予測データセットにおけるデータ不足とクラス不均衡問題を軽減すること。
- トランスフォーマーアーキテクチャ—特に自己アテンションとクラスアテンション機構—を、動画における微細な関与度強度の回帰に適応させること。
- 多様な動画長さとコンテンツにわたるモデルのロバスト性と性能を向上させるサンプリング戦略を開発すること。
提案手法
- 可学習なクラストークンと視覚的パッチとの間のクラスアテンションを用いて、時空間的特徴を集約する回帰のための、Class-attention Video Transformer (CavT) を提案する。
- 可学習な位置埋め込みとフラット化された動画フレーム上の多頭部自己アテンションを用いた、標準的なViTスタイルのアーキテクチャを採用する。
- 動画シーケンスをスライディングウィンドウに分割し、バイナリーオーダーロジックを用いて代表フレームを選択する、データ拡張手法であるバイナリオーダーレイアウトサンプリング(BorS)を導入する。
- BorSは、バイナリーオーダーに従って中央部またはサブウィンドウからフレームを選択することで、入力動画ごとに複数の動画シーケンスを適応的に生成し、均等な分布を確保する。
- CavTとBorSを組み合わせて、変動する長さの動画にわたる一般化性能に優れたエンドツーエンドモデルを訓練する。
- 評価指標として平均二乗誤差(MSE)と平均絶対誤差(MAE)を用い、顔抽出、クラスウェイト、サンプリングハイパーパramータに関するアブレーションスタディを実施する。
実験結果
リサーチクエスチョン
- RQ1手作業で特徴を抽出しないで、生の動画フレームから連続的な関与度の強度を予測するために、クラスアテンションを備えたトランスフォーマーベースのアーキテクチャが有効に機能するか?
- RQ2提案されたBorSサンプリング戦略は、ランダムサンプリングに比べて、関与度予測タスクにおけるモデルの一般化性能と性能をどのように向上させるか?
- RQ3データが限られている、あるいは不均衡な状況下で、BorSはモデル性能をどの程度向上させるか?
- RQ4顔抽出の統合は、CavTフレームワークにおける関与度の強度予測を改善するか?
- RQ5EmotiW-EPやDAiSEEなどの異なるベンチマークデータセットにおいて、BorSの最適なサンプリング回数(r)は何か?
主な発見
- BorS+CavTは、EmotiW-EPデータセットで最先端のMSE 0.0495を達成し、先行手法を上回った。
- DAiSEEデータセットでは、BorS+CavTが新たな最先端MSE 0.0377を達成し、多様な動画長にわたる強力な一般化性能を示した。
- アブレーションスタディにより、顔抽出がCavTの性能を向上させ、EmotiW-EPにおけるMSEを0.0759から0.0667に低下させたことが確認された。
- 重み付き損失はCavTの性能を向上させず、むしろMMSEを増加させた。これは、クラス不均衡が損失重み付けのみでは効果的に緩和されないことを示している。
- BorSの最適なサンプリング回数は、EmotiW-EPではr=4、DAiSEEではr=3であり、それ以上に増加させると過学習により性能が低下した。
- BorSはランダムサンプリングに比べて0.0157 MSE(0.0495 vs. 0.0652)の優位性を示し、構造的でバイナリーオーダーに従ったフレーム選択の有効性を裏付けた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。