Skip to main content
QUICK REVIEW

[論文レビュー] Addressing Missing and Noisy Modalities in One Solution: Unified Modality-Quality Framework for Low-quality Multimodal Data

Sijie Mai, Shiqin Han|arXiv (Cornell University)|Mar 3, 2026
Emotion and Mood Recognition被引用数 0
ひとこと要約

UMQは欠損およびノイズのあるモダリティをquality estimator、quality enhancer、そして modality-quality-aware mixture-of-expertsを導入することで同時に扱い、複数のMACデータセットで最先端の結果を達成します。

ABSTRACT

Multimodal data encountered in real-world scenarios are typically of low quality, with noisy modalities and missing modalities being typical forms that severely hinder model performance and robustness. However, prior works often handle noisy and missing modalities separately. In contrast, we jointly address missing and noisy modalities to enhance model robustness in low-quality data scenarios. We regard both noisy and missing modalities as a unified low-quality modality problem, and propose a unified modality-quality (UMQ) framework to enhance low-quality representations for multimodal affective computing. Firstly, we train a quality estimator with explicit supervised signals via a rank-guided training strategy that compares the relative quality of different representations by adding a ranking constraint, avoiding training noise caused by inaccurate absolute quality labels. Then, a quality enhancer for each modality is constructed, which uses the sample-specific information provided by other modalities and the modality-specific information provided by the defined modality baseline representation to enhance the quality of unimodal representations. Finally, we propose a quality-aware mixture-of-experts module with particular routing mechanism to enable multiple modality-quality problems to be addressed more specifically. UMQ consistently outperforms state-of-the-art baselines on multiple datasets under the settings of complete, missing, and noisy modalities.

研究の動機と目的

  • 現実的な低品質データで欠損およびノイズのあるモダリティの両方を有するロバストなマルチモーダル学習を動機づける。
  • 欠損およびノイズのあるモダリティを単一の低品質モダリティ問題として jointly に扱う統一フレームワークを提案する。
  • ランク誘導トレーニングを通じてモダリティ品質推定の明示的な監督を開発する。
  • サンプル固有情報とモダリティ固有情報を活用して unimodal 表現を改善するquality enhancerを設計する。
  • モダリティ品質認識に基づくエキスパートのルーティングを専門化するモダリティ品質認識型の混合専門家モデル(MQ-MoE)を導入する。

提案手法

  • 欠損およびノイズのあるモダリティを単一の低品質モダリティ問題として扱う unified modality-quality (UMQ) フレームワークを定義する。
  • 絶対的な品質ラベルに依存せず、相対的品質を学習するランク誘導トレーニング戦略で拡張された監視信号を用いて各モダリティの品質推定器を訓練する。
  • 他のモダリティからのサンプル固有情報とモダリティ固有のベースライン表現を用いて unimodal 特徴を豊かにする quality enhancer を開発する。
  • モダリティベースライン表現を構築し、強化された unimodal 表現を融合ネットワークを介してマルチモーダル表現へ統合する。
  • 2^{|M|} のモダリティ品質構成を効率的に扱うルーティング制約を持つ modality-quality-aware mixure-of-experts (MQ-MoE) を実装し、エキスパート間のバランスと類似性制約を適用する。

実験結果

リサーチクエスチョン

  • RQ1欠損およびノイズのあるモダリティを共同でモデル化して低品質データでのロバスト性を向上させるにはどうすればよいか。
  • RQ2ランク誘導監督で学習した品質推定器は、強化とルーティングのための信頼できるモダリティ品質信号を提供できるか。
  • RQ3モダリティ固有のベースラインとサンプル固有情報の双方を活用することで、劣化時の unimodal 表現の忠実性を改善できるか。
  • RQ4品質認識型の混合専門家は多様なモダリティ品質構成を効果的に専門化して扱えるか。
  • RQ5標準 MAC データセットでの完全/欠損/ノイズモダリティ設定における性能向上はどれほどか。

主な発見

  • UMQは完全/欠損/ノイズモダリティ設定の複数のマルチモーダル感情認識データセットで最先端ベースラインを上回る。
  • ランク誘導監督で訓練された品質推定器は絶対的品質ラベルに依存せずにモダリティ品質を効果的に識別する。
  • サンプル固有情報とモダリティ固有情報の双方を活用する quality enhancer は、モダリティ特性を保持しつつ高品質な unimodal 表現を生み出す。
  • 品質認識ルーティングと制約付きエキスパート使用を備えた MQ-MoE は各モダリティ品質構成に対して専門的な処理を提供し、頑健性と精度を向上させる。
  • アブレーション研究により、品質推定器の欠落やランク誘導トレーニングの除去は性能を大幅に低下させることが示され、これらの重要性が強調される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。