[論文レビュー] Jointly Learning Visual and Auditory Speech Representations from Raw Data
RAVEn は、非対称なマスク予測とモーメンタムエンコーダーを用いて、生の動画と音声から直接視覚的および聴覚的発話表現を共同で自己教師付きで学習するマルチモーダルフレームワークである。視覚的発話認識(LRS3で全データ使用時23.1% WER)および聴覚的発話認識の両面で最先端の結果を達成しており、最小限のラベル付きデータでも従来手法を上回っている。特に、9万時間の非公開データでトレーニングされた半教師付き手法でさえ、わずか30時間のラベル付きデータでのみトレーニングされた RAVEn がそれを上回っている。
We present RAVEn, a self-supervised multi-modal approach to jointly learn visual and auditory speech representations. Our pre-training objective involves encoding masked inputs, and then predicting contextualised targets generated by slowly-evolving momentum encoders. Driven by the inherent differences between video and audio, our design is asymmetric w.r.t. the two modalities' pretext tasks: Whereas the auditory stream predicts both the visual and auditory targets, the visual one predicts only the auditory targets. We observe strong results in low- and high-resource labelled data settings when fine-tuning the visual and auditory encoders resulting from a single pre-training stage, in which the encoders are jointly trained. Notably, RAVEn surpasses all self-supervised methods on visual speech recognition (VSR) on LRS3, and combining RAVEn with self-training using only 30 hours of labelled data even outperforms a recent semi-supervised method trained on 90,000 hours of non-public data. At the same time, we achieve state-of-the-art results in the LRS3 low-resource setting for auditory speech recognition (as well as for VSR). Our findings point to the viability of learning powerful speech representations entirely from raw video and audio, i.e., without relying on handcrafted features. Code and models are available at https://github.com/ahaliassos/raven.
研究の動機と目的
- 手作業で特徴を設計しない自己教師付き統合手法を開発し、視覚的および聴覚的発話表現を学習すること。
- 生のデータからの音声・視覚の自己教師付き統合を活用することで、リソースが限られた発話認識の課題に取り組むこと。
- 視覚的および聴覚的発話認識のための多段階事前学習や別々の戦略の必要性を排除すること。
- 非対称なクロスモーダル学習により、視覚的および聴覚的発話認識の下流タスク性能を向上させること。
- 言語的・音響的教師付き情報なしに、完全に生の感覚入力から強力な発話表現を学習できることを示すこと。
提案手法
- RAVEn は、音声および動画の両ストリームに対して、モーメンタム平均されたターゲットエンコーダーを用いた学生・教師型対照的学習フレームワークを採用している。
- 音声ストリームは、音声および視覚の両方のモーメンタムエンコーダーからのターゲットを予測する(クロスモーダルおよび同じモーダルの学習)が、視覚ストリームは音声のターゲットのみを予測する(クロスモーダル学習)ことで、音声に高い情報量があることを反映している。
- マスクされた入力を学生エンコーダーに供給し、未マスク入力のゆっくり更新されるモーメンタムエンコーダーからの文脈化された表現を予測する。
- 軽量なトランスフォーマー基盤の予測器を採用して、モーメンタムエンコーダーの出力を回帰し、エンドツーエンドの自己教師付き事前学習を可能にしている。
- 事前学習は生の動画および音声上で単一段階で実施され、その後、最小限のラベル付きデータで下流の ASR および VSR タスクでのファインチューニングが実施される。
- このフレームワークは、教師ありファインチューニングおよび自己学習をサポートしており、リソースが限られた環境での性能向上に寄与している。
実験結果
リサーチクエスチョン
- RQ1手作業で特徴を設計しない単一段階の自己教師付き手法が、生の音声および動画から視覚的および聴覚的発話表現を強固に共同で学習できるか?
- RQ2音声ストリームが両モーダルを予測するが、視覚ストリームは音声のみを予測する非対称学習は、対称的または単一モーダルのアプローチと比較して性能向上をもたらすか?
- RQ3RAVEn は最小限のラベル付きデータで、視覚的および聴覚的発話認識の両方で最先端の結果を達成できるか?
- RQ4生のデータでの事前学習が、動画から音声への変換などの下流タスクにどの程度向上効果をもたらすか?
- RQ5外部の ASR モデルや大規模な疑似ラベル付けに依存する手法と比較して、RAVEn はリソースが限られた環境でどの程度優れているか?
主な発見
- RAVEn は、433時間の全データを使用してファインチューニングした場合、LRS3 における視覚的発話認識で 23.1% WER を達成し、新たな最先端水準を樹立した。
- 30時間のラベル付きデータと自己学習を用いた場合、RAVEn は VSR で 23.8% WER を達成し、非公開の9万時間のデータでトレーニングされた最近の半教師付き手法を上回った。
- 聴覚的発話認識において、タスク固有の事前学習や手作業特徴なしに、AV-HuBERT と同等またはそれを上回る性能を示した。
- RAVEn の事前学習は、動画から音声への変換性能を向上させ、スクラッチからの学習と比較して PESQ を 0.04、STOI を 0.03、ESTOI を 0.06 向上させた。
- この手法は強力な一般化性能を示し、ベースモデルを用いてリソースが限られた VSR で 47.0% WER、リソースが限られた ASR で 4.7% WER を達成した。
- 誤りの多くは発音的に類似した置換(例:'were taken' → 'we’re taking')であり、モデルが発音的および意味的構造を効果的に捉えていることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。