[論文レビュー] Denoising convolutional autoencoder based B-mode ultrasound tongue image feature extraction
本稿では、スペックルノイズや画像歪みに対して頑健性を高めるために畳み込み型アーキテクチャを活用した、非教師付き特徴抽出を目的としたノイズ除去畳み込みオートエンコーダー(DCAE)を提案する。DCAEは2010年 Silent Speech Interface Challengeにおいて6.17%のWord Error Rate(WER)を達成し、最先端のDCTベース手法(6.45%)および他のオートエンコーダー変種を上回った。
B-mode ultrasound tongue imaging is widely used in the speech production field. However, efficient interpretation is in a great need for the tongue image sequences. Inspired by the recent success of unsupervised deep learning approach, we explore unsupervised convolutional network architecture for the feature extraction in the ultrasound tongue image, which can be helpful for the clinical linguist and phonetics. By quantitative comparison between different unsupervised feature extraction approaches, the denoising convolutional autoencoder (DCAE)-based method outperforms the other feature extraction methods on the reconstruction task and the 2010 silent speech interface challenge. A Word Error Rate of 6.17% is obtained with DCAE, compared to the state-of-the-art value of 6.45% using Discrete cosine transform as the feature extractor. Our codes are available at https://github.com/DeePBluE666/Source-code1.
研究の動機と目的
- ノイズが多く、SNRが低いBモード超音波舌画像から、頑健で発話関連の特徴を抽出する課題に対処すること。
- 超音波ベースのサイレントスピーチインターフェース(SSI)における次元削減および特徴学習のための非教師付きディープラーニング手法を検討すること。
- 畳み込みアーキテクチャの不変性特性を活用することで、再構成の正確性と認識性能を向上させること。
- 再構成および発話認識タスクにおいて、DCT、PCA、標準オートエンコーダーなど既存手法と比較してDCAEモデルの性能を評価すること。
提案手法
- 非教師付きで超音波舌画像のコンactでノイズに強い表現を学習するために、ノイズ除去畳み込みオートエンコーダー(DCAE)を採用する。
- 入力画像にノイズを付加し、元の画像の再構成を最適化することで、スペックルノイズやアーティファクトに対して頑健性を高める。
- 段階的な空間的特徴を学習するために、ストライド付き畳み込みと逆畳み込みを用いた対称的なエンコーダー・デコーダー構造を採用する。
- DCAEのボトルネック層から特徴を抽出し、それをDNN-HMM音声認識モデルの入力として使用する。
- MSEおよびCW-SSIM指標を用いて、DCAEの性能をDCT、ディープオートエンコーダー(DAE)、ノイズ除去オートエンコーダー(DAE)、標準畳み込みオートエンコーダー(CAE)と比較する。
- Kaldiを用いて認識システムの実装に、2010年サイレントスピーチインターフェースチャレンジデータセットに特徴抽出パイプラインを適用する。
実験結果
リサーチクエスチョン
- RQ1ノイズ除去畳み込みオートエンコーダーは、DCT や PCA のような従来の特徴抽出手法よりも、超音波舌画像の再構成において優れた性能を示せるか?
- RQ2DCAEモデルは、標準オートエンコーダーや畳み込みオートエンコーダーと比較して、再構成精度およびノイズ耐性において優れているか?
- RQ3DCAEに基づく特徴表現は、最先端の手法と比較して、サイレントスピーチ認識における単語誤り率(WER)を改善するか?
- RQ4DCAEアーキテクチャの空間的不変性およびノイズ耐性は、超音波シーケンスにおける発話関連の発音動態をどの程度保持するか?
主な発見
- DCAEモデルは2010年サイレントスピーチインターフェースチャレンジで6.17%の最低WERを達成し、最先端のDCTベース手法(6.45%)を上回った。
- 再構成タスクにおいて、DCAEは60次元の特徴ベクトルを用いてテストMSEが71.28、CW-SSIMが0.6577を達成し、DCT、DAE、CAEモデルを上回った。
- DCAEモデルは、同一設定下で標準CAEと比較して、MSEが1.5%低下し、CW-SSIMが0.012上昇するなど、優れたノイズ耐性を示した。
- DCAEベースの特徴は30次元特徴で6.24%のWERを達成し、次元削減下でも優れた性能を示した。
- 可視化比較により、DCAEは他のモデルと比較して、舌の形状の保持が良く、スペックルアーティファクトが低減された再構成画像を生成した。
- 非畳み込み型オートエンコーダーと比較してDCAEモデルは一貫した改善を示し、畳み込み型のインダクティブバイアスが超音波画像における特徴品質を向上させることを示唆した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。