Skip to main content
QUICK REVIEW

[論文レビュー] KSoF: The Kassel State of Fluency Dataset -- A Therapy Centered Dataset of Stuttering

Sebastian P. Bayerl, Alexander Wolff von Gudenberg|arXiv (Cornell University)|Mar 10, 2022
Stuttering Research and Treatment被引用数 12
ひとこと要約

KSoF は、発語矯正療法を受ける人々から収集した 5,500 フレーズの注釈付き音声クリップを含む、ドイツ語のステッタースピーチを特徴とする画期的な療法中心のデータセットを紹介する。6 種類の不順応(ブロック、延長、音の繰り返し、語の繰り返し、挿入語、発話の修正)を含み、ステッターの検出および療法的発話修正の自動検出を可能にする。限られた学習データでも W2V2 特徴量がベースラインモデルで優れた性能を示した。

ABSTRACT

Stuttering is a complex speech disorder that negatively affects an individual's ability to communicate effectively. Persons who stutter (PWS) often suffer considerably under the condition and seek help through therapy. Fluency shaping is a therapy approach where PWSs learn to modify their speech to help them to overcome their stutter. Mastering such speech techniques takes time and practice, even after therapy. Shortly after therapy, success is evaluated highly, but relapse rates are high. To be able to monitor speech behavior over a long time, the ability to detect stuttering events and modifications in speech could help PWSs and speech pathologists to track the level of fluency. Monitoring could create the ability to intervene early by detecting lapses in fluency. To the best of our knowledge, no public dataset is available that contains speech from people who underwent stuttering therapy that changed the style of speaking. This work introduces the Kassel State of Fluency (KSoF), a therapy-based dataset containing over 5500 clips of PWSs. The clips were labeled with six stuttering-related event types: blocks, prolongations, sound repetitions, word repetitions, interjections, and - specific to therapy - speech modifications. The audio was recorded during therapy sessions at the Institut der Kasseler Stottertherapie. The data will be made available for research purposes upon request.

研究の動機と目的

  • 注釈付き発話修正を含む、公開可能で療法中心のステッタースピーチデータセットの不足に対処すること。
  • 現実世界の環境において、ステッターの重症度および療法の進行状況を客観的かつ長期的にモニタリングすること。
  • 臨床的および日常的状況下での不順応タイプおよび発話修正の検出を支援する自動システムの開発を促進すること。
  • 最小限の訓練で済む一般聴取者によるステッターの注釈の信頼性を向上させること。
  • 既存の最大規模のステッタースピーチコーパス(UCLASS)とラベルを一致させることで、多言語間の転移学習を促進すること。

提案手法

  • カッセルのステッタースピーチ療法研究所で実施された療法セッションから、5,500 以上の音声クリップを収集し、発語矯正療法を受けてきた被験者に焦点を当てた。
  • 各クリップに対して、6 種類の不順応タイプ(ブロック、延長、音の繰り返し、語の繰り返し、挿入語、発話の修正)を注釈づけた。
  • 話者ごとの 5 折り交差検証を用いた one-vs-all 二値分類アプローチを採用し、検出性能を評価した。
  • モデル入力として、openSMILE を用いた低レベルの音響特徴量と、W2V2(wav2vec2.0)を用いた文脈的発話表現を抽出した。
  • SVM(openSMILE 特徴量を用い、W2V2 埋め込みを用い)、LSTM/LSTM-attention ネットワークを含む複数のモデルを訓練・比較した。
  • 関連データで事前学習されたモデルを活用する際の性能向上を評価するため、多言語間の転移学習実験を実施した。

実験結果

リサーチクエスチョン

  • RQ1治療中心のデータセットに発話修正のラベルを付与することで、ステッタースピーチにおける不順応タイプの検出性能が向上するか?
  • RQ2最小限の訓練で済む一般聴取者による注釈はどれほど信頼性が高く、品質を損なわずに注釈コストを削減できるか?
  • RQ3自己教師付き音声表現(例:W2V2)は、手作業で作成された音響特徴量(例:openSMILE)に比べて、多様なステッターのタイプを検出する上でどれほど優れているか?
  • RQ4なぜ特定の不順応タイプ、特に語の繰り返しは検出が難しいのか。この課題の背後にある要因は何か?
  • RQ5既存のコーパス(例:UCLASS)からの転移学習により、KSoF データセットにおける検出性能が向上するか?

主な発見

  • W2V2 を用いた SVM モデルが、全不順応タイプにおいて最良の全体的性能を示し、平均化されたクリップレベルの埋め込みでさえも、自己教師付き音声表現の強力な表現力が裏付けられた。
  • 発話の修正が最も信頼性の高い不順応タイプとして検出された。これは、話者間で一貫した学習済みの音響パターンがあるためと考えられる。
  • 語の繰り返しが最も検出が困難であり、陽性例を含むクリップはわずか 3.8% にとどまり、流暢な発話と類似した音響的特徴のため、より長い文脈的認識が求められた。
  • LSTM および LSTM-attention モデルは、従来の機械学習モデルに比べて性能が低かった。これは、学習データが不足していることとモデルの複雑さのためと考えられる。
  • 多言語間の転移学習により、語の繰り返しを除く全不順応タイプで性能が向上した。これは、多言語事前学習をステッタースピーチ検出に活用する可能性を示唆している。
  • ベースラインの openSMILE 特徴量が LSTM モデルを上回った。これは、データが限られている状況下でも、手作業で作成された特徴量が依然としてこのタスクに有効であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。