Skip to main content
QUICK REVIEW

[論文レビュー] It's not what you said, it's how you said it: discriminative perception of speech as a multichannel communication system

Sarenne Wallbridge, Peter Bell|arXiv (Cornell University)|May 1, 2021
Speech and dialogue systems参考文献 39被引用数 4
ひとこと要約

本研究は、同じ単語を用いたプロソディ的に異なる発話文を聞き取り分ける際、聴取者が語彙的および非語彙的発話チャネルをどのように利用するかを調査する。新規の行動的識別タスクを用いた結果、非語彙的(プロソディック)な文脈が、語彙的文脈のみに比べて有意に知覚的正確性を向上させることを示し、会話認識におけるプロソディの重要な役割を明らかにした。

ABSTRACT

People convey information extremely effectively through spoken interaction using multiple channels of information transmission: the lexical channel of what is said, and the non-lexical channel of how it is said. We propose studying human perception of spoken communication as a means to better understand how information is encoded across these channels, focusing on the question 'What characteristics of communicative context affect listener's expectations of speech?'. To investigate this, we present a novel behavioural task testing whether listeners can discriminate between the true utterance in a dialogue and utterances sampled from other contexts with the same lexical content. We characterize how perception - and subsequent discriminative capability - is affected by different degrees of additional contextual information across both the lexical and non-lexical channel of speech. Results demonstrate that people can effectively discriminate between different prosodic realisations, that non-lexical context is informative, and that this channel provides more salient information than the lexical channel, highlighting the importance of the non-lexical channel in spoken interaction.

研究の動機と目的

  • 語彙的および非語彙的発話チャネルにおけるコミュニケーション的文脈が、会話認識における聴取者の期待をどのように形作るかを調査すること。
  • 語彙的に同一の発話文であっても、プロソディ的実現が異なる場合に、聴取者がそれを識別できるかを検討すること。
  • 語彙的文脈と非語彙的文脈の相対的な貢献度が、発話の識別的認識をどのように支援するかを評価すること。
  • 異なるレベルの文脈情報(テキストのみ、音声+テキスト、将来の文脈)が、知覚的パフォーマンスおよび信頼度に与える影響を調査すること。
  • 人間がリアルタイムの会話認識において使用する顕著な手がかりを特定することで、自動音声表現の設計を支援すること。

提案手法

  • 被験者が、同一の語彙的内容を持つが、元の発話文かサンプリングされた代替発話文かを判断する新しい行動的識別タスクを設計する。
  • スイッチボードコーパスからの刺激を用い、異なる会話的文脈から語彙的に同等の発話文を選択する。
  • 文脈モダリティ(テキストのみ、音声+テキスト、将来の文脈)および文脈の範囲(局所的 vs. 拡張的)を変化させた条件を提示する。
  • 語彙的および非語彙的手がかりへの依存度を評価するため、識別正確性と被験者の確信度を各条件下で測定する。
  • パフォーマンスの傾向と信頼度評価を分析し、聴取者が発話チャネル全体にわたって情報をどのように統合しているかを推察する。
  • 話者の同一性および語彙頻度を制御することで、プロソディ的および文脈的変動の影響を明確に分離する。

実験結果

リサーチクエスチョン

  • RQ1非語彙的(プロソディック)な文脈の追加が、語彙的に同等の発話文の識別能力にどのように影響するか。
  • RQ2語彙的文脈のみで識別パフォーマンスが向上するのか、それともプロソディックな文脈の方がより情報量が多いのか。
  • RQ3前回の発話や将来の文脈といった、異なる種類および期間の文脈情報が、聴取者の期待にどのように影響するか。
  • RQ4異なる文脈条件下で、被験者の信頼度が実際に達成されたパフォーマンスとどの程度一致するか。
  • RQ5識別タスクを通じて、聴取者がリアルタイムの会話認識において語彙的および非語彙的手がかりをどの程度重視しているかの違いを明らかにできるか。

主な発見

  • 非語彙的(プロソディック)な文脈が提供された場合、被験者の識別正確性が有意に向上した。これは、プロソディが言語認識において顕著な手がかりであることを示している。
  • 前回の発話のトランスクリプトのみが与えられた場合でもパフォーマンスが高く維持された。これは、局所的なプロソディック手が十分に識別に有効であることを示している。
  • 追加される文脈情報が増えるにつれて、被験者の判断に対する自信が高まったが、正確性と必ずしも相関しなかった。特に、テキストのみの将来文脈条件下では顕著だった。
  • テキストのみの将来文脈条件(3,3)では、パフォーマンスがランダムベースラインに近かったが、信頼度は高かった。これは、被騟能力と文脈情報の実効性の間で不一致が生じていることを示唆している。
  • 非語彙的文脈は、語彙的文脈のみに比べてより情報量が多く、知覚的識別においてその優位性が顕著に現れた。
  • 本研究の結果から、自己教師あり音声表現学習手法は、トレーニング信号として局所的なプロソディック文脈を組み込むことで恩恵を受ける可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。