Skip to main content
QUICK REVIEW

[論文レビュー] On Laughter and Speech-Laugh, Based on Observations of Child-Robot Interaction

Anton Batliner, Stefan Steidl|arXiv (Cornell University)|Aug 30, 2019
Digital Communication and Language被引用数 7
ひとこと要約

本研究では、FAU Aibo Emotion Corpus を用いて、子供とロボットの対話における無意識的な笑いと会話付きの笑いを分析し、構文的・対話的・音響的特性を検討した。笑いが対話の構成要素として機能しており、音響的にも明確に特徴づけられることを示した。特徴選択により、自動検出に有効なモジュレーションおよびスペクトルダイナミクスの特徴が特定された。

ABSTRACT

In this article, we study laughter found in child-robot interaction where it had not been prompted intentionally. Different types of laughter and speech-laugh are annotated and processed. In a descriptive part, we report on the position of laughter and speech-laugh in syntax and dialogue structure, and on communicative functions. In a second part, we report on automatic classification performance and on acoustic characteristics, based on extensive feature selection procedures.

研究の動機と目的

  • 子供とロボットの対話における無意識的な笑いの役割と音響的特性を調査すること、ここで笑いは意図的に誘発されていない。
  • 音響的特徴と特徴選択手法を用いて、笑いと会話付きの笑いを自動分類すること。
  • 自然な対話における笑いの構文的および対話的配置と、そのコミュニケーション的機能を検討すること。
  • 笑いと会話付きの笑い、およびそれらのサブタイプを区別するための音響的特徴を同定すること。

提案手法

  • 51名の子供(10–13歳)がロボット(Aibo)とウィザード・オブ・オズの設定で対話する、ドイツ語の自然な会話コーパスであるFAU Aibo Emotion Corpusを用いた。
  • 感情状態、構文的境界、およびコミュニケーション的機能(句読点や強調の役割を含む)について、笑いと会話付きの笑いをアノテートした。
  • 相関に基づく特徴サブセット選択(CFS)を用い、語ベース、ターンベース、全体の3段階の分類レベルにおいて関連する音響的特徴を同定した。
  • 低レベルの音響記述子(例:メル周波数ケプストラル係数、スペクトルロールオフ、エネルギー分布、音声確率)を抽出し、モジュレーションおよび分布関数を導出した。
  • 選択された特徴を用いて機械学習による笑いの分類を行い、語レベル、ターンレベル、全体の検出タスクにおける性能を比較した。
  • ターンレベルの検出においてスペクトルフラックスのモジュレーションを分析し、笑いの間におけるスペクトルダイナミクスの変化に注目した。

実験結果

リサーチクエスチョン

  • RQ1子供とロボットの対話において、笑いは構文的および対話的構造のどの位置に位置づけられるか?
  • RQ2自然な子供とロボットの対話における笑いと会話付きの笑いのコミュニケーション的役割は何か?
  • RQ3笑いと会話付きの笑いを会話から、および互いに区別するのに最も適した音響的特徴は何か?
  • RQ4特徴選択と音響モデリングを用いた笑いと会話付きの笑いの自動分類はどの程度有効か?
  • RQ5信号のモジュレーションおよびスペクトル分布は、会話から笑いを区別するために果たす役割は何か?

主な発見

  • コーパス全体の0.4%が笑いのインスタンスを占めており、これは発生頻度が低いが、データの自然さは高いことを示している。
  • 会話付きの笑いは一貫して内部構文的位置を避ける傾向にあり、配置に強い構文的制約があることが示唆された。
  • 笑いはしばしば対話の「句読点」として機能し、ターンまたはタスクの境界を示していた。
  • 特徴選択により、第4メル周波数ケプストラル係数のモジュレーション、音声確率、スペクトルエネルギー分布が笑いの区別に重要な特徴であると特定された。
  • スペクトルフラックスのモジュレーションはターンレベルの笑い検出において顕著な特徴であり、笑い中に特徴的なスペクトルダイナミクスの変化を示した。
  • 自動分類の性能はターンレベルの検出では有望であったが、同じ主クラス内での微細なサブタイプの区別は困難であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。