Skip to main content
QUICK REVIEW

[論文レビュー] The EMPATHIC Project: Mid-term Achievements

M. Inés Torres, Javier Mikel Olaso|arXiv (Cornell University)|May 5, 2021
Technology Use by Older Adults参考文献 35被引用数 12
ひとこと要約

EMPATHECプロジェクトは、話声、顔貌、および眼球追跡分析を用いて、高齢者のアクティブ・エイジングを支援する共感的でマルチモーダルなバーチャル・コーチの開発を進めている。中間段階の結果として、ウィザード・オブ・オズ(Wizard-of-Oz)プラットフォームの成功した統合、平均500msの遅延を達成した低遅延型ASRの改善、および高齢者ユーザーを対象とした多言語・リアルタイム仮想エージェント対話におけるユーザー参加度、対話フロー、技術的課題に関する知見が得られた。

ABSTRACT

The goal of active aging is to promote changes in the elderly community so as to maintain an active, independent and socially-engaged lifestyle. Technological advancements currently provide the necessary tools to foster and monitor such processes. This paper reports on mid-term achievements of the European H2020 EMPATHIC project, which aims to research, innovate, explore and validate new interaction paradigms and platforms for future generations of personalized virtual coaches to assist the elderly and their carers to reach the active aging goal, in the vicinity of their home. The project focuses on evidence-based, user-validated research and integration of intelligent technology, and context sensing methods through automatic voice, eye and facial analysis, integrated with visual and spoken dialogue system capabilities. In this paper, we describe the current status of the system, with a special emphasis on its components and their integration, the creation of a Wizard of Oz platform, and findings gained from user interaction studies conducted throughout the first 18 months of the project.

研究の動機と目的

  • 高齢者がテクノロジーを活用してアクティブで自立した生活を維持できるように支援する、パーソナライズされ、共感的なバーチャル・コーチの開発。
  • 話声、顔貌、および視線の分析を含むマルチモーダルセンシングを、高齢者ユーザー向けに応答性が高くリアルタイムな対話システムに統合すること。
  • 複数のヨーロッパ諸国における実世界の文脈で、受容性、参加度、使いやすさに焦点を当てたユーザー研究を通じて、システムの妥当性を検証すること。
  • 特に健康的な高齢者における行動変容を促す場面において、自然で流れのある人間-エージェント対話の課題を解決すること。
  • 多様な言語的・文化的ニーズに対応できる、安全で信頼性が高くスケーラブルなホーム環境への展開を可能にするプラットフォームの構築。

提案手法

  • リアルタイム仮想エージェント対話のシミュレーションを可能にする、ウィザード・オブ・オズ(Wizard-of-Oz)プラットフォームを用い、人間が中核を占めるコーチングを伴う制御されたユーザー研究を実施。
  • GStreamerフレームワークを活用した低遅延ストリーミングASRシステム「ASR.online」を開発し、平均遅延を約500msまで低減。
  • 1,574時間のトランスクリプト付き話声データを用いて、Kaldi ASpIREレシピを用いてスペイン語、フランス語、ノルウェー語の多言語音声モデルをトレーニング。
  • 感情状態および認知状態をリアルタイムで検出できる顔貌および眼球追跡分析モジュールを統合。
  • 仮想エージェントの受容性およびユーザーの認識を評価するための多言語アンケート(6言語)を設計。
  • スペイン、ノルウェー、フランス、イタリア、英国の高齢者(65歳以上)を対象に現地調査を実施し、システムの使いやすさおよび対話品質を評価。

実験結果

リサーチクエスチョン

  • RQ1話声、顔貌、および眼球追跡データを用いて、マルチモーダル仮想コーチは高齢者の感情状態および認知状態を効果的に検出し、適切に反応できるか?
  • RQ2どのような会話戦略が、仮想コーチングセッション中に高齢者ユーザーの参加度および共感の認識を高めるか?
  • RQ3ヨーロッパ諸国における言語的・文化的な違いが、多言語仮想コーチに対するユーザー受容性および対話品質にどのように影響するか?
  • RQ4ウェブベースの仮想エージェントプラットフォームにおいて、低遅延で安全かつ信頼性が保たれるリアルタイム対話の維持に伴う技術的課題は何か?
  • RQ5ユーザーの仮想エージェントに対する期待値や事前の認識が、その採用および参加意欲にどの程度影響を及えるか?

主な発見

  • ASR.onlineシステムは平均で約500ミリ秒の遅延を達成し、従来のバッファリング方式と比較して、リアルタイム応答性が顕著に向上した。
  • ウィザード・オブ・オズプラットフォームは制御されたユーザー研究を成功裏に実施でき、参加者の言葉をそのまま使用したバックチャンネリング戦略(例:「毎日2時間歩きますか?」)が、会話の流れと参加度を向上させたことが明らかになった。
  • 参加者の中には、個人の目標について話す意欲が薄く、会話が短時間で終わることが多かった。このため、対話を維持するために研究者が自発的に栄養関連トピックに話題をシフトさせる必要があった。
  • アンケートで「分からない」との回答が多数寄せられたことから、抽象的または享楽的(hedonic)な用語がうまく理解されていないことが判明。これにより、より明確で具体的なアンケート語彙の必要性が浮き彫りになった。
  • セッション管理およびリモート技術的サポートにおける技術的問題が遅延を引き起こした。今後の展開にあたっては、現地のインfraストラクチャの整備が不可欠であると示唆された。
  • 健康な参加者において予期しないほど高い抑うつスコアが観察されたことから、一部の尺度の妥当性に懸念が生じ、高齢者集団における測定ツールの再検討が今後の課題となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。