Skip to main content
QUICK REVIEW

[論文レビュー] Engagement Detection in Meetings

Maria Frank, Ghassem Tofighi|arXiv (Cornell University)|Aug 31, 2016
Personal Information Management and User Behavior参考文献 9被引用数 9
ひとこと要約

本論文は、2次元/3次元イメージング、音声、およびモーショングレーデータを用いて、グループ会議における参加者を6つの関与状態に分類するリアルタイム関与検出のためのマルチモーダルフレームワークを提案する。本システムは、行動をとる意思がある状態を分類する際、83.36%の正確性を達成しており、会議の生産性と参加者の意識向上のための動的フィードバックを可能にする。

ABSTRACT

Group meetings are frequent business events aimed to develop and conduct project work, such as Big Room design and construction project meetings. To be effective in these meetings, participants need to have an engaged mental state. The mental state of participants however, is hidden from other participants, and thereby difficult to evaluate. Mental state is understood as an inner process of thinking and feeling, that is formed of a conglomerate of mental representations and propositional attitudes. There is a need to create transparency of these hidden states to understand, evaluate and influence them. Facilitators need to evaluate the meeting situation and adjust for higher engagement and productivity. This paper presents a framework that defines a spectrum of engagement states and an array of classifiers aimed to detect the engagement state of participants in real time. The Engagement Framework integrates multi-modal information from 2D and 3D imaging and sound. Engagement is detected and evaluated at participants and aggregated at group level. We use empirical data collected at the lab of Konica Minolta, Inc. to test initial applications of this framework. The paper presents examples of the tested engagement classifiers, which are based on research in psychology, communication, and human computer interaction. Their accuracy is illustrated in dyadic interaction for engagement detection. In closing we discuss the potential extension to complex group collaboration settings and future feedback implementations.

研究の動機と目的

  • グループ会議における関与状態の検出と分類のためのリアルタイムフレームワークを開発すること。
  • 特に関与と行動意思といった隠れた精神状態の透明性を高め、ファシリテーターが会議のダイナミクスを調整するのを支援すること。
  • eRingプロトタイプを拡張し、身体の動きに加えて、姿勢、顔の表情、音声、モーションといったマルチモーダル入力を統合すること。
  • 個別およびグループレベルでのフィードバックメカニズムを実装し、関与が薄らいだ参加者を再関与させたり、会議の焦点をシフトさせること。
  • Big Roomデザイン会議のような複雑な共同作業環境におけるスケーラブルなセンサー基盤の関与モニタリングの基盤を構築すること。

提案手法

  • フレームワークは、行動的・知覚的側面の兆候に基づき、6つの状態(聞く、観察する、話している、行動している、行動する意思がある、関与していない)に関与状態を分類する。
  • 2次元/3次元カメラ、音声、モーションセンサーからのマルチモーダルデータストリームをリアルタイムで処理し、手の速度、姿勢、顔の表情などの特徴を抽出する。
  • サポートベクターマシン(SVM)を用いて関与状態を分類し、フレーム処理時間が10ms未満であるため、30fpsでのリアルタイム動作が可能である。
  • 動的関与テーブルを用いて、部屋内の参加者と物体間の潜在的関与レベルを追跡し、意図に基づく相互作用を支援する。
  • 分類器はモジュラーかつ拡張可能であり、将来的な拡張にあたって音声や生体情報データなどの追加モダリティの統合が可能である。
  • 初期実装では、二重会話(dyadic interactions)に焦点を当て、コニカミノルタ研究所の実地データを用いて分類器のトレーニングと検証が行われた。

実験結果

リサーチクエスチョン

  • RQ1マルチモーダルセンサーのデータを用いて、グループ会議における関与を効果的に検出し分類することは可能か?
  • RQ2協働環境において、関与と行動する意思の信頼性の高い行動的・知覚的指標は何か?
  • RQ3リアルタイムの関与分類が、フィードバックメカニズムを通じて会議のダイナミクスと参加者の生産性を向上させられるか?
  • RQ4提案されたマルチモーダル分類システムは、リアルタイムで関与状態を検出する上で、どれほど正確で効率的か?
  • RQ5Big Roomプロジェクト会議のような複雑な環境における、自動化された関与フィードバックの会議ファシリテーションとチーム協働への影響は何か?

主な発見

  • 関与分類器は、二重会話における「行動する意思がある」状態を検出する際、分類正確度83.36%を達成した。
  • フレーム処理時間が10ms未満であるため、30fpsでのリアルタイム運用が可能であることが確認された。
  • 本システムは、個別およびグループレベルでの関与状態を効果的に検出し集約でき、動的フィードバックを可能にした。
  • 関与が40%を超える参加者にわたって低下している場合、公開アラート(「グループが関与していない」)やeRingのような視覚的シグナルを発動できる。
  • モジュラー設計により、将来的に音声、顔の表情、生体情報データなどの追加モダリティを統合し、正確性を向上させることができる。
  • 本フレームワークは、方向性のある姿勢と関与レベルに基づき、スマートルーム内の応答性のあるオブジェクトが、どのユーザーがどのオブジェクトと相互作用しようとしているかを特定する操作意図フィードバックをサポートする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。