Skip to main content
QUICK REVIEW

[論文レビュー] HARMONIC: A Multimodal Dataset of Assistive Human-Robot Collaboration

Benjamin A. Newman, Reuben M. Aronson|arXiv (Cornell University)|Jul 30, 2018
Cognitive Functions and Memory被引用数 7
ひとこと要約

HARMONIC は、6自由度のロボットアームを用いた補助食事タスクにおける人間-ロボット協働を捉えた大規模なマルチモーダルデータセットである。視線、EMG、ステレオ映像、ジョイスティック入力、ロボットの運動学的データを統合することで、補助的ロボティクス分野における意図予測、共有自律性、人間の心理状態モデリングの研究を可能にする。

ABSTRACT

We present the Human And Robot Multimodal Observations of Natural Interactive Collaboration (HARMONIC) data set. This is a large multimodal data set of human interactions with a robotic arm in a shared autonomy setting designed to imitate assistive eating. The data set provides human, robot, and environmental data views of twenty-four different people engaged in an assistive eating task with a 6 degree-of-freedom (DOF) robot arm. From each participant, we recorded video of both eyes, egocentric video from a head-mounted camera, joystick commands, electromyography from the forearm used to operate the joystick, third person stereo video, and the joint positions of the 6 DOF robot arm. Also included are several features that come as a direct result of these recordings, such as eye gaze projected onto the egocentric video, body pose, hand pose, and facial keypoints. These data streams were collected specifically because they have been shown to be closely related to human mental states and intention. This data set could be of interest to researchers studying intention prediction, human mental state modeling, and shared autonomy. Data streams are provided in a variety of formats such as video and human-readable CSV and YAML files.

研究の動機と目的

  • 補助的ロボティクス分野における研究を支援するため、共有自律性設定下での人間-ロボット相互作用の包括的でマルチモーダルなデータセットの構築を目的とする。
  • タスク実行中の人間の意図や心理状態に関連する非言語的行動的兆候(視線、EMG、姿勢など)を捉えることを目的とする。
  • 複数のセンサーからの時間的に同期された高精細なデータストリームを提供することで、意図推論と人間-ロボット協調の研究を可能にする。
  • 直接遠隔操作とロボット補助制御の両条件を含めることで、共有自律性に関する研究を支援する。
  • 人間行動モデル、意図予測、適応的ロボット制御のベンチマーク評価を可能にする、標準化された公開データセットを提供する。

提案手法

  • 6自由度のKinova Micoロボットアームを用いて、24名の参加者が補助的食事タスクを実行する際の同期データを収集した。
  • エゴセントリックなRGB映像、赤外線を用いた双眼視線追跡、第三人称ステレオ映像、2次元ジョイスティックによる入力(手動モード切替機能付き)を記録した。
  • ジョイスティックを操作する前腕部からの筋電図(EMG)信号と、ロボットアームの関節位置をキャプチャした。
  • 視線をエゴセントリック映像上に投影し、コンピュータビジョンパイプラインを用いて身体ポーズ、手のポーズ、顔のキーポイントを抽出した。
  • ステレオ映像のキャプチャにStereolabs ZEDを用い、すべてのモダリティ間でのタイムスタンプ同期を実現した。
  • アクセス性と再現可能性を高めるために、H.264映像、CSV、YAML、NumPy配列などの複数形式でデータを保存した。

実験結果

リサーチクエスチョン

  • RQ1補助的ヒューマンロボット協働の過程で、視線パターンはタスク関連の物体との相互作用とどのように相関しているか?
  • RQ2EMG信号とジョイスティック入力は、遠隔操作におけるロボット操作の意図をどの程度正確に予測できるか?
  • RQ3直接遠隔操作と共有自律性の異なる制御モードは、人間-ロボット協調性や行動ダイナミクスにどのように影響を及えるか?
  • RQ4視線、EMG、ポーズといったマルチモーダル信号を効果的に統合することで、人間の意図を推定し、ロボットの支援を向上させることができるか?
  • RQ5多様な個人を対象とした実世界の補助的タスクにおいて、行動信号(視線、EMGなど)の信頼性と一貫性はどの程度か?

主な発見

  • HARMONIC データセットには24名の参加者が含まれ、視線、EMG、ステレオ映像、ロボット関節状態を含む7つのセンサーストリームからなる同期マルチモーダルデータが収集された。
  • 視線は、物理的接触の直前には常にタスク関連の対象(例:食べ物の一口分)を向いており、意図推定における予測的価値が確認された。
  • ジョイスティック入力と関連する明確なパターンを示す前腕部のEMG信号が検出され、これにより意図モデリングへの応用が可能であることが裏付けられた。
  • 直接遠隔操作(制御モード0)と共有自律性(制御モード3)の両条件がデータセットに含まれており、ロボットの自律性に関する比較研究が可能である。
  • ジョイスティック入力は120 Hzに再サンプリングされ、タイムスタンプはUnixエポックに同期されており、時間的高精細度が確保された。
  • 計算負荷に起因する一部のデータ欠落が生じたが、HARP LabのウェブサイトおよびGitHubリポジトリを通じてバージョン管理付きで公開された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。