Skip to main content
QUICK REVIEW

[論文レビュー] Shimon the Rapper: A Real-Time System for Human-Robot Interactive Rap Battles

Richard Savery, Lisa Zahray|arXiv (Cornell University)|Sep 19, 2020
Artificial Intelligence in Games参考文献 22被引用数 9
ひとこと要約

本稿では、音声入力を分析し、音節ベースのディープラーニングを用いて韻を踏んだ歌詞を生成し、ロボットのジェスチャーと音声出力を同期させるリアルタイム相互作用型システム「Shimon the Rapper」を提示する。このシステムは低遅延性能を達成しており、参加者による評価でも、入力に応じた出力が好まれ、ヒップホップ風の歌詞の整合性、韻の質、満足度が顕著に高く評価された。

ABSTRACT

We present a system for real-time lyrical improvisation between a human and a robot in the style of hip hop. Our system takes vocal input from a human rapper, analyzes the semantic meaning, and generates a response that is rapped back by a robot over a musical groove. Previous work with real-time interactive music systems has largely focused on instrumental output, and vocal interactions with robots have been explored, but not in a musical context. Our generative system includes custom methods for censorship, voice, rhythm, rhyming and a novel deep learning pipeline based on phoneme embeddings. The rap performances are accompanied by synchronized robotic gestures and mouth movements. Key technical challenges that were overcome in the system are developing rhymes, performing with low-latency and dataset censorship. We evaluated several aspects of the system through a survey of videos and sample text output. Analysis of comments showed that the overall perception of the system was positive. The model trained on our hip hop dataset was rated significantly higher than our metal dataset in coherence, rhyme quality, and enjoyment. Participants preferred outputs generated by a given input phrase over outputs generated from unknown keywords, indicating that the system successfully relates its output to its input.

研究の動機と目的

  • 人間のラッパーとロボットがヒップホップのスタイルで即興的な歌詞のやり取りを行うリアルタイムシステムの開発。
  • 音声インタラクションにおける低遅延処理、韻の生成、音声合成という技術的課題の克服。
  • 人間の音声入力から同期されたロボットの音声およびジェスチャー出力までを統合したパイプラインの構築。
  • システムの歌詞の質、整合性、入力への反応性に関するユーザーの認識の評価。
  • 新規のロボットパフォーマーを通じて、身体的なAIが音楽的協働に与える可能性の探求。

提案手法

  • 人間のラップ入力のリアルタイム音声分析により、意味的キーワードと音声的特徴を抽出する。
  • 音節埋め込みに基づくカスタムディープラーニングパイプラインが、入力の意味的・リズミカルな文脈に合った韻を踏んだ歌詞を生成する。
  • リズムはルールベースのシステムにより、歌詞の syllable を音楽のビートに合わせて整列させ、タイミングの正確性を保証する。
  • リアルタイムボコーダーを用いて音声合成を行い、生成された歌詞とリズムに合ったロボットの歌唱を実現する。
  • 歌詞の内容とプロソディーに紐づけられた事前定義のジェスチャー対応表を用いて、ロボットのジェスチャーと口の動きを音声出力と同期させる。
  • 不適切な言語をフィルタリングするためのセンシング機構を備え、社会的に許容できる出力を保証する。

実験結果

リサーチクエスチョン

  • RQ1ロボットは、ライブの人の声の入力に対して、リアルタイムで整合的で韻を踏み、リズム的に正確なラップの歌詞を生成できるか?
  • RQ2ヒップホップとメタルといった異なる音楽ジャンルにおいて、システムの歌詞の質とユーザーの認識はどのように異なるか?
  • RQ3ユーザーは、ロボットの出力が入力フレーズに対して文脈的に関連しているとどれほど感じているか?
  • RQ4入力に特化した生成とランダムキーワード生成のどちらがユーザーの好みに合うか?
  • RQ5ユーザーは、ロボットが生成したラップの全体的な満足度、整合性、韻の質をどの程度高く評価するか?

主な発見

  • 参加者は与えられた入力フレーズから生成された歌詞を、ランダムキーワードから生成されたものよりも顕著に好んだ。一標本t検定のp値は0.00033(平均スコア:6.2/10)。
  • ヒップホップデータセットは金属系データセットよりも整合性(p = 0.027)と韻の質(p = 0.017)で顕著に高い評価を受けた。
  • 満足度についてもヒップホップデータセットが顕著に高く評価された(p = 0.046)。ただし、リズムや品質といった他の指標と満足度の間に強い相関は確認されなかった。
  • システムは低遅延性能を達成しており、人間とロボットがラップバトル形式でリアルタイムで相互作用できる。
  • ユーザーは、システムの表現力が高く、予想を上回ると一貫して評価した。多くのユーザーが、ロボットの反応の新奇性と創造性に注目した。
  • 評価結果から、音声の質と表現力がユーザー認識において中心的役割を果たしており、定性的フィードバックでは歌詞の内容にあまり重きを置かれていないことが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。