Skip to main content
QUICK REVIEW

[论文解读] Shimon the Rapper: A Real-Time System for Human-Robot Interactive Rap Battles

Richard Savery, Lisa Zahray|arXiv (Cornell University)|Sep 19, 2020
Artificial Intelligence in Games参考文献 22被引用 9
一句话总结

本文提出了 Shimon the Rapper,这是一个实时交互系统,使人类与机器人能够通过分析语音输入、使用基于音素的深度学习生成押韵歌词,并同步机器人动作与语音输出,从而进行现场说唱对决。该系统实现了低延迟性能,并经过积极评估,参与者更偏好响应输入的输出,且对说唱生成的连贯性、押韵质量及愉悦度评分显著更高。

ABSTRACT

We present a system for real-time lyrical improvisation between a human and a robot in the style of hip hop. Our system takes vocal input from a human rapper, analyzes the semantic meaning, and generates a response that is rapped back by a robot over a musical groove. Previous work with real-time interactive music systems has largely focused on instrumental output, and vocal interactions with robots have been explored, but not in a musical context. Our generative system includes custom methods for censorship, voice, rhythm, rhyming and a novel deep learning pipeline based on phoneme embeddings. The rap performances are accompanied by synchronized robotic gestures and mouth movements. Key technical challenges that were overcome in the system are developing rhymes, performing with low-latency and dataset censorship. We evaluated several aspects of the system through a survey of videos and sample text output. Analysis of comments showed that the overall perception of the system was positive. The model trained on our hip hop dataset was rated significantly higher than our metal dataset in coherence, rhyme quality, and enjoyment. Participants preferred outputs generated by a given input phrase over outputs generated from unknown keywords, indicating that the system successfully relates its output to its input.

研究动机与目标

  • 开发一个实时系统,实现在说唱风格下人类说唱者与机器人之间的互动式即兴填词。
  • 克服在低延迟处理、押韵生成和语音合成方面实现语音交互的技术挑战。
  • 创建从人类语音输入到同步机器人语音与动作输出的完整集成流程。
  • 评估用户对系统歌词质量、连贯性及对输入响应性的感知。
  • 通过一种新型机器人表演者,探索具身人工智能在音乐协作中的潜力。

提出的方法

  • 系统使用对人类说唱输入的实时音频分析,提取语义关键词和语音特征。
  • 基于音素嵌入的定制深度学习流程,生成与输入语义和节奏语境相符的押韵歌词。
  • 通过基于规则的系统生成说唱节奏,将歌词音节与音乐节拍对齐,确保时间准确性。
  • 使用实时声码器进行语音合成,生成与生成歌词和节奏相匹配的机器人歌唱。
  • 通过预设的动作映射,将机器人的手势和嘴部动作与语音输出同步,映射关系基于歌词内容和语调。
  • 系统包含一种内容过滤机制,可过滤不当语言,确保输出符合社会规范。

实验结果

研究问题

  • RQ1机器人能否在实时响应现场人类语音输入的情况下,生成连贯、押韵且节奏准确的说唱歌词?
  • RQ2该系统在歌词质量与用户感知方面,与金属乐等其他音乐类型相比表现如何?
  • RQ3用户在多大程度上认为机器人的输出与输入短语具有语境相关性?
  • RQ4与随机关键词生成相比,基于输入的生成方式在用户偏好上是否有显著影响?
  • RQ5用户如何评价机器人生成说唱的整体愉悦度、连贯性及押韵质量?

主要发现

  • 参与者显著更偏好基于给定输入短语生成的歌词,而非随机关键词生成的歌词,单样本 t 检验 p 值为 0.00033(平均分:6.2/10)。
  • 说唱数据集在连贯性(p = 0.027)和押韵质量(p = 0.017)方面评分显著高于金属乐数据集。
  • 愉悦度在说唱数据集中也显著更高(p = 0.046),但愉悦度与其他指标(如节奏或质量)之间未发现强相关性。
  • 该系统实现了低延迟性能,支持人类与机器人以说唱对决形式进行实时互动。
  • 用户一致认为系统表现富有表现力,且优于预期,许多人指出机器人的回应具有新颖性和创造力。
  • 评估结果表明,语音质量和表现力是用户感知的核心因素,而歌词内容在定性反馈中所受关注较少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。