Skip to main content
QUICK REVIEW

[논문 리뷰] ANGUS: Real-time manipulation of vocal roughness for emotional speech transformations

Marco Liuni, Luc Ardaillon|arXiv (Cornell University)|2020. 08. 25.
Speech and Audio Processing참고 문헌 44인용 수 5
한 줄 요약

ANGUS는 실시간으로 작동하며 계산적으로 효율적인 알고리즘으로, 볼륨 조절과 시간 도메인 필터링을 통해 음성과 비음성 소리의 음성 거칠기를 조작하여 정서적 각성 효과를 시뮬레이션한다. 이 알고리즘은 청취자가 변형된 소리와 원본 소리를 신뢰성 있게 구분하지 못할 정도로 음성, 동물의 울음소리, 악기 소리의 정서적 부정성 인식을 효과적으로 높인다.

ABSTRACT

Vocal arousal, the non-linear acoustic features taken on by human and animal vocalizations when highly aroused, has an important communicative function because it signals aversive states such as fear, pain or distress. In this work, we present a computationally-efficient, real-time voice transformation algorithm, ANGUS, which uses amplitude modulation and time-domain filtering to simulate roughness, an important component of vocal arousal, in arbitrary voice recordings. In a series of 4 studies, we show that ANGUS allows parametric control over the spectral features of roughness like the presence of sub-harmonics and noise; that ANGUS increases the emotional negativity perceived by listeners, to a comparable level as a non-real-time analysis/resynthesis algorithm from the state-of-the-art; that listeners cannot distinguish transformed and non-transformed sounds above chance level; and that ANGUS has a similar emotional effect on animal vocalizations and musical instrument sounds than on human vocalizations. A real-time implementation of ANGUS is made available as open-source software, for use in experimental emotion reseach and affective computing.

연구 동기 및 목표

  • 실시간으로 작동하며 계산적으로 효율적인 음성 거칠기 조작 방법을 개발하여 정서적 음성 변환을 구현한다.
  • 사전 녹음된 음성에 비선형적인 음성 특징(예: 서하모닉스와 잡음)을 추가하기 위한 실시간 솔루션의 부족을 보완한다.
  • 임의의 오디오 신호에서 서하모닉스와 스펙트럼 잡음 등의 거칠기 성분에 대한 매개변수 제어를 가능하게 한다.
  • ANGUS의 정서적 영향을 인간의 음성, 동물의 울음소리, 악기 소리에 대해 평가하며, 비실시간 최첨단 방법과 비교한다.
  • 청취자가 변형된 소리와 원본 소리를 구별할 수 있는지 여부를 평가한다.

제안 방법

  • 저주파수 조절 신호를 사용하여 원본 신호에 볼륨 조절을 적용함으로써 서하모닉스 성분을 생성한다.
  • 조절된 신호의 스펙트럼 응답을 형상화하기 위해 시간 도메인 필터를 사용하여 거칠기 특징을 강조한다.
  • 캐리어 신호를余弦 파형으로 모델링하고, 조절 신호를 깊이 h ∈ [0,1]를 가진余弦 파형으로 설정함으로써 (ωc ± ωm) 주파수에서 사이드밴드를 생성한다.
  • 출력 신호는 원본 캐리어와 두 사이드밴드로 분해되며, y(t) = x_c(t) + y^+(t) + y^-(t)로 표현되며, 이는 서하모닉스 에너지를 생성한다.
  • 실시간 오디오 스트림의 동적 조작을 위해 알고리즘을 실시간 처리 파이프라인에 통합한다.
  • ANGUS를 비실시간 분석-재생 방법과 비교하여 정서적 변환의 정밀도를 평가한다.

실험 결과

연구 질문

  • RQ1ANGUS는 서하모닉스와 잡음과 같은 음성 거칠기와 관련된 스펙트럼 특징을 얼마나 정밀하게 매개변수 제어할 수 있는가?
  • RQ2ANGUS는 비실시간 최첨단 방법과 유사한 수준으로 청취자가 정서적으로 더 부정적으로 느끼게 하는가?
  • RQ3청취자는 청각 테스트에서 ANGUS로 변형된 음성과 변형되지 않은 음성을 신뢰성 있게 구별할 수 있는가?
  • RQ4ANGUS는 인간의 음성 외의 음향(예: 동물의 울음소리, 악기 소리)에도 인간 음성과 유사한 정서적 영향을 미치는가?
  • RQ5맥락적 요소와 음향적 요소(예: 음고, 음량)가 ANGUS에 의해 유도된 거칠기와 정서적 인식에 어떻게 상호작용하는가?

주요 결과

  • ANGUS는 볼륨 조절과 필터링을 통해 서하모닉스와 잡음 등의 거칠기 특징에 대한 매개변수 제어를 성공적으로 구현하였다.
  • 청취자는 ANGUS로 변형된 음성을 비실시간 최첨단 분석-재생 방법과 유사한 수준으로 더 정서적으로 부정적으로 인식하였다.
  • 청취자는 변형된 음성과 변형되지 않은 음성을 우연의 수준을 초월해 신뢰성 있게 구별하지 못했으며, 이는 높은 청각적 자연스러움을 의미한다.
  • ANGUS의 정서적 효과는 인간의 음성, 동물의 울음소리, 악기 소리에 걸쳐 일관되게 나타나 cross-domain 전이 가능성(이행성)을 입증하였다.
  • 평균 음고는 정서적 부정성 인식에 Δ = +1.0의 영향을 미쳤으며, 이는 음고와 거칠기가 독립적이지만 누적되는 정서적 신호로 작용할 수 있음을 시사한다.
  • 기준으로 사용된 CONTROL 알고리즘은 변형되지 않은 자료보다 더 자연스럽게 평가되었는데, 이는 청각적 편향 또는 짧은 600ms 클립에서 음향 복잡도가 감소했기 때문일 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.