Skip to main content
QUICK REVIEW

[論文レビュー] TorchAudio: Building Blocks for Audio and Speech Processing

Yao-Yuan Yang, Moto Hira|arXiv (Cornell University)|Oct 28, 2021
Music and Audio Processing被引用数 14
ひとこと要約

TorchAudio は、GPU で加速され、微分可能で生産環境向けの音声および音声処理用のビルディングブロックを提供する、PyTorch ネイティブでオープンソースのツールキットです。テキスト音声変換や音声分離などの主要なタスクにおいて、妥当性が検証されたパフォーマンスを実現し、速度および品質の面で最先端の実装を上回るか同等の性能を発揮します。

ABSTRACT

This document describes version 0.10 of TorchAudio: building blocks for machine learning applications in the audio and speech processing domain. The objective of TorchAudio is to accelerate the development and deployment of machine learning applications for researchers and engineers by providing off-the-shelf building blocks. The building blocks are designed to be GPU-compatible, automatically differentiable, and production-ready. TorchAudio can be easily installed from Python Package Index repository and the source code is publicly available under a BSD-2-Clause License (as of September 2021) at https://github.com/pytorch/audio. In this document, we provide an overview of the design principles, functionalities, and benchmarks of TorchAudio. We also benchmark our implementation of several audio and speech operations and models. We verify through the benchmarks that our implementations of various operations and models are valid and perform similarly to other publicly available implementations.

研究の動機と目的

  • PyTorch エコシステム内での音声および音声機械学習アプリケーションの開発およびデプロイを加速すること。
  • GPU 対応で自動微分が可能で、エンドツーエンドの学習に適した統合的で生産環境向けのツールキットを提供すること。
  • コア演算の標準的で高品質な実装を提供することで、上位レベルの音声/音声ツールキットの基盤となること。
  • PyTorch を超える外部依存関係を最小限に抑えることで、広範な互換性と保守性を確保すること。
  • パフォーマンスベンチマークが強く、安定的でコミュニティ主導のオープンソース基盤を確立すること。

提案手法

  • 音声 I/O、スペクトログラム計算、データセットローディングを、PyTorch と互換性があり、GPU で加速された操作として実装すること。
  • すべてのコア演算を、PyTorch の autograd システムを用いて自動的に微分可能に設計すること。
  • 主要なコンponent を TorchScript にコンパイルすることで、生産環境での実行およびモバイル・組み込みプラットフォームへのデプロイを保証すること。
  • 実行時間と出力品質の両面で、基準実装と比較してコア演算およびモデル(例:WaveRNN、Tacotron2、Conv-TasNet)をベンチマークすること。
  • 標準化されたデータセット(LJSpeech、Libri2Mix)とメトリクス(MCD、Si-SDRi、MOS)を用いて、客観的な評価を行うこと。
  • 複数の GPU でのスケーラブルなモデル学習を実現するため、DistributedDataParallel を活用して分散学習を実装すること。
Fig. 1 : The mean and standard error of the running time over five repeated experiments. We compare over five different audio processing functions using the implementations from TorchAudio (including just-in-time compiled (jitted) and GPU accelerated versions) and librosa .
Fig. 1 : The mean and standard error of the running time over five repeated experiments. We compare over five different audio processing functions using the implementations from TorchAudio (including just-in-time compiled (jitted) and GPU accelerated versions) and librosa .

実験結果

リサーチクエスチョン

  • RQ1PyTorch ネイティブのツールキットは、GPU 対応で微分可能かつ生産環境向けの音声処理ビルディングブロックを提供でき、既存の実装を上回るか同等の性能を発揮できるか?
  • RQ2TorchAudio の音声処理演算の実行性能およびモデル推論性能は、基準実装と比較して、速度および出力品質の面でどの程度優れているか?
  • RQ3TorchAudio は、PyTorch エコシステム内での上位レベルの音声/音声ツールキットの基盤的依存関係として、どの程度有効に機能できるか?
  • RQ4TorchAudio が実装するエンドツーエンドモデル(例:Tacotron2 や WaveRNN)は、公表済みのモデルと同等または優れた性能を発揮するか?
  • RQ5コミュニティの採用状況およびコントリビューションメトリクスから見て、TorchAudio は実際の開発においてどの程度スケーラブルで保守可能か?

主な発見

  • TorchAudio が実装する音声処理演算は、公開の基準実装と同等またはそれ以上の実行時間性能を達成しています。
  • Tacotron2 の実装は、メルcepストラル歪み(MCD)が 2.305 であり、Nvidia の実装(2.294)とほぼ同等の出力品質を達成しています。
  • WaveRNN の実装は、fatchord および Nvidia のモデルと同等の主観的品質を発揮しており、平均意見スコア(MOS)が人間の発話と高い知覚的類似性を示しています。
  • Libri2Mix における Conv-TasNet 実装は、Asteroid のベースラインを上回り、Si-SDRi 15.3 dB、SDRi 15.6 dB を達成しました(ベースラインはそれぞれ 14.7 dB および 15.1 dB)。
  • TorchAudio が DistributedDataParallel を使用することで、fatchord の実装よりも高速な学習が可能となり、現代的な PyTorch 学習パターンによるパフォーマンス向上が実証されました。
  • 2021年9月現在、TorchAudio を使用する公開リポジトリは 5,420 件以上、フォークは 350 を超え、マージされたプルリクエストは 1,250 を超えており、コミュニティの広範な採用と活発な開発が示されています。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。