Skip to main content
QUICK REVIEW

[論文レビュー] Pansori: ASR Corpus Generation from Open Online Video Contents

Yoona Choi, Bowon Lee|arXiv (Cornell University)|Dec 23, 2018
Speech Recognition and Synthesis参考文献 8被引用数 5
ひとこと要約

本論文では、クラウドベースの音声認識APIを活用して、公開オンライン動画コンテンツから高品質な自動音声認識(ASR)コーパスを準自動的に生成するオープンソースフレームワークPansoriを提示する。コミュニティが翻訳した字幕を備えた韓国語のTEDxトークを処理することで、研究およびコミュニティ利用を目的として、許可が緩いライセンスで公開された、最初のフリーで高品質な韓国語ASRコーパスであるPansori-TEDxKRデータセットを構築した。

ABSTRACT

This paper introduces Pansori, a program used to create ASR (automatic speech recognition) corpora from online video contents. It utilizes a cloud-based speech API to easily create a corpus in different languages. Using this program, we semi-automatically generated the Pansori-TEDxKR dataset from Korean TED conference talks with community-transcribed subtitles. It is the first high-quality corpus for the Korean language freely available for independent research. Pansori is released as an open-source software and the generated corpus is released under a permissive public license for community use and participation.

研究の動機と目的

  • 韓国語のような低リソース言語向けに、高品質で公開可能なASRコーパスの不足を解消すること。
  • 公開済みの動画コンテンツに字幕が付いている場合に、スケーラブルで自動化されたASR学習データ生成パイプラインを開発すること。
  • 既存のコミュニティによる字幕を活用することで、手動による音声データセット作成作業を削減すること。
  • Pansoriソフトウェアフレームワークおよび生成されたPansori-TEDxKRデータセットを、研究コミュニティが自由に利用可能なオープンソースリソースとして公開すること。

提案手法

  • Pansoriフレームワークは、主に韓国語のTEDxトーク動画から音声を抽出する。
  • 抽出された音声を、クラウドベースの音声認識APIを用いてテキストに変換する。
  • 強制アラインメント技術を用いて、自動生成された発話と既存のコミュニティによる字幕をアラインメントする。
  • 精度と一貫性を確保するため、トランスクリプション品質の高いペアを検証およびフィルタリングする。
  • 最終的なデータセットは、高信頼度で適切にアラインされた音声-トランスクリプションペアのみを含むようにキュレートされる。
  • パイプライン全体はオープンソースソフトウェアとして実装されており、再現性とコミュニティ貢献を可能にしている。

実験結果

リサーチクエスチョン

  • RQ1最小限の手作業で、公開済みの動画コンテンツから高品質なASRコーパスを準自動パイプラインで生成できるか?
  • RQ2コミュニティ提供の字幕と自動生成された発話のアラインメントは、正確な学習データを生成するためにどの程度有効か?
  • RQ3クラウドベースのASRAPIを活用して、スケールアップ可能な多言語ASRデータセットをどの程度構築できるか?
  • RQ4コミュニティによる字幕をゴールドスタンダードとして使用することで、自動生成されたASRコーパスの品質はどの程度向上するか?
  • RQ5オープンソースソフトウェアとデータ共有は、低リソース音声認識分野の研究をどの程度加速できるか?

主な発見

  • Pansoriフレームワークは、韓国語向けに、公開済みで高品質なASRコーパスとして、Pansori-TEDxKRデータセットを成功裏に生成した。
  • データセットには、コミュニティ字幕付きのTEDxトークから得られた、高精度でアラインメントされた音声-トランスクリプションペアが多数含まれている。
  • クラウドベースのASRAPIの活用により、手動によるトランスクリプションの必要性が低減され、大規模なコーパス作成が迅速に可能になった。
  • 生成されたコーパスは、許可が緩いオープンライセンスで公開されており、再利用とコミュニティ主導の開発を促進している。
  • Pansoriソフトウェアのオープンソース性により、研究者が他の言語や動画ソース向けにパイプラインをカスタマイズ・拡張できる。
  • 本研究は、既存のオンラインコンテンツから低コストで高品質なASRデータセットを構築する、実用的でスケーラブルな手法を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。