Skip to main content
QUICK REVIEW

[논문 리뷰] audino: A Modern Annotation Tool for Audio and Speech

Manraj Singh Grover, Pakhi Bamdev|arXiv (Cornell University)|2020. 06. 09.
Speech Recognition and Synthesis참고 문헌 15인용 수 4
한 줄 요약

audino는 현대적이고 웹 기반이며 오픈소스인 음성 및 음성 애너테이션 툴로, 중앙집중식 프로젝트 및 사용자 관리 기능을 통해 협업형 서버 기반 시간 분할, 음성 인식, 레이블링을 가능하게 합니다. ASR, VAD, 감정 인식 등의 다양한 NLP 및 음성 작업을 지원하며, Docker 배포 및 API 통합을 통해 확장성 있고 안전하며 효율적인 데이터셋 생성을 가능하게 하였고, 자동화된 평가 시스템을 위한 65시간 분량의 L2 영어 음성 녹음 데이터를 애너테이션하는 데 성공적으로 활용되었습니다.

ABSTRACT

In this paper, we introduce a collaborative and modern annotation tool for audio and speech: audino. The tool allows annotators to define and describe temporal segmentation in audios. These segments can be labelled and transcribed easily using a dynamically generated form. An admin can centrally control user roles and project assignment through the admin dashboard. The dashboard also enables describing labels and their values. The annotations can easily be exported in JSON format for further analysis. The tool allows audio data and their corresponding annotations to be uploaded and assigned to a user through a key-based API. The flexibility available in the annotation tool enables annotation for Speech Scoring, Voice Activity Detection (VAD), Speaker Diarisation, Speaker Identification, Speech Recognition, Emotion Recognition tasks and more. The MIT open source license allows it to be used for academic and commercial projects.

연구 동기 및 목표

  • 스케일링 가능하고 안전하며 중앙집중식으로 음성 데이터셋을 관리할 수 있는 현대적이고 협업형 서버 기반 음성 애너테이션 툴의 부족을 보완하기 위해.
  • 다양한 음성 및 NLP 작업을 위한 효율적이고 정확한 시간 분할, 음성 인식, 레이블링을 위한 오디오 데이터 처리를 가능하게 하기 위해.
  • 허용성 있는 MIT 라이선스를 통해 학술적 및 상업적 용도로 모두 사용 가능한 프로덕션 준비형, 접근 용이하고 확장 가능한 플랫폼을 제공하기 위해.
  • API 기반 데이터 업로드, 사전 레이블링된 데이터 임포트, 상호 애너테이터 일致도를 통한 자동 품질 추적 기능을 지원함으로써 대규모 데이터셋 생성을 간소화하기 위해.
  • 토큰 기반 인증, 해시된 파일명, 역할 기반 접근 제어를 통해 데이터 보안 및 프라이버시를 강화하기 위해.

제안 방법

  • 툴은 RESTful API와 React 기반 프론트엔드를 사용한 전체 스택 웹 애플리케이션으로 구축되었으며, 중앙집중식 데이터 스토리지가 있는 서버에서 호스팅됩니다.
  • 오디오 파일과 애너테이션은 중앙 데이터베이스에 저장되며, 사용자 액세스는 JSON 웹 토큰(JWT)과 역할 기반 권한으로 제어됩니다.
  • 애너테이터는 브라우저 기반 인터페이스를 통해 오디오 웨이브폼을 조작하며, 재생 컨트롤, 줌, 세그먼트 선택 기능을 이용해 레이블링을 위한 시간 기반 영역을 정의합니다.
  • 각 애너테이션 작업에 맞게 동적 폼이 생성되어, 각 세그먼트에 대한 음성 인식 및 사전 정의된 레이블(단일 또는 다중 선택) 입력이 가능합니다.
  • 관리자 대시보드를 통해 사용자, 역할, 프로젝트, 레이블, API 키를 생성하고 관리할 수 있어, 안전한 데이터 업로드 및 통합이 가능합니다.
  • 시스템은 애너테이션의 JSON 내보내기를 지원하여 머신러닝 파이프라인에서의 후속 사용이 가능하며, API를 통한 사전 학습 모델 통합을 통해 초기 레이블링 기능을 제공합니다.

실험 결과

연구 질문

  • RQ1현대적이고 협업형이며 안전한 웹 기반 애너테이션 툴은 오디오 및 음성 데이터셋 생성의 확장성과 효율성을 어떻게 향상시킬 수 있는가?
  • RQ2중앙집중식 프로젝트 및 사용자 관리 기능은 대규모 음성 애너테이션 프로젝트에서 오류를 줄이고 일관성을 향상시키는 데 어느 정도 기여하는가?
  • RQ3API 통합 및 사전 레이블링된 데이터 임포트 기능을 갖춘 웹 기반 툴은 음성 인식 및 평가 작업에서 수동 애너테이션의 노고를 얼마나 줄일 수 있는가?
  • RQ4이 툴은 화자 다이어라이제이션, 감정 인식, ASR 오류 보정과 같은 다양한 음성 애너테이션 작업을 얼마나 효과적으로 지원하는가?
  • RQ5중앙집중식 대시보드와 안전한 인증 기능은 협업 애너테이션 과정에서 데이터 프라이버시 및 액세스 제어를 향상시키는 데 어떤 역할을 하는가?

주요 결과

  • audino는 시뮬레이션된 구두 영어 능력 인터뷰에서 65시간 분량의 L2 영어 음성을 성공적으로 애너테이션하여, 사전 학습된 ASR 모델의 미세조정을 가능하게 하였습니다.
  • 두 명의 애너테이터가 데이터의 20%를 겹쳐 애너테이션하여, CRON 작업을 통해 자동으로 단어 오류율(WER)을 추적하고 오류를 표시할 수 있었습니다.
  • 상호 애너테이터 일치도는 자동 WER 계산을 통해 모니터링되었으며, 주요 음성 인식 오류는 토론을 통해 해결되어 데이터 품질이 향상되었습니다.
  • audino의 사용은 사전 레이블링된 데이터 임포트 및 반복적 수정 기능을 통해 데이터셋 준비 과정의 수동 작업을 줄였고, 자동화된 어휘 능력 평가 시스템 개발을 가속화시켰습니다.
  • 중앙집중식 아키텍처와 역할 기반 접근 제어 덕분에, 클라이언트 사이드 또는 오프라인 툴 대비 데이터 보안 및 프로젝트 관리가 크게 향상되었습니다.
  • 프로젝트는 1년 이상 활발히 유지보수되고 있으며, 대규모 음성 애너테이션 작업에 대한 신뢰성과 확장성의 실증을 보여주고 있습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.