Skip to main content
QUICK REVIEW

[论文解读] audino: A Modern Annotation Tool for Audio and Speech

Manraj Singh Grover, Pakhi Bamdev|arXiv (Cornell University)|Jun 9, 2020
Speech Recognition and Synthesis参考文献 15被引用 4
一句话总结

audino 是一款现代、基于网络的开源音频与语音标注工具,支持协作式、服务器端的时序分割、转录和标注,并具备集中化的项目与用户管理功能。它支持多种自然语言处理与语音任务,如自动语音识别(ASR)、语音活动检测(VAD)和情感识别,通过 Docker 部署与 API 集成,实现可扩展、安全且高效的语料库构建,已在自动评分系统中成功用于转录 65 小时的 L2 英语语音数据。

ABSTRACT

In this paper, we introduce a collaborative and modern annotation tool for audio and speech: audino. The tool allows annotators to define and describe temporal segmentation in audios. These segments can be labelled and transcribed easily using a dynamically generated form. An admin can centrally control user roles and project assignment through the admin dashboard. The dashboard also enables describing labels and their values. The annotations can easily be exported in JSON format for further analysis. The tool allows audio data and their corresponding annotations to be uploaded and assigned to a user through a key-based API. The flexibility available in the annotation tool enables annotation for Speech Scoring, Voice Activity Detection (VAD), Speaker Diarisation, Speaker Identification, Speech Recognition, Emotion Recognition tasks and more. The MIT open source license allows it to be used for academic and commercial projects.

研究动机与目标

  • 解决缺乏现代、协作式、服务器端音频标注工具的问题,这些工具能够支持语音语料库的可扩展、安全且集中化的管理。
  • 为多样化的语音与自然语言处理任务,实现音频数据的高效且准确的时序分割、转录与标注。
  • 通过宽松的 MIT 许可证,为学术界与商业应用提供生产就绪、可访问且可扩展的平台。
  • 通过支持基于 API 的数据上传、预标注数据导入以及通过标注者间一致性计算实现的自动化质量追踪,简化大规模语料库的创建流程。
  • 通过基于令牌的身份验证、哈希文件名和基于角色的访问控制,增强数据安全与隐私保护。

提出的方法

  • 该工具作为全栈 Web 应用构建,采用 RESTful API 与基于 React 的前端,部署于具备集中式数据存储的服务器上。
  • 音频文件与标注信息存储于中央数据库,用户访问通过 JSON Web Tokens (JWT) 和基于角色的权限进行控制。
  • 标注者通过浏览器端界面与音频波形交互,使用播放控制、缩放和区域选择功能,定义用于标注的时间段。
  • 根据标注任务动态生成表单,支持输入转录内容,并为每个片段选择预定义标签(单选或多选)。
  • 项目通过管理员控制面板进行管理,支持创建用户、角色、项目、标签和 API 密钥,以实现安全的数据上传与系统集成。
  • 系统支持标注信息的 JSON 导出,便于在机器学习流水线中使用,并通过 API 与预训练模型集成,实现初始标注。

实验结果

研究问题

  • RQ1一款现代、协作式且安全的基于网络的标注工具,如何提升音频与语音语料库构建的可扩展性与效率?
  • RQ2集中化的项目与用户管理在多大程度上可减少大规模语音标注项目中的错误并提升一致性?
  • RQ3具备 API 集成与预标注数据导入功能的基于网络的工具,能否显著减少语音识别与评分任务中的手动标注工作量?
  • RQ4该工具在支持多样化的语音标注任务(如说话人分离、情感识别和 ASR 错误修正)方面效果如何?
  • RQ5集中式控制面板与安全的身份验证在协作标注过程中,对提升数据隐私与访问控制方面起到何种作用?

主要发现

  • audino 成功转录了 65 小时的 L2 英语语音数据,来自模拟的口语能力面试,使预训练的 ASR 模型得以微调。
  • 该工具使两名标注者能够共同转录 20% 的重叠数据,通过 CRON 任务实现自动的词错误率(WER)追踪与错误标记。
  • 通过自动计算 WER 监控标注者间一致性,重大转录错误通过讨论得以解决,从而提升了数据质量。
  • 使用 audino 通过支持预标注数据导入与迭代修正,显著减少了数据准备阶段的手动工作量,加速了自动口语能力评分系统的发展。
  • 与客户端或离线工具相比,该工具的集中式架构与基于角色的访问控制显著提升了数据安全与项目管理能力。
  • 该项目已持续维护并投入生产超过一年,证明其在大规模语音标注任务中具备可靠性与可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。