Skip to main content
QUICK REVIEW

[論文レビュー] A large-scale and PCR-referenced vocal audio dataset for COVID-19

Jobie Budd, Kieran Baker|arXiv (Cornell University)|Dec 15, 2022
Phonocardiography and Auscultation Techniques被引用数 4
ひとこと要約

本論文では、イギリスで流通していたSARS-CoV-2変異株の時代に、PCR検査で確認された70,794名の参加者から収集された咳、吐瀉、発話音声の大型スケールな音声データセット、UK COVID-19 Vocal Audio Datasetを紹介する。このデータセットは、SARS-CoV-2感染状況や自己申告された症状と関連付けられており、機械学習モデルが音声を用いて感染状態や呼吸器疾患を同定するのを可能にする。陽性例は24,155例、インフルエンザ検査データは27.2%を占め、これまでで最大の同種のデータセットである。

ABSTRACT

The UK COVID-19 Vocal Audio Dataset is designed for the training and evaluation of machine learning models that classify SARS-CoV-2 infection status or associated respiratory symptoms using vocal audio. The UK Health Security Agency recruited voluntary participants through the national Test and Trace programme and the REACT-1 survey in England from March 2021 to March 2022, during dominant transmission of the Alpha and Delta SARS-CoV-2 variants and some Omicron variant sublineages. Audio recordings of volitional coughs, exhalations, and speech were collected in the 'Speak up to help beat coronavirus' digital survey alongside demographic, self-reported symptom and respiratory condition data, and linked to SARS-CoV-2 test results. The UK COVID-19 Vocal Audio Dataset represents the largest collection of SARS-CoV-2 PCR-referenced audio recordings to date. PCR results were linked to 70,794 of 72,999 participants and 24,155 of 25,776 positive cases. Respiratory symptoms were reported by 45.62% of participants. This dataset has additional potential uses for bioacoustics research, with 11.30% participants reporting asthma, and 27.20% with linked influenza PCR test results.

研究の動機と目的

  • SARS-CoV-2感染状態を音声サンプルから機械学習モデルで同定できる、大規模かつ臨床的根拠を有する音声データセットの構築を目的とする。
  • 音声記録をゴールスタンダードであるSARS-CoV-2 PCR検査結果と関連付けることで、信頼性の高いモデルの訓練および評価を可能にする。
  • 自己申告された症状、呼吸器疾患、インフルエンザ検査結果を含めることで、より広範なバイオアコースティクスおよび多条件研究を可能にする。
  • 音声を用いた診断手法を活用し、非侵襲的かつスケーラブルなスクリーニングツールの開発を支援する。
  • 実世界の人口の多様性を反映した、公に利用可能な、倫理的に適切に調製されたデータセットを提供する。

提案手法

  • 参加者は2021年3月から2022年3月にかけて、イギリスのTest and TraceプログラムおよびREACT-1調査を通じて参加者を募った。
  • 音声サンプルはデジタル調査を通じて収集され、意図的な咳、吐瀉、持続的発話が含まれた。
  • 各参加者の音声は、SARS-CoV-2 PCR検査結果、自己申告された症状、および既存の呼吸器疾患と関連付けられた。
  • PCR検査で確認された結果を有する参加者は70,794名で、そのうち24,155名がSARS-CoV-2陽性であった。27.2%の参加者が同時期のインフルエンザPCR検査結果も有していた。
  • 音声データに加えて、人口統計、症状、健康歴データが収集され、マルチモodal分析を支援した。
  • 倫理的監視のもとでデータセットがキュレートされ、参加者のプライバシーとデータ整合性が保証された。

実験結果

リサーチクエスチョン

  • RQ1機械学習を用いて、音声特徴のみでSARS-CoV-2陽性者と陰性者を信頼性高く区別できるか?
  • RQ2音声パターンは、自己申告された呼吸器症状や喘息などの既存疾患とどの程度相関しているか?
  • RQ3インフルエンザ検査結果の追加が、差別的診断研究におけるデータセットの有用性をどの程度高めるか?
  • RQ4このデータセットは、コミュニティ環境における呼吸器感染症のスケーラブルで非侵襲的なスクリーニングツールの開発を支援できるか?
  • RQ5変異株の動態(アルファ、デルタ、オミクロン)が、音声で検出可能なバイオマーカーに与える影響は何か?

主な発見

  • 本データセットは、PCR検査で確認されたSARS-CoV-2状態を有する70,794名の参加者を含み、これまでで最大の同種の収集データセットである。
  • そのうち24,155名がSARS-CoV-2に陽性であり、診断モデルの訓練および評価に十分なデータを提供している。
  • 参加者の45.62%が呼吸器症状を自己申告しており、音声特徴と症状の関連性が強いことが示唆されている。
  • 参加者の11.30%が喘息を自己申告しており、慢性呼吸器疾患の音声バイオマーカーに関する研究が可能である。
  • 参加者の27.20%が関連するインフルエンザPCR検査結果を有しており、多病原体診断研究を支援している。
  • 本データセットは、アルファ、デルタ、および初期オミクロン変異株の時代をカバーしており、主要なSARS-CoV-2系統に伴う音声変化を捉えている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。