Skip to main content
QUICK REVIEW

[論文レビュー] Keyword Spotter Model for Crop Pest and Disease Monitoring from Community Radio Data

Benjamin Akera, Joyce Nakatumba‐Nabende|arXiv (Cornell University)|Oct 5, 2019
Food Supply Chain Traceability参考文献 11被引用数 4
ひとこと要約

本論文では、農業関連のキーワードをウガンダのルガンド語で放送されるコミュニティラジオ番組から検出するための1次元畳み込みニューラルネットワーク(1D-CNN)キーワードスプライティングモデルを提案する。農村部のウガンダ人発話者からクラウドソーシングで得た音声データを用い、93%の正確性を達成した。これは密度型ベースラインを著しく上回り、リソースが限られた環境において低コストでリアルタイムで作物の害獣・病害を監視可能となる。

ABSTRACT

In societies with well developed internet infrastructure, social media is the leading medium of communication for various social issues especially for breaking news situations. In rural Uganda however, public community radio is still a dominant means for news dissemination. Community radio gives audience to the general public especially to individuals living in rural areas, and thus plays an important role in giving a voice to those living in the broadcast area. It is an avenue for participatory communication and a tool relevant in both economic and social development.This is supported by the rise to ubiquity of mobile phones providing access to phone-in or text-in talk shows. In this paper, we describe an approach to analysing the readily available community radio data with machine learning-based speech keyword spotting techniques. We identify the keywords of interest related to agriculture and build models to automatically identify these keywords from audio streams. Our contribution through these techniques is a cost-efficient and effective way to monitor food security concerns particularly in rural areas. Through keyword spotting and radio talk show analysis, issues such as crop diseases, pests, drought and famine can be captured and fed into an early warning system for stakeholders and policy makers.

研究の動機と目的

  • 既存のコミュニティラジオデータを活用して、ウガンダ農村部における作物の害獣・病害の低コストでスケーラブルな監視手法を開発すること。
  • 特にインターネットアクセスが限られた地域を含むサハラ以南アフリカにおいて、作物の健康状態をリアルタイムで監視するシステムの欠如に対処すること。
  • 最小限のラベル付きデータで、ルガンド語(低リソースのバントゥー語)の話者に依存しないキーワードスプライティングシステムを構築すること。
  • 自然な会話環境からのノイズが多く、品質が低い音声において、1D-CNNがキーワードスプライティングにどの程度有効であるかを評価すること。
  • 公共のコミュニティラジオコンテンツから重要なキーワードを抽出することで、農業関係者に早期警告システムを提供すること。

提案手法

  • 35人の被験者から、10種類のターゲットキーワード(ルガンド語および英語)を10回以上発話した18,426件の音声サンプルを収集。収録は自然でノイズの多い環境下で実施。
  • 音声をffmpegを用いてOGG Vorbis形式から8kHzのWAV形式に変換し、librosaを用いてモデル入力用の1次元波形を抽出。
  • 5つの畳み込み層、マックスプーリング、ドロップアウト(0.5)、10クラス分類用のソフトマックス出力層を備えた14層の1D-CNNを設計。
  • 学習率0.001でAdam最適化を用い、検証損失の改善が10エポック続かなかった時点で早期停止を実行してモデルを訓練。
  • 1D-CNNアーキテクチャの優位性を評価するために、5層の密度型ニューラルネットワークベースラインと性能を比較。
  • 未学習データに対する最終的なモデル性能を評価するため、5,759件のテストデータセットを用いた。

実験結果

リサーチクエスチョン

  • RQ1ノイズが多く、品質が低い録音であっても、1D-CNNはコミュニティラジオ放送からの低リソースのルガンド語発話において、農業関連キーワードを効果的に検出できるか?
  • RQ2低リソース言語において、1D-CNNモデルは密度型フィードフォワードネットワークと比較して、キーワードスプライティングの正確性に優れているか?
  • RQ3農村部の発話者からクラウドソーシングで得た自然な発話データは、広範なデータ拡張を施さなくても、効果的なキーワードスプライティングを可能にするか?
  • RQ4最小限のラベル付きデータで訓練されたキーワードスプライティングモデルは、現実の農村放送環境においても高い正確性と再現率を達成できるか?
  • RQ5サハラ以南アフリカにおいて、このようなシステムをリアルタイムの作物の害獣・病害の早期警告に展開可能か?

主な発見

  • 1D-CNNモデルは93%の正確性、93%の平均適合率、93%の平均再現率、93%のF1スコアを達成。これは密度型ベースラインモデルを著しく上回った。
  • 密度型ベースラインモデルはわずか62%の正確性、62%の平均適合率、60%の平均再現率、60%のF1スコアにとどまり、同じタスクにおいて一般化能力が著しく低いことが示された。
  • 1D-CNNモデルはベースラインと比較して偽陽性率を低減し、キーワード検出における適合率の向上を示した。
  • ルガンド語のような低リソース言語においても、ノイズが多く、不適切な訓練データであっても1D-CNNが有効であることが示された。
  • コミュニティラジオをリアルタイムのデータソースとして活用することで、インターネットアクセスが限られた地域における農業監視の実現可能性が裏付けられた。
  • 本研究は、低リソース環境において、最小限のクラウドソーシング音声データで話者に依存しないキーワードスプライティングが可能であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。