[论文解读] Spanish Biomedical Crawled Corpus: A Large, Diverse Dataset for Spanish Biomedical Language Models
本文介紹了 CoWeSe,這是迄今為止最大的公開西班牙語生物醫學語料庫,包含來自 2,766 個網站、覆蓋 3,338 個精心篩選領域的 4.5GB 清理過的純文字(7.457 億個詞元)。該語料庫透過大規模網路爬蟲(2020 年)與領域特定的種子網站及自訂預處理流程建立,可提供高品質、多樣化的生物醫學文字資料,用於訓練西班牙語語言模型,並促進醫療與生物醫學領域的自然語言處理發展。
We introduce CoWeSe (the Corpus Web Salud Español), the largest Spanish biomedical corpus to date, consisting of 4.5GB (about 750M tokens) of clean plain text. CoWeSe is the result of a massive crawler on 3000 Spanish domains executed in 2020. The corpus is openly available and already preprocessed. CoWeSe is an important resource for biomedical and health NLP in Spanish and has already been employed to train domain-specific language models and to produce word embbedings. We released the CoWeSe corpus under a Creative Commons Attribution 4.0 International license, both in Zenodo (\url{https://zenodo.org/record/4561971\#.YTI5SnVKiEA}).
研究动机与目标
- 針對自然語言處理中西班牙語生物醫學文字資料稀缺的問題,建立一個全面且多樣化的語料庫。
- 透過從非學術、現實世界中的健康網站收集資料,克服現有資源的限制,超越傳統科學文獻的範疇。
- 支援西班牙語生物醫學與臨床自然語言處理應用中,領域特定語言模型與詞嵌入的開發。
- 提供一個公開可取得、已預處理的語料庫,以促進西班牙語生物醫學領域中可重現的研究與模型訓練。
提出的方法
- 使用深度為 5 的爬蟲策略,從 10 個與健康相關的類別(包括醫院、病患協會與公共衛生機構)的 3,338 個精心篩選網站中進行爬取。
- 根據與健康及生物醫學內容的相關性,優先選擇特定領域的網站,包含西班牙 ISCIII 指定為健康資訊資源的網站。
- 僅提取段落與標題的 HTML 標籤,以保留有意義的生物醫學文字,同時排除不相關的格式。
- 應用自訂的高效能運算管道(50 節點叢集)進行清理,包括句子切分、語言識別與去重。
- 提高語言識別的閾值,以更佳偵測生物醫學西班牙語,因標準模型對此類語言的置信度通常較低。
- 保留原始文件邊界,並執行內容去重,以確保資料品質並防止重複。
实验结果
研究问题
- RQ1大規模網路爬蟲語料庫是否能提供足夠的覆蓋範圍與多樣性,以訓練有效的西班牙語生物醫學語言模型?
- RQ2來自非學術、現實世界健康網站的語料庫,與傳統科學文獻語料庫相比,在語言與領域多樣性方面有何差異?
- RQ3高吞吐量、自動化的預處理管道在處理海量網路規模生物醫學資料時,能在多大程度上維持文字品質?
- RQ4公開可取得、已預處理的語料庫是否能加速西班牙語生物醫學自然語言處理工具與模型的開發?
- RQ5語言識別調校對低資源環境下生物醫學西班牙語檢測準確率有何影響?
主要发现
- CoWeSe 語料庫包含 4.5GB 的清理過純文字,相當於 7.457 億個詞元,來自 158 萬份文件與 3,277 萬個句子。
- 語料庫源自 2,766 個來自多樣化健康領域的網站,包括醫院、病患協會與公共衛生組織。
- 預處理管道將原始 WARC 資料(905GB)透過去重與雜訊過濾,轉換為 4.5GB 的乾淨、可用語料庫。
- 語料庫包含西班牙語、加泰隆尼亞語、加利西亞語與巴斯克語內容,反映西班牙的多語言健康資訊。
- 語料庫以創用CC 姓名標示 4.0 國際授權釋出,確保開放存取與可重用性。
- 語料庫已成功用於訓練領域特定語言模型與產生詞嵌入,展現其在西班牙語生物醫學自然語言處理中的實用價值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。