Skip to main content
QUICK REVIEW

[論文レビュー] Mining and Exploiting Domain-Specific Corpora in the PANACEA Platform

Núria Bel, Vassilis Papavassiliou|RECERCAT (Consorci de Serveis Universitaris de Catalunya)|Mar 8, 2013
Natural Language Processing Techniques参考文献 7被引用数 4
ひとこと要約

本論文は、PANACEAプラットフォームのコロナス抽出コンponent(CAC)を提示する。CACは、分散型で言語およびドメインに特化したクローリング手法を用いて、ウェブ上から単語彙および並列ドメイン固有コーパスを自動抽出する。CACは、機械翻訳システムのドメイン適応に使用された並列コーパスを効果的に抽出し、文のアライメントとリソースの活用を通じて、効果的なドメイン適応を実証した。

ABSTRACT

The objective of the PANACEA ICT-2007.2.2 EU project is to build a platform that automates the stages involved in the acquisition, production, updating and maintenance of the large language resources required by, among others, MT systems. The development of a Corpus Acquisition Component (CAC) for extracting monolingual and bilingual data from the web is one of the most innovative building blocks of PANACEA. The CAC, which is the first stage in the PANACEA pipeline for building Language Resources, adopts an efficient and distributed methodology to crawl for web documents with rich textual content in specific languages and predefined domains. The CAC includes modules that can acquire parallel data from sites with in-domain content available in more than one language. In order to extrinsically evaluate the CAC methodology, we have conducted several experiments that used crawled parallel corpora for the identification and extraction of parallel sentences using sentence alignment. The corpora were then successfully used for domain adaptation of Machine Translation Systems.

研究の動機と目的

  • 機械翻訳システムのための大規模言語リソースの自動的取得、生成、保守を実現すること。
  • ウェブソースから効率的かつスケーラブルにドメイン固有コーパスを構築する課題に対処すること。
  • 単語彙および並列データのための分散型で言語およびドメインに特化したクローリングパイプラインの開発。
  • 自動的に取得された並列コーパスを用いて機械翻訳システムのドメイン適応を可能にすること。
  • 実世界のMTタスクにおける内在的および外在的評価を通じて、CACの有効性を評価すること。

提案手法

  • CACは、特定の言語および事前に定義されたドメインにおける豊富なテキストコンテンツを有するウェブドキュメントを収集するための分散型クローリングアーキテクチャを採用している。
  • 多言語ウェブサイトにおけるドメイン内コンテンツを検出・抽出するための特別なモジュールを含む。
  • 収集されたコーパスから並列文を特定・抽出するために、文のアライメント技術を適用している。
  • パイプラインは、言語リソースの継続的更新および保守をサポートするように設計されている。
  • 言語およびドメインのフィルタリングを伴うウェブクローリングを活用することで、取得データの高い関連性と品質を確保する。
  • 最終出力は、機械翻訳システムの学習および適応に適した、整理されたアラインメント済み並列コーパスである。

実験結果

リサーチクエスチョン

  • RQ1ウェブから大規模でドメイン固有の単語彙および並列コーパスを自動的に取得する方法は何か?
  • RQ2分散型でターゲットを絞ったクローリングアプローチが、高品質でドメイン内並列テキストを抽出する上でどの程度有効であるか?
  • RQ3自動的に取得された並列コーパスは、機械翻訳システムの適応に成功するか?
  • RQ4CACの文アライメントモジュールは、ドメイン固有の並列データに対してどの程度の性能を示すか?
  • RQ5ドメイン適応型の学習データが機械翻訳性能に与える影響は何か?

主な発見

  • CACは、ターゲットドメインに関連性の高いウェブソースから、ドメイン固有の単語彙および並列コーパスを効果的に抽出した。
  • 言語およびドメインに特化したコンテンツのための分散型クローリングにおいて、スケーラビリティと効率性を示した。
  • 文のアライメント技術は、抽出されたコーパス内の並列文を効果的に同定した。
  • 抽出された並列コーパスは、機械翻訳システムのドメイン適応に成功した。
  • 外在的評価により、取得リソースがターゲットドメインにおけるMTパフォーマンスの向上に寄与することが確認された。
  • 本アプローチは、生産環境向けパイプラインとしての言語リソース作成を自動化する上で実用的であることが立証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。