Skip to main content
QUICK REVIEW

[논문 리뷰] Mining and Exploiting Domain-Specific Corpora in the PANACEA Platform

Núria Bel, Vassilis Papavassiliou|RECERCAT (Consorci de Serveis Universitaris de Catalunya)|2013. 03. 08.
Natural Language Processing Techniques참고 문헌 7인용 수 4
한 줄 요약

이 논문은 PANACEA 플랫폼의 코퍼스 획득 컴ponent(CAC)을 제시하며, 분산된 언어 및 도메인 중심의 크롤링 기반으로 웹에서 단일 언어 및 양방향 도메인 특화 코퍼스를 자동으로 추출하는 방법을 제시한다. CAC는 기계 번역 시스템의 도메인 적응을 위해 사용된 병렬 코퍼스를 성공적으로 추출하여 문장 정렬 및 자원 활용을 통한 효과적인 도메인 적응을 입증한다.

ABSTRACT

The objective of the PANACEA ICT-2007.2.2 EU project is to build a platform that automates the stages involved in the acquisition, production, updating and maintenance of the large language resources required by, among others, MT systems. The development of a Corpus Acquisition Component (CAC) for extracting monolingual and bilingual data from the web is one of the most innovative building blocks of PANACEA. The CAC, which is the first stage in the PANACEA pipeline for building Language Resources, adopts an efficient and distributed methodology to crawl for web documents with rich textual content in specific languages and predefined domains. The CAC includes modules that can acquire parallel data from sites with in-domain content available in more than one language. In order to extrinsically evaluate the CAC methodology, we have conducted several experiments that used crawled parallel corpora for the identification and extraction of parallel sentences using sentence alignment. The corpora were then successfully used for domain adaptation of Machine Translation Systems.

연구 동기 및 목표

  • 기계 번역 시스템을 위한 대규모 언어 자원의 자동 획득, 생산 및 유지보수를 목표로 한다.
  • 웹 자료에서 효율적이고 확장 가능한 방식으로 도메인 특화 코퍼스를 구축하는 과제를 해결한다.
  • 단일 언어 및 양방향 데이터를 위한 분산된 언어 및 도메인 중심의 크롤링 파이프라인을 개발한다.
  • 자동으로 확보한 병렬 코퍼스를 활용해 기계 번역 시스템의 도메인 적응을 가능하게 한다.
  • 실세계 기계 번역 작업에서 내재적 및 외재적 검증을 통해 CAC의 효과성을 평가한다.

제안 방법

  • CAC는 특정 언어와 사전 정의된 도메인에서 풍부한 텍스트 콘텐츠를 포함한 웹 문서를 수집하기 위해 분산 크롤링 아키텍처를 활용한다.
  • 도메인 내 콘텐츠를 포함한 多국어 웹사이트에서 병렬 텍스트를 탐지하고 추출하기 위한 전용 모듈을 포함한다.
  • 수집된 코퍼스에서 병렬 문장을 식별하고 추출하기 위해 문장 정렬 기법을 적용한다.
  • 언어 자원의 지속적인 업데이트 및 유지보수를 지원하도록 파이프라인을 설계한다.
  • 언어 및 도메인 필터링을 통한 웹 크롤링을 활용하여 확보된 데이터의 높은 관련성과 품질을 확보한다.
  • 최종 출력은 기계 번역 시스템의 훈련 및 적응에 적합한 정제된, 정렬된 병렬 코퍼스이다.

실험 결과

연구 질문

  • RQ1어떻게 웹에서 대규모의 도메인 특화 단일 언어 및 양방향 코퍼스를 자동으로 확보할 수 있는가?
  • RQ2분산된 타겟팅 크롤링 접근법이 고품질의 도메인 내 병렬 텍스트를 추출하는 데 얼마나 효과적인가?
  • RQ3자동으로 확보한 병렬 코퍼스가 기계 번역 시스템의 도메인 적응에 성공적으로 활용될 수 있는가?
  • RQ4CAC의 문장 정렬 모듈이 도메인 특화 병렬 데이터에서 어떻게 성능을 발휘하는가?
  • RQ5도메인 적응 훈련 데이터가 기계 번역 성능에 미치는 영향은 무엇인가?

주요 결과

  • CAC는 목표 도메인과 높은 관련성을 가진 웹 자료에서 도메인 특화 단일 언어 및 양방향 코퍼스를 성공적으로 추출하였다.
  • 시스템은 타겟 언어 및 도메인 콘텐츠를 위한 분산 크롤링에서 확장성과 효율성을 입증하였다.
  • 문장 정렬 기법이 추출된 코퍼스에서 병렬 문장을 효과적으로 식별하였다.
  • 채굴된 병렬 코퍼스는 기계 번역 시스템의 도메인 적응을 성공적으로 가능하게 하였다.
  • 외재적 평가를 통해 확보된 자원이 목표 도메인의 기계 번역 성능 향상에 기여하는 것으로 확인되었다.
  • 이러한 접근법은 생산 준비가 된 파이프라인에서 언어 자원을 자동으로 생성하는 데 실현 가능함을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.