Skip to main content
QUICK REVIEW

[論文レビュー] Do Software Languages Engineers Evaluate their Languages?

Pedro Gabriel, Miguel Goulão|arXiv (Cornell University)|Sep 30, 2011
Advanced Software Engineering Methodologies参考文献 17被引用数 7
ひとこと要約

この論文は、ドメイン特化言語(DSL)開発における体系的評価の欠如を調査し、2001年から2008年までのSLE論文の14%しか、生産性や保守性の向上という主張があるにもかかわらず、 usability や品質評価を報告していないことを明らかにした。著者らは、DSL工学のライフサイクルに体系的かつ再現可能な評価手法を統合することで、信頼性と採用促進を図るべきだと提言する。

ABSTRACT

Domain Specific Languages (DSLs) can contribute to increment productivity, while reducing the required maintenance and programming expertise. We hypothesize that Software Languages Engineering (SLE) developers consistently skip, or relax, Language Evaluation. Based on the experience of engineering other types of software products, we assume that this may potentially lead to the deployment of inadequate languages. The fact that the languages already deal with concepts from the problem domain, and not the solution domain, is not enough to validate several issues at stake, such as its expressiveness, usability, effectiveness, maintainability, or even the domain expert's productivity while using them. We present a systematic review on articles published in top ranked venues, from 2001 to 2008, which report DSLs' construction, to characterize the common practice. This work confirms our initial hypothesis and lays the ground for the discussion on how to include a systematic approach to DSL evaluation in the SLE process.

研究の動機と目的

  • ソフトウェア言語工学の研究者が、発表された研究においてDSLを体系的に評価しているかどうかを調査すること。
  • 2001年から2008年までのトップクラスのSLE会議で発表された論文における、評価手法の範囲と質を特定すること。
  • DSLの利点として主張される利点と、文献における実証的検証の欠如とのギャップを浮き彫りにすること。
  • SLEコミュニティがDSL開発プロセスのコアフェーズとして標準化された体系的評価を採用するよう促すこと。
  • 評価をSLEプロセスモデルに統合し、DSLの主張の信頼性と再現可能性を高めることを支援すること。

提案手法

  • 2001年から2008年までの、トップランクのSLE会議(例:GPCE、MODELS、ICSR)から抽出された110篇の論文を対象とした体系的文献レビューを実施した。
  • 事前に定義された客観的基準を用い、定量的または定性的な評価を報告しているかどうかを分類した。
  • 評価レポートの詳細を分析し、研究手法の透明性とユーザーの関与度を評価した。
  • 例の代表性(例:おもちゃレベル vs. 業界規模)を評価し、妥当性の脅かしを特定した。
  • 評価研究における被験者の特徴づけを評価し、ドメインエキスパートが実際に関与していたかを検証した。
  • 見逃された論文や誤分類の可能性といった妥当性の脅かしを特定し、緩和戦略を適用した。

実験結果

リサーチクエスチョン

  • RQ12001年から2008年までの発表されたSLE研究において、DSLはどの程度評価されているか?
  • RQ2報告されている評価の種別(定性的、定量的)は何か? また、手順の記述はどの程度詳細に記載されているか?
  • RQ3評価対象はどの程度代表的であり、ドメインエキスパートは評価プロセスに参加していたか?
  • RQ4DSLの使いやすさ、生産性、保守性に関する主張を裏付ける証拠の質はどの程度か?
  • RQ5体系的評価の欠如が、実務におけるDSLの信頼性と採用に与える影響は何か?

主な発見

  • 調査対象のSLE論文のうち、定性的または定量的のいずれかの形で評価を報告しているのはわずか14%であり、検証手法の大きなギャップを示している。
  • 評価レポートはしばしば不十分に記述されており、再現性に欠けるため、主張の信頼性が損なわれる。
  • 大多数の評価が産業規模のアプリケーションではなく、おもちゃレベルの例に依存しており、外部妥当性に脅かしがある。
  • 論文の大部分が、評価に参加した被験者の特徴を明示しておらず、ドメインエキスパート(主なユーザー)が実際に含まれていたかどうかに懸念が生じる。
  • 生産性や保守性の向上を広く主張しているにもかかわらず、文献における証拠は多くが主観的根拠に依存しているか、欠落している。
  • 体系的評価の欠如は、SLEコミュニティがDSL工学ライフサイクルにおける検証を標準フェーズとして定着させていないことを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。