Skip to main content
QUICK REVIEW

[论文解读] merlin - a unified modelling framework for data analysis and methods development in Stata

Michael J. Crowther|arXiv (Cornell University)|Jun 5, 2018
demographic modeling and climate adaptation参考文献 7被引用 5
一句话总结

本文介紹了 merlin,一個在 Stata 中的統一建模框架,可靈活擬合複雜統計模型,包括多層混合效應模型、縱向資料與生存資料的聯合模型,以及使用者定義的分配。該框架利用階層式語法指定模型,可支援任意連結函數、隨機效應與時間變動共變數,達成高度彈性,但代價是計算速度較慢。

ABSTRACT

merlin can do a lot of things. From simple stuff, like fitting a linear regression or a Weibull survival model, to a three-level logistic mixed effects model, or a multivariate joint model of multiple longitudinal outcomes (of different types) and a recurrent event and survival with non-linear effects...the list is rather endless. merlin can do things I haven't even thought of yet. I'll take a single dataset, and attempt to show you the full range of capabilities of merlin, and discuss some future directions for the implementation in Stata.

研究动机与目标

  • 開發一個通用的 Stata 建模框架,能處理標準實作以外的廣泛統計模型。
  • 將先前的專用指令(如 stjm、stmixed、stgenreg)整合至單一、可擴充的框架中。
  • 讓使用者能以一致語法指定包含多種結果類型、隨機效應與非線性效應的複雜模型。
  • 透過 Mata 程式設計支援使用者定義的分配、風險函數與連結函數,促進方法論創新。
  • 為未來擴充奠定基礎,包括解析微分、新隨機效應分配與動態預測工具。

提出的方法

  • merlin 使用階層式模型指定語法:`merlin (model1) (model2) ...`,其中每個模型由應變數、組成成分與選項定義。
  • 每個組成成分由共變數、限制性立方 spline(rcs)、時間變動函數與隨機效應等元素組合而成,透過乘法與加法結合。
  • 框架支援多種分配家族(例如常態、伯努利、威爾鮑、羅伊斯頓-帕姆爾),並可透過 Mata 函數定義使用者自訂的對數概似。
  • 隨機效應透過自適應或非自適應高斯積分,或蒙地卡羅積分整合,支援多變量常態或 t 分配的隨機效應。
  • 模型透過最概然法估計,支援透過 `timevar()` 選項與 `fp()` 或 `rcs()` 函數的時間變動係數。
  • 架構允許透過共用隨機效應或結構方程連結子模型,實現多種結果類型的聯合建模。

实验结果

研究问题

  • RQ1單一、可擴充的 Stata 指令是否能支援從簡單線性回歸到複雜多變量聯合模型的廣泛統計模型?
  • RQ2如何設計一個統一框架,以處理具有任意分配、連結函數與隨機效應結構的混合效應模型?
  • RQ3在通用建模引擎中,彈性與計算效率之間的權衡為何?
  • RQ4使用者定義的分配與風險函數在多大程度上能無縫整合至最概然估計框架中?
  • RQ5外殼指令如何簡化複雜模型指定,同時保有對底層 merlin 引擎的完整存取?

主要发现

  • merlin 成功擬合一個包含四種結果的模型,整合了生存資料、連續縱向資料、二元資料與事件發生時間資料,並包含兩個隨機效應,在一般筆電上約 16 分鐘內收斂。
  • 該框架支援複雜模型,如具非線性效應、時間變動共變數與多種隨機效應結構的多變量聯合模型。
  • 使用者定義的分配與風險函數可透過 Mata 函數實作,進而支援自訂概似與複雜生存過程的彈性建模。
  • 使用限制性立方 spline(rcs)與分數多項式(fp)項,可靈活建模非線性共變數效應與時間趨勢。
  • 儘管彈性高,merlin 目前使用有限差分法計算得分與海塞矩陣,導致其執行速度較專用指令慢。
  • 建議以外殼指令簡化語法並提升收斂效率,透過在內部調用 merlin 的同時,提供客製化起始值與模型特定邏輯。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。