潜类别混合模型(Latent Class Mixed Model, LCMM)解决的是:一群人的某个指标随时间变化,但不是所有人走同一条曲线——有人一路高位、有人持续下降、有人先低后升。LCMM 假设人群由若干潜在轨迹类别组成,同时估计每类的平均轨迹和每个个体归属各类的后验概率。
它和"先按某阈值分组再比较"不同:类别不是人为切的,而是从数据里估出来的。常用于亚表型/内型发现(脓毒症、ARDS、乳酸/炎症/机械功轨迹等)。
长表(long format):每人多行,三列 id, time, value。时间点可不整齐(本演示会插值到公共网格)。逗号/制表符/空格分隔均可,可含表头。
id,time,value 1,0,8.1 1,1,7.9 1,2,7.6 2,0,7.8 2,1,6.0 2,2,4.1 ...
把每个人的纵向轨迹看成高维空间里的一个点(按时间对齐后的向量)。LCMM/轨迹聚类做的,就是在这个空间里找出若干"曲线原型"(类中心),每个人被吸引到最像自己的那条——粗线是各类平均轨迹,细线是个体。
"后验概率"的几何直觉:一个人离某条原型曲线越近,属于那一类的概率越高;离两条都不远,就是"归属不确定"的边界个体。类别数 k 太大,会把噪声也切成"类"。
真做分析(R):
library(lcmm)
# d: 长表 data.frame,含 id / time / value
m3 <- hlme(value ~ time + I(time^2),
mixture = ~ time + I(time^2),
random = ~ time, subject = "id",
ng = 3, data = d)
summary(m3) # 各类占比、参数
postprob(m3) # 后验概率与分类清晰度(熵)
# 比较 ng=2..5 的 BIC 选类别数;再看类别能否外部验证/指导治疗