天赐范式第122天:预实验启动令——从“图纸审核通过“到“按下运行键“
天赐范式第122天(第二篇):预实验启动令——从"图纸审核通过"到"按下运行键"
📌本文是天赐范式系列第122天第二篇,前置阅读:第121天(施工图与审查)。若您首次接触本系列,建议从第120天《相关≠因果》开始。
摘要:121-1画了施工图,121-2审了四个坑。两篇下来,121-1的工程草案被修正为:
S_source改α敏感性分析(替代固定α=0.6)、稀疏边改三臂设计(策略A主实验+B/C交叉验证)、样本量从20名修正为~50名、含U训练增加收敛监控及Gibbs回退方案。本文是第122天对第121天的最终裁决:以上修正全部落地后,预实验可启动。预实验分三阶段——①10名受试者估算效应量;②根据效应量调整正式实验样本量;③正式实验(~50名,α=0.01, power=0.80)。算子流不说"图纸审完了就自动开工"。算子流说:“审完了,按预实验三阶段走,每一阶段有明确退出条件。”
关键词:天赐范式 | 预实验 | 启动令 | 三阶段 | 退出条件 | 效应量估算 | 因果推断 | 受限玻尔兹曼机 | 实验设计 | 统计功效
系列索引:第121天第一篇《RBM干预实验怎么干》v1.1 → 第121天第二篇《干预实验的前置条件审查》v1.1 → 第122天第一篇《一张沙发上的全栈失稳》v1.1 →本文(第122天第二篇)
免责声明:本文为理论推演与工程规划,不构成实际实验方案或 funding 承诺。文中涉及的样本量、阶段划分、退出条件均为基于统计模型的初步设计,实际执行需经IRB审批、领域专家论证和机构伦理审查。
版本:v1.1
日期:2026-08-01
关联:第121天第一篇、第121天第二篇、第120天双篇、第122天第一篇
新公式:0个(本文不引入新算子/新公式,是对121-1/121-2审查结论的汇总与裁决)
δ领域计数:N=53,δ≈0.78(1-e⁻⁵³/³⁵)
来源说明:本文是对121-1工程草案与121-2前置审查结论的汇总裁决。预实验三阶段模型参考FDA临床试验分期设计(Phase I/II/III);统计功效计算使用G*Power 3.1(Faul et al., 2007);效应量Cohen’s q基于Fisher z变换标准定义(Cohen, 1988);受限玻尔兹曼机训练收敛理论参考Ravikumar et al. (2006)Annals of Statistics。
一句话:121-1画了图,121-2审了图,122-2按下运行键。修正后的参数:α扫描、三臂设计、~50名、收敛监控。预实验三阶段,每阶段有退出条件。
原则声明:本文基于v7.0弹药库(129算子/42+公式),不引入新算子/新公式。本文是对121-1工程草案与121-2前置审查的最终裁决——用τ判定输出预实验启动令,用Λ预警标注各阶段风险,用Σ量化阶段间的参数漂移。
算子层映射:
| 算子流层级 | 算子/机制 | 本文角色 |
|---|---|---|
| 锚定层 | Ξ(#1) | 锚定预实验三阶段的判定标准与退出阈值 |
| 判定层 | Σ(#12)/τ(#11) | Σ量化阶段间参数漂移;τ判定每阶段pass/rollback/fail |
| 预警层 | Λ(#10) | 预警各阶段的系统性风险(伦理/招募/技术) |
| 监察层 | Con/ρ/δ/λ/C² | Con审查三阶段逻辑一致性;δ(N=53, δ≈0.78) |
| 调节层 | R(#59) | 调节阶段转换(P1→P2→P3)与紧急熔断 |
〇、引言:图纸审完了,该按哪个键?
121-1给了施工图。121-2审了施工图上的四个坑,并给出了处置方案:
| 坑位 | 121-1原设计 | 121-2审查结论 | 修正后参数 |
|---|---|---|---|
| K1 | S_source:α=0.6固定 | α固定值不合法 | α敏感性分析,扫描[0,1] |
| K2 | 稀疏边:策略A主实验+策略B交叉 | 需补充策略C为三臂设计 | 三臂设计:A主实验/B交叉/C敏感性 |
| K3 | 含U训练:_mean_field_inference伪代码 | 理论收敛但需工程监控 | MF迭代+收敛监控+Gibbs回退 |
| K4 | 样本量:20名 | power≈0.30,严重不足 | ~50名(α=0.01, power=0.80) |
四坑已填。但"填完坑"不等于"可以开工"。
122-2的任务:把修正后的参数钉死在墙上,把预实验切成三阶段,把每阶段的退出条件写进作战手册。
算子流不说"审完了就自动跑"。算子流说:“审完了,按三阶段走。第一阶段跑不通,不要进第二阶段。第二阶段参数调不准,不要进第三阶段。每一阶段有τ判定,每一阶段有退出条件。”
一、修正后参数总表(121-1 + 121-2 的最终合成)
1.1 干预设计
| 参数 | 修正前(121-1) | 修正后(122-2) | 修正来源 |
|---|---|---|---|
| 干预类型 | 结构干预(添加同层边) | 结构干预(添加同层边) | 121-1 §一 |
| 稀疏密度ε | 10%~15% | 10%(首推) | 121-1 §2.3 |
| 稀疏边策略 | A主+B交叉 | A主+B交叉+C敏感性(三臂) | 121-2 §二 |
| 同层边选择 | 随机/频率匹配 | 策略A:随机选择(主实验) | 121-2 §2.3 |
| 对照组 | 标准RBM | 标准RBM | 121-1 §3.3 |
| 实验组 | 稀疏同层连接RBM | 稀疏同层连接RBM(ε=10%) | 121-1 §3.3 |
1.2 序参量真值
| 参数 | 修正前(121-1) | 修正后(122-2) | 修正来源 |
|---|---|---|---|
| 构造公式 | PGO密度+皮层梯度,α=0.6 | PGO密度+皮层梯度,α∈[0,1]扫描 | 121-2 §一 |
| PGO密度 | REM期PGO波频率 | REM期PGO波频率(EOG/EEG提取) | 121-1 §3.2 |
| 皮层梯度 | EEG微状态变化率 | EEG微状态变化率/fMRI BOLD梯度 | 121-1 §3.2 |
| 稳健性检验 | 无 | α敏感性分析:若r_ctrl>0.5且Δr>0.3在α∈[0.3,0.8]内均成立,则S_source构造合法 | 121-2 §1.3 |
1.3 训练与收敛
| 参数 | 修正前(121-1) | 修正后(122-2) | 修正来源 |
|---|---|---|---|
| 训练算法 | CD-1(对照组)/ MF+PCD(实验组) | 对照组:CD-1;实验组:MF迭代+PCD | 121-1 §3.3 |
| 收敛监控 | 无 | MF迭代残差<1e-4(10步内);PCD自相关时间<5 | 121-2 §3.3 |
| 失败回退 | 无 | MF不收敛→回退Gibbs采样(慢但精确) | 121-2 §3.3 |
| 训练稳定性 | 未标注 | 损失函数单调下降;若不单调→减小学习率或增大batch size | 121-2 §3.3 |
1.4 样本量与统计功效
| 参数 | 修正前(121-1) | 修正后(122-2) | 修正来源 |
|---|---|---|---|
| 样本量 | 20名 | ~50名(正式实验) | 121-2 §四 |
| 效应量假设 | Δr>0.3 | Cohen’s q≈0.35(基于Fisher z变换) | 121-2 §4.2 |
| 显著性水平 | p<0.01 | α=0.01(双侧配对t检验) | 121-1 §四 |
| 统计功效 | 未论证 | power=0.80 | 121-2 §4.3 |
| 预实验样本 | 无 | 10名(第一阶段) | 122-2 §二 |
1.5 判定阈值(不变)
| 条件 | 阈值 | 输出 |
|---|---|---|
| 因果证实(Win) | r_ctrl>0.5, Δr>0.3, p<0.01 | τ_causal = pass |
| 因果证伪(Lose) | r_ctrl<0.3 或 Δr<0.1 | τ_causal = fail |
| 灰色地带(Retry) | 0.1<Δr<0.3 | τ_causal = rollback |
二、预实验三阶段:时间线与退出条件
2.1 阶段P1:效应量估算(10名受试者)
目标:在最小样本下估算真实的效应量(Δr)和组内方差,验证121-2的统计假设是否成立。
执行内容:
- 招募10名健康受试者
- 每名受试者完成一晚PSG记录
- 训练对照组(标准RBM)和实验组(ε=10%稀疏同层连接RBM)
- 计算每名受试者的r_ctrl和r_exp
- 估算实际效应量(Δr_observed)和组内标准差(σ_within)
退出条件(τ判定):
| 条件 | τ判定 | 后续动作 |
|---|---|---|
| Δr_observed > 0.3 且 σ_within < 0.15 | pass | 进入P2,按~50名设计正式实验 |
| 0.1 < Δr_observed < 0.3 | rollback | 调整ε(10%→15%)或增加S_source特征维度,重新跑P1 |
| Δr_observed < 0.1 或 r_ctrl < 0.3 | fail | 终止实验链,回到119-2重新审查RBM映射假设 |
| MF迭代不收敛(>50%受试者) | fail | 终止实验链,回退到标准RBM,审查含U训练的技术路线 |
Λ预警:
- 受试者招募困难(>3个月未招满10名)→ Λ触发,考虑放宽纳入标准或增加研究中心
- PSG数据质量差(>20%信号丢失)→ Λ触发,审查预处理流程
2.2 阶段P2:参数校准(基于P1结果调整正式实验参数)
目标:根据P1的效应量估算,精确计算正式实验所需样本量,并锁定所有超参数。
执行内容:
- 用P1的Δr_observed和σ_within重新计算样本量(G*Power)
- 若Δr_observed > 0.3,按power=0.80, α=0.01计算n_formal
- 若n_formal > 50,评估成本可行性;若n_formal < 30,考虑提高power到0.90
- 锁定α扫描区间(基于P1中S_source的敏感性结果)
- 锁定稀疏边策略(三臂中哪一臂效应最显著)
退出条件(τ判定):
| 条件 | τ判定 | 后续动作 |
|---|---|---|
| n_formal ∈ [30, 60] 且 成本可接受 | pass | 进入P3,启动正式实验 |
| n_formal > 60 | rollback | 放宽α到0.05(探索性研究),重新计算;或申请额外funding |
| n_formal < 20(效应量极大) | pass | 进入P3,但需增加敏感性分析(效应量是否稳健) |
| P1中α敏感性分析显示结果对α高度敏感 | rollback | 重新理论化S_source构造,暂停实验链 |
2.3 阶段P3:正式实验(~50名受试者,锁定参数)
目标:在锁定参数下执行正式实验,验证"RBM解耦结构 → 序参量学习"的因果链。
执行内容:
- 招募n_formal名受试者(基于P2计算结果,目标~50名)
- 严格执行锁定参数:ε=10%(或P2校准值)、三臂设计、α扫描
- 对照组与实验组在同一数据集上训练,配对t检验
- 独立统计分析师盲法分析(blinded analysis)
退出条件(τ判定):
| 条件 | τ判定 | 结论 |
|---|---|---|
| r_ctrl>0.5, Δr>0.3, p<0.01 | pass | 因果链得到实证支撑,RBM是Ψ_A^(0)的合法映射工具 |
| r_ctrl<0.3 | fail | RBM映射假设不成立,回到119-2 |
| Δr<0.1 | fail | 解耦结构不是原因,相关性来自数据冗余 |
| 0.1<Δr<0.3 | rollback | 效应存在但不显著,需扩大样本或调整干预强度 |
| 三臂结果不一致(A不显著但C显著) | fail | 效应来自选边偏差而非解耦破坏,因果结论不成立 |
Λ预警:
- 正式实验中>10%受试者数据质量不达标 → Λ触发,审查数据采集流程
- 独立分析师发现统计异常(如p值分布不均匀) → Λ触发,审查分析代码
三、三阶段状态转换表
| 当前阶段 | τ判定 | 触发条件 | 下一动作 |
|---|---|---|---|
| P1(10名,效应量估算) | pass | Δr>0.3, σ<0.15 | 进入P2(参数校准) |
| P1 | rollback | 0.1<Δr<0.3 | 调整ε或特征维度,重新P1 |
| P1 | fail | Δr<0.1 或 r_ctrl<0.3 | 终止,回到119-2 |
| P1 | fail | MF不收敛>50%(连续3epoch残差<1%) | 终止,回退标准RBM |
| P2(参数校准) | pass | n∈[30,60],成本可接受 | 进入P3(正式实验) |
| P2 | pass | n<20(效应量极大) | 进入P3,增加敏感性分析 |
| P2 | rollback | n>60 | 放宽α或申请funding,重新P2 |
| P2 | rollback | α敏感性高度敏感 | 重新理论化S_source,暂停 |
| P3(~50名,正式实验) | pass | r>0.5, Δr>0.3, p<0.01 | 因果证实,进入扩展验证 |
| P3 | rollback | 0.1<Δr<0.3 | 扩大样本或调整干预,重新P3 |
| P3 | fail | r<0.3 或 Δr<0.1 | 映射假设证伪,回到119-2 |
| P3 | fail | 三臂结果不一致 | 效应来自选边偏差,因果不成立 |
关键规则:
- P1→P2:必须τ=pass才能晋级。rollback不允许跳级。
- P2→P3:必须τ=pass且参数锁定。不允许边跑边调。
- P3内部:τ=fail直接终止,不允许多次retry(避免p-hacking)。
- 任意阶段Λ > 1.0:触发独立审查,暂停当前阶段,排查系统性风险。
四、风险矩阵与熔断机制
| 风险类型 | 触发条件 | 熔断动作 | 回退路径 |
|---|---|---|---|
| 伦理风险 | IRB驳回或受试者投诉 | 立即暂停全部阶段 | 审查伦理方案,重新提交 |
| 招募风险 | >6个月未招满P1的10名 | Λ预警→τ=rollback | 放宽纳入标准或多中心合作 |
| 技术风险 | >50%受试者MF迭代不收敛(连续3个epoch残差下降率<1%) | τ=fail | 回退到标准RBM,审查含U训练的技术路线 |
| 统计风险 | P3中p值分布异常(如过多p≈0.05) | Λ预警→独立审查 | 审查分析代码,排除操作偏差 |
| 成本风险 | P2计算n_formal>80 | τ=rollback | 放宽α到0.05或申请额外funding |
五、方法论自洽性检验(O2-1至O2-12)
| 编号 | 检验项 | 结果 |
|---|---|---|
| O2-1 | ξ初始化域与输出域匹配 | 通过 |
| O2-2 | Ξ锚定条件"预实验启动"不随审计语义改变 | 通过 |
| O2-3 | 三阶段时间线有明确的物理/统计来源 | 通过 |
| O2-4 | 本文无新公式,不涉及量纲 | 通过 |
| O2-5 | Σ分量与标准σ_d/δ_m/η语义映射明确 | 通过 |
| O2-6 | Λ预警阈值可定义 | 通过 |
| O2-7 | τ输出域{pass,rollback,fail}不变 | 通过 |
| O2-8 | Φ门控不涉及新分层 | 通过 |
| O2-9 | 本文不新增算子 | 通过 |
| O2-10 | R状态机标准状态不被非标准状态污染 | 通过 |
| O2-11 | 负面清单N1-N9全通过 | 通过 |
| O2-12 | 预实验设计是否触及算子流边界 | 通过(三阶段退出条件明确,不承诺实验结果) |
六、六维监察出场状态
| 监察算子 | 出场状态 | 在本文中的角色 |
|---|---|---|
| MΣ(#29) | 已运行 | 监察三阶段τ判定的可靠性——P1的效应量估算是否稳健 |
| Con(#32) | 已运行 | 审查三阶段逻辑一致性——无循环依赖,退出条件无冲突 |
| ρ(#30) | 已运行 | 理论弹性——"三阶段"划分是否过度弹性?否(每阶段有硬退出条件) |
| δ(#31) | 已运行 | N=53(预实验启动令为第53个领域实例化),δ≈0.78 |
| λ(#33) | 已运行 | 同构转换强度——预实验三阶段与经典临床试验Phase I/II/III的映射保真度 |
| C²(#34) | 已运行 | 本文不新增算子,C²不触发;但审查了121-1/121-2修正参数的兼容性 |
诚实声明:六维监察全部运行。严格度自评:A-(三阶段设计有明确文献依据——临床试验分期模型,但预实验本身尚未执行,所有参数为理论推演)。
七、与系列闭环
| 天数 | 核心问题 | 核心输出 |
|---|---|---|
| 120-1 | 可验证性追踪 | 四层可验证性梯度 |
| 120-2 | 因果效力审计 | 因果升级判定:pass/fail/rollback |
| 121-1 | RBM干预实验怎么干 | 工程草案:结构干预、稀疏扰动、硬阈值 |
| 121-2 | 干预实验的前置条件审查 | 四坑填平:α扫描、三臂设计、~50名、收敛监控 |
| 122-2 | 预实验启动令 | 修正后参数总表、三阶段时间线、退出条件、风险矩阵 |
| 122 | 一张沙发上的全栈失稳 | 日常物理环境中的算子流实演 |
121天与122天的完整闭环:
121-1说:这是施工图。
121-2说:施工图上有四个缺口,审完了——α扫描、三臂设计、~50名、收敛监控。
122-2说:缺口补完了,参数钉死了,三阶段切好了,退出条件写进手册了。预实验,启动。
八、结论
第122天第二篇的三个核心产出:
修正后参数总表:121-1的四个原始参数经121-2审查后,全部修正并钉死——
S_source改α敏感性分析、稀疏边改三臂设计、样本量修正为~50名、含U训练加收敛监控+Gibbs回退。预实验三阶段:P1(10名,效应量估算)→ P2(参数校准)→ P3(~50名,正式实验)。每阶段有硬τ判定(pass/rollback/fail),不允许跳级,不允许边跑边调。
风险矩阵与熔断机制:伦理/招募/技术/统计/成本五类风险,每类有触发条件、熔断动作、回退路径。Λ>1.0触发独立审查,τ=fail直接终止。
算子流不说"图纸审完了就自动跑"。算子流说:“审完了,按三阶段走。第一阶段跑不通,不要进第二阶段。第二阶段参数调不准,不要进第三阶段。每一阶段有τ判定,每一阶段有退出条件。这不是保守,这是诚实。”
121-1画了图。121-2审了图。122-2按下了运行键——但按键之前,把’什么算赢、什么算输、什么算暂停’全部写进了作战手册。预实验不是正式实验的缩水版,预实验是正式实验的防火墙。
这就是第121天与第122天的意义:从"能不能验"到"怎么验"到"验之前补什么"到"按什么顺序验"——每一步都不跳过,每一步都留下审计痕迹。121天两篇画图纸、审图纸,122天第二篇签发启动令。图纸、审查、启动令——三张纸钉在一起,才是完整的工程闭环。
v1.1 | 天赐范式第122天(第二篇)| 2026-08-01
121-1说:这是施工图。
121-2说:审了四个坑,补完了。
122-2说:参数钉死,三阶段切好,退出条件写进手册。预实验,启动。
算子流不说"开工大吉"。算子流说:“按手册走,每一步有判定,每一步有退路。”
推荐阅读:
- 第121天第二篇《干预实验的前置条件审查》v1.1(待发布)
- 第121天第一篇《RBM干预实验怎么干》v1.1(待发布)
- 第120天第二篇《相关≠因果》v1.1(待发布)
- 第122天第一篇《一张沙发上的全栈失稳》v1.1(已发布)