上一篇把通过两批 intake 校验的 admission rule 发布成版本化稳定基线,并补上 change control、月度 drift threshold、rollback contract 和 rollout ring。
基线进入 ring_0 后,第一个月很容易出现两种极端:看到一项指标越线就改规则,或者因为整体通过率平稳便直接扩围。前者会让小样本噪声反复扰动基线,后者可能把已出现但尚未聚合成红灯的问题带入更复杂的业务范围。
首月复盘要回答的并非“指标有没有变”,而是变化来自哪里,原阈值是否真的能识别风险,以及当前证据是否足以开放 ring_1。
这一篇沿着首个月度健康窗口,整理样本成熟度、漂移归因、阈值校准和扩圈门禁的最小闭环。
1. 月度窗口先冻结观察边界
复盘前先固定基线版本、ring、准入批次和结果观察截止时间。窗口定义中途变化,指标就失去可比性。
1 2 3 4 5 6 7 8 9 10 11 12 13
| monthly_health_window: baseline_id: admission_rules_2026_q4_v1 rollout_ring: ring_0 intake_from: 2026-11-01 intake_to: 2026-11-30 outcome_observed_until: 2026-12-14 admitted_items: 46 reviewed_outcomes: 39 pending_outcomes: 7 previous_reference: validation_batches: - 2026_q4_intake_01 - 2026_q4_intake_02
|
intake_to 与 outcome_observed_until 应分开。11 月最后一周进入的项目,在月底往往还没有足够执行结果;把它们提前记为成功,会系统性压低误收率和容量保护缺口。
窗口关闭时仍未成熟的样本保留为 pending,并写清下一次回补日期。指标分母只使用达到判定条件的样本,同时报告覆盖率:本例为 39 / 46 = 84.8%。
2. 先检查数据健康,再评价规则健康
一项指标变化可能只是记录缺失。月度会议不应在数据合同尚未满足时讨论阈值升降。
1 2 3 4 5 6 7 8 9 10
| health_data_gate: decision_snapshot_coverage: 1.00 rule_revision_coverage: 1.00 outcome_maturity: 0.848 owner_capacity_record_coverage: 0.935 exception_reason_review_coverage: 1.00 minimum_gate: outcome_maturity: 0.80 owner_capacity_record_coverage: 0.90 result: pass_with_pending_followup
|
数据门禁至少检查:每次决定是否绑定 baseline_id 与 rule revision、结果是否达到观察期、owner capacity 是否有实际保护记录、例外原因是否经过人工复核。
如果关键字段覆盖率不足,正确动作是补齐记录并冻结扩圈。缺失数据不能归类为健康,也不能直接解释成规则漂移。
3. 用三类归因拆开同一个红灯
首月复盘把异常分成 sample_noise、rule_drift 和 execution_drift。三类问题会让同一个指标变红,但处置路径不同。
| 类型 |
识别证据 |
典型动作 |
sample_noise |
样本量小、个别极端项目主导变化、规则行为符合预期 |
保持基线,延长观察窗口 |
rule_drift |
相似样本开始被稳定误判,规则输入或阈值无法解释结果 |
发起 baseline change request |
execution_drift |
准入证据真实,进入执行期后容量、范围或依赖被改变 |
修复执行合同,不改准入规则 |
可以为每个越线信号建立归因记录:
1 2 3 4 5 6 7 8 9 10 11 12 13
| drift_case: signal: capacity_protection_gap current: 0.18 threshold: 0.20 delta_from_validation: 0.10 evidence: admission_capacity_verified: true capacity_borrowed_after_admission: true scope_reduction_triggered: false classification: execution_drift confidence: high action: enforce_capacity_borrow_scope_reduction baseline_change_required: false
|
这里的容量保护缺口虽未达到 0.20 绝对门槛,但相对验证期已经明显恶化。证据显示准入时容量真实存在,问题发生在进入 roadmap 之后,因此应修复容量借用后的 scope reduction,而不是继续提高 admission threshold。
4. 样本噪声要用影响集中度识别
小样本窗口里,一个项目就可能把比率推过阈值。仅以“样本少”为由忽略异常也不可靠,因为单个高影响误收本来就足以冻结扩围。
1 2 3 4 5 6 7 8 9 10 11 12 13
| noise_check: signal: false_reject_rate reviewed_rejections: 12 false_rejects: 2 rate: 0.167 threshold: 0.10 leave_one_out_range: min: 0.091 max: 0.167 repeated_rule_reason: false high_impact_case: false classification: sample_noise next_action: collect_next_10_reviewed_rejections
|
可以用简单的 leave-one-out 检查观察单个样本对结果的影响,不需要立刻引入复杂统计模型。移除任一边界案例后比率就回到阈值附近,并且误拒没有集中在同一规则上时,更适合延长观察,而不是马上改配置。
若出现一个高影响误收,影响集中度高恰恰是风险证据。此类信号仍按 rollback contract 进入快速复核,不能被“样本不足”抵消。
5. 规则漂移要能重复命中同一判断缺口
规则漂移通常表现为相似样本在当前业务结构下重复误判,而不是聚合比率单次波动。
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15
| rule_drift_diagnosis: rule: premise_freshness_window revision: 2 affected_items: 4 shared_pattern: source_evidence_valid: true refresh_latency_days: 5 current_maximum_age_days: 30 result: false_rejects: 3 correct_rejects: 1 classification: rule_drift proposed_change: type: conditional_grace_window next_version: admission_rules_2026_q4_v1_1_rc1
|
四个项目都携带可验证证据,只因刷新流程固定需要五天而被相同阈值挡住,说明规则与当前执行条件之间出现稳定缺口。
修改仍需走 change control。首月复盘只生成 candidate 和验证要求,不能在会议中直接覆盖 stable manifest。新版本通过历史回放与 canary 后,再决定是否替换当前基线。
6. 检查阈值是过敏、迟钝还是刚好可用
阈值校准需要同时回看“触发了什么”和“漏掉了什么”。只统计告警数量,会鼓励团队把阈值调高以获得安静的仪表盘。
| 状态 |
月度表现 |
校准动作 |
| 过敏 |
多次触发,但复核后主要是噪声,且没有高影响案例 |
增加最小样本数或连续窗口 |
| 迟钝 |
未触发,但已有高影响案例或持续恶化趋势 |
降低绝对门槛或增加 delta 门槛 |
| 可用 |
触发结果与人工复核一致,动作成本可接受 |
保持阈值 |
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25
| threshold_calibration: false_reject_rate: current: absolute: 0.10 minimum_reviewed_samples: 20 observed: alerts: 2 confirmed_rule_drift: 0 sample_noise: 2 decision: keep_absolute_raise_minimum_sample proposed: absolute: 0.10 minimum_reviewed_samples: 30
capacity_protection_gap: current: absolute: 0.20 observed: absolute_breached: false delta_from_validation: 0.10 confirmed_execution_drift: true decision: add_delta_threshold proposed: absolute: 0.20 delta_from_validation: 0.08
|
误拒率的绝对门槛保持不变,只提高最小样本数,减少首月小样本触发。容量保护缺口则补一条相对变化门槛,让尚未触达绝对红线的持续恶化更早进入复核。
7. 下一 ring 的门禁要同时看风险和修复状态
ring_0 没有发生回滚,不等于可以自动开放 ring_1。扩圈会引入新的团队、依赖与样本结构,入口条件应比“服务仍在运行”更严格。
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15
| next_ring_gate: baseline_id: admission_rules_2026_q4_v1 target_ring: ring_1 checks: data_gate_passed: true high_impact_false_admit: 0 confirmed_rule_drift_open: 1 execution_drift_open: 1 rollback_triggered: false threshold_calibration_approved: true decision: hold blockers: - premise_freshness_rule_candidate_not_validated - capacity_borrow_scope_reduction_not_enforced recheck_at: 2026-12-21
|
这里没有高影响误收,也没有触发回滚,但仍有一项规则漂移和一项执行漂移没有闭环。hold 只冻结下一 ring,不回退当前 ring;两者对应不同风险动作。
门禁通过后也不应一次接入全部团队。ring_1 可以先限制新准入数量和高风险项目占比,并继续保留相同的 baseline version 与月度指标口径。
8. 复盘决定要落到账本,而不是停在会议结论
每项信号最终应形成一个可追踪决定,包含归因、责任人、截止时间和对扩圈的影响。
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29
| monthly_health_decisions: window: 2026-11 baseline_id: admission_rules_2026_q4_v1 decisions: - id: mh_2026_11_01 signal: false_reject_rate classification: sample_noise action: extend_observation owner: governance_analyst due_at: 2026-12-21
- id: mh_2026_11_02 signal: premise_freshness_false_reject classification: rule_drift action: validate_v1_1_rc1 owner: admission_policy_owner due_at: 2026-12-18
- id: mh_2026_11_03 signal: capacity_protection_gap classification: execution_drift action: enforce_scope_reduction owner: roadmap_owner due_at: 2026-12-14
rollout: current_ring: ring_0 next_ring: ring_1 decision: hold
|
下一次评审先核对这些决定是否关闭,再读取新窗口指标。若没有 action ledger,团队会在每个月重新解释同一批异常,阈值也会随着参会者变化反复调整。
9. 一个可直接复用的首月健康复盘模板
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39
| stable_baseline_monthly_review: baseline: id: admission_rules_2026_q4_v1 ring: ring_0 window: 2026-11
data_health: admitted_items: 46 reviewed_outcomes: 39 pending_outcomes: 7 gate: pass_with_pending_followup
signals: high_impact_false_admit: 0 false_reject_rate: 0.167 exception_rate: 0.109 capacity_protection_gap: 0.18
diagnosis: sample_noise: - false_reject_rate_small_sample rule_drift: - premise_freshness_window execution_drift: - capacity_borrow_without_scope_reduction
threshold_changes: - raise_false_reject_minimum_sample_to_30 - add_capacity_gap_delta_threshold_0_08
actions: baseline: validate_v1_1_candidate execution: enforce_capacity_borrow_contract rollback: not_required
rollout_gate: target: ring_1 decision: hold recheck_at: 2026-12-21
|
模板中的每个异常都要能回到项目样本、准入快照和执行记录。聚合指标负责发现问题,样本证据负责决定改规则、改执行合同,还是继续观察。
小结
稳定基线的第一个月,重点不在于追求全部指标为绿,而在于验证监控和决策机制是否真的能工作。
月度窗口先冻结观察边界,并用数据门禁排除记录缺失。异常进入复盘后,按样本噪声、规则漂移和执行漂移分别处理:噪声延长观察,规则漂移进入受控候选版本,执行漂移回到 roadmap 与容量合同。阈值校准同时检查误报和漏报,避免靠抬高门槛换取安静。
下一 rollout ring 只有在高影响风险可接受、漂移动作已闭环、阈值经过复核后才开放。若条件不足,冻结扩圈即可,不必把 hold 误解为当前基线失败。下一步可以在 ring_1 的首批新团队中验证 overlay 边界、跨团队样本差异与阈值可迁移性,避免稳定基线进入更复杂环境后再次分叉。
本文永久链接: https://www.mulianju.com/learning-notes/ai-learning-notes-llm-governance-first-month-baseline-health-review-drift-threshold-rollout-ring-gate/