术语表
榜单和报告里每个数字的严格定义。三个分数语言(中位分 / 排名分 / 通过率)含义不同、不可互换—— 详见 方法论。
中位分 · Median Score
90 天窗口内该站点全部有效公开检测分数的(加权)中位数。回答"这个站典型表现怎么样"。中位数天然抗单点污染——个别极端分数拉不动它。
排名分 · Rank Key
榜单唯一的排序依据:贝叶斯收缩后的 90% 置信下界 × critical 率 Wilson 上界惩罚。回答"这个分数有多少证据支撑"。检测次数越多、严重问题越少,排名分越接近中位分。
置信下界 · Lower Confidence Bound
按威尔逊/正态近似计算的分数区间下端(90% 置信)。样本越少区间越宽——这是"新站不会一夜登顶"的数学根源。
收缩 · Shrinkage
样本量不足时把观测分数向先验(中位数基准)收缩的统计技术。样本少 → 收缩强 → 排名分趋于保守。这是防止小样本刷榜的核心机制。
critical 率
结论为 high_risk(不可信)的检测占比。其 Wilson 97.5% 上界作为惩罚项进入排名分——一次 critical 就足以显著压低排名分。
三支柱
检测引擎的三个评分维度:A 安全与滥用控制(40%)、B 正确性与质量(35%)、C 性能与吞吐(20%),另有稳定性(5%)。各检查项归入支柱并加权。
官方样本
平台出资、用平台托管 Key 做的检测(isOfficial=true),在聚合中权重 3×。抽样审计即官方样本的公开来源,种子与结果全部公示。