阈值含义

所有阈值实时渲染自检测引擎 /api/checks——本页不做任何硬编码,引擎调参后本页自动跟随。

token 计量偏差

实际消耗与声称计量的相对偏差:normal 以内视为正常浮动,超过 suspicious 判可疑(虚标计费的核心证据)。

token_deviation_normal0.03
token_deviation_suspicious0.05

价格溢价

实际价格相对官方目录的溢价倍数:超过 normal 值进入观察,超过 watch 判可疑(贵不是错,虚标才是——溢价本身只作参考信号)。

price_premium_normal1.1
price_premium_watch1.3

模型指纹

输出分布与声称模型的指纹距离:小于 match 视为同源证据,超过 mismatch 视为异源替换证据;两者之间需最小差距(min_margin)避免噪声定罪。

fingerprint_match0.02
fingerprint_mismatch0.05
fingerprint_min_margin0.02

输出一致性

同题重复采样的自一致率与输出变异系数:低于 watch 观察、低于 fail 判定(偷工减料的典型表现)。

consistency_watch0.85
consistency_fail0.6
consistency_output_cv_watch0.15
consistency_output_cv_alert0.4

长上下文召回

埋点检索的召回率:低于 watch 观察、低于 fail 判定(上下文裁剪/压缩的证据)。

context_recall_watch0.85
context_recall_fail0.6

双峰检测

行为分布双峰系数阈值:超过该值说明存在"检测账号/普通账号"分流的强信号。

bimodality_threshold0.555

能力衰减

静态/动态能力相对官方基线的下降幅度:超过 watch 观察、超过 fail 判定(降智/缓存老答案的证据)。

capability_drop_watch0.08
capability_drop_fail0.18

官方基线偏差

与平台官方基线样本的偏差幅度:watch 观察、fail 判定。

official_baseline_delta_watch0.15
official_baseline_delta_fail0.3

其他阈值

p_value0.05
min_sample_size100
cross_endpoint_ratio_spread0.05
cross_endpoint_accuracy_spread0.15
cross_endpoint_min_peers2

阈值之上的评分模型见 评分模型;误判可能见 局限与误判。